工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

OpenRouter,AI智能体Token消耗量激增14倍,超过人类

2026年2月以来,AI智能体的Token使用量增长了14倍,而人类的增幅只有2.8倍

터널처럼 휘어진 화려한 색상의 디지털 데이터 흐름 추상화

이미지: METAL LAB 생성

摘要

  • 在OpenRouter平台上,AI智能体的Token消耗量自2026年2月6日以来增长了14倍,远超人类2.8倍的增幅。
  • 智能体消耗的Token中约有70%来自成本较低的缓存提示,因此实际成本增幅要比用量增幅平缓得多。
  • OpenRouter上开放权重模型占比较高,Token使用效率相对偏低,但随着推理模型的普及,类似趋势也可能在主流实验室中出现。
분기점
2026년 2월 6일, 사람이 에이전트보다 토큰을 더 많이 쓴 마지막 날로 추정
에이전트 토큰 증가
14배 (0.51조 → 7.3조 토큰)
사람 토큰 증가
같은 기간 2.8배
캐시 프롬프트 비중
에이전트 토큰 소비의 약 70%
데이터 출처
오픈라우터 애널리스트 피터 워커
오픈라우터 모델 특성
오픈웨이트 모델 비중이 높아 토큰 효율이 상대적으로 낮음

OpenRouter上,Token消耗主体已经易主

在中转多种AI模型API请求的平台OpenRouter上,出现了一项引人注目的数据。据OpenRouter分析师Peter Walker统计,2026年2月6日很可能是人类Token消耗量最后一次超过AI智能体的日子。从那天起,智能体一方的消耗量就一直领先于人类。

AI智能体不同于那种一问一答、就此结束的聊天机器人。它会自主搜索、生成文件、推进到下一个任务,长时间独立作业,并在这个过程中不断调用其他AI进程。任务被拆分成的步骤越多,Token消耗量的增长速度也就和人类对话完全不在一个量级上。

이미지: The Decoder

14倍与2.8倍,差距是如何拉开的

从2026年2月6日至今,智能体与人类的Token消耗增幅已经拉开了五倍以上的差距。

类别Token消耗增幅(2026年2月6日以来)
AI智能体14倍(0.51万亿→7.3万亿Token)
人类2.8倍

值得注意的是,同一时期人类的Token消耗量并没有减少,反而也在增长。但由于智能体一方的增速实在太快,如今在OpenRouter上流转的Token,绝大多数已经不是人类发出的请求,而是AI向AI发出的请求。

缓存提示压低了成本涨幅

智能体Token消耗量涨了14倍,并不意味着成本也会跟着涨14倍。因为在智能体消耗的全部Token中,约有70%来自缓存提示。缓存提示是指不必重新计算此前已经处理过的内容,而是直接复用保存下来的结果,因此其计费单价要远低于新计算的Token。原文指出,正因如此,实际成本的增长幅度要比用量的增长幅度平缓得多。

OpenAI、Anthropic会不会也是这样

OpenRouter是一个开放权重模型占比相对较高的平台。原文指出,开放权重模型在处理同样任务时,往往比OpenAIAnthropic的模型消耗更多Token。不过,Token消耗量整体走高的趋势,很可能也会在主流实验室中以类似的方式出现。事实上,这一趋势早在推理模型出现时就已经开始——推理模型会在给出答案之前进行一段自主思考的过程,而对于那些原本不需要深思的问题,它也会长时间思考,从而消耗超出必要的Token。

编辑视角

从某种角度看,智能体消耗的Token超过人类,是一件很自然的事。聊天机器人只是一问一答就结束了,而智能体要完成一项任务,得反复经历制定计划、调用工具、核查结果的过程。每一次反复,都会累积成Token消耗。问题在于,这一趋势已经在基准测试中得到了印证。最近NVIDIAClaude Opus 5套上自研的执行框架(harness),把ARC-AGI-3的得分从30%拉高到100%,也是同一逻辑的体现——决定性能高低的,与其说是模型本身,不如说是包裹在模型外层的执行框架能坚持多久、走多少步。如果Token用得越多、分数就越高,那么智能体的Token消耗恐怕不会减少,只会继续攀升。

从实际操作层面看,这项数据值得国内企业在制定智能体引入预算时参考。如果单纯按Token数量估算API费用,很容易忽略缓存带来的折扣,从而把预算算得比实际所需更高。反过来说,如果某项任务每次都要输入不同的上下文、难以命中缓存,那么成本就会按Token原价支出,因此在早期试点阶段,最好单独核实一下缓存命中率。

给出一个简短的预判:下个季度的OpenRouter报告中,智能体Token占比很可能会大幅超过人类的十倍以上。到那时,"Token消耗者"这个说法,恐怕会先让人联想到AI,而不是人类。

评论