
摘要
- Cognition在其编码智能体Devin中搭载了Anthropic的Fable 5.1,缓存方式的调整让单任务成本较Fable 5降低54%,甚至比Claude Opus还便宜。
- Devin自研的执行系统Fusion harness在FrontierCode 1.1 Extended基准测试中取得了与Fable 5.1相近的分数(63.2对63.6),但单任务成本仅为1.43美元,比Fable 5.1便宜47%。
- 这次发布正值OpenAI和Anthropic为应对中国AI模型的追赶而相继下调价格之际。
编码智能体Devin,换上了新大脑
Cognition于当地时间9月1日通过X账号宣布,已在旗下编码智能体Devin中搭载Anthropic的新模型Fable 5.1。公司表示,由于调整了缓存方式,使用Fable级智能所需的成本较此前降低了54%,结果甚至比使用Claude Opus还要便宜。根据公司公布的FrontierCode 1.1 Extended基准测试表格,Fable 5在中等难度任务上得分62.8,每个任务耗费5.84美元;而Fable 5.1得分63.6,费用降至2.68美元。
简单来说,Fable是Anthropic旗下Claude系列模型的名称,而Cognition正是使用这一模型来运营Devin——一个代替人工完成编码任务的智能体服务。Devin是一款能够自主规划任务、编写代码并执行的软件工程智能体,这次的发布意味着,其内部实际做出判断的模型被换成了最新版本,同时成本也随之下降。
Fable 5.1是什么——价格战的延续
今年8月,Anthropic曾以旗舰模型Fable 5一半的价格推出Claude Opus 5。当时Fable 5的价格为每百万输入token 10美元、每百万输出token 50美元,Opus 5的定价仅为其一半;而这次Fable 5.1再度降价,进一步缩小了两款模型之间的价差。同一时期,OpenAI也将GPT-5.6 Luna的输入和输出价格分别下调了80%,据悉SiliconData统计的token价格指数自7月中旬以来已下跌约25%。越来越多企业转向Moonshot、DeepSeek等中国模型,被认为是这轮降价潮的背景之一。
自研执行框架反超外部模型
Cognition此次同时公布的,还有Devin的执行系统"Fusion harness"。所谓harness,是指调度模型调用工具、执行代码顺序的运行框架;在同一项FrontierCode 1.1 Extended基准测试中,Fusion harness取得了63.2分,单任务成本为1.43美元。这一分数几乎与Fable 5.1的63.6分持平,但成本却低了47%。
| 系统 | 基准测试分数 | 单任务成本 | 备注 |
|---|---|---|---|
| Fable 5 | 62.8 | 5.84美元 | 上一版本 |
| Fable 5.1 | 63.6 | 2.68美元 | 较Fable 5降低54% |
| Devin Fusion harness | 63.2 | 1.43美元 | 较Fable 5.1降低47% |
把这三组数字放在一起看,就能发现Cognition是同时从两个方向压低成本的:一是Anthropic通过改造模型自身的缓存结构带来的降价,二是Cognition优化模型运行方式所带来的额外降价。

价格战的延续
这次发布延续了OpenAI和Anthropic此前专注于降低智能体运营成本的趋势,此前已有将文档处理成本削减至十八分之一的案例。编码智能体每接到一次任务,往往要调用模型数十甚至上百次,因此单任务成本哪怕只降低一点,对整体运营开支的影响也会被放大。Cognition用自研执行框架以更低价格实现接近外部模型的性能,归根结底也是为了压缩这种重复调用带来的成本。
编辑视角
这次发布中值得留意的地方,与其说是降价本身,不如说是Cognition特意把自研执行框架的表现拿来和Fable 5.1做对比这件事。对于像Devin这样依赖外部模型的智能体公司而言,收益结构难免会随着模型提供商的定价政策而不断波动。正因如此,这类公司一直把投资重点放在如何减少模型调用次数、如何优化缓存这类执行框架技术上,而不是模型本身;这次公布的数据也证明,这样的投入确实能够改变成本曲线。
对那些已经把编码智能体用于实际工作的团队来说,这种模式并不陌生。通常的路径是先接入最新模型验证性能,再通过打磨缓存和工具调用顺序,以更低成本得到同样的结果,这个循环一直在重复出现。国内如果有开发团队正在使用Devin或类似的编码智能体,与其每次看到模型更换公告就只盯着价目表,不如先检视一下自己工作流中重复调用的频率有多高——这样做才更可能带来实质性的成本节省。
预计未来几周内,其他编码智能体厂商也可能会陆续公布类似的自研执行系统成本效率数据,并附上相应的基准测试结果。





评论