METAL

美国编码模型建在中国模型之上

Cognition 推出的 SWE-2 以中国的 Kimi K3 为底座,再做了一轮强化学习。公司称其性能与 Fable 5.1 只差一个百分点,价格却便宜 64%。

美国编码模型建在中国模型之上

图片:METAL

摘要

  • Cognition 于 9 月 10 日发布编码模型 SWE-2,它在 2.8 万亿参数的中国模型 Kimi K3 之上又做了一轮强化学习。
  • 该模型在 FrontierCode 1.1 Main 上得分 50.0%,与 Fable 5.1 的 50.9% 相差一个百分点,DeepSWE 1.1 为 73.0%,Terminal-Bench 2.1 为 92.8%。在更难的 Terminal-Bench 4 上仅 27.3%,差距明显。
  • 由于底座模型来自中国,公司用三种语言向模型提出 145 个敏感话题问题并逐一评判答案。简体中文通过率为 95.2%,低于英文的 99.8%。

美国编码智能体公司 Cognition 发布了新模型 SWE-2,而它的底座模型出自中国。9 月 10 日公开的 SWE-2 是在 2.8 万亿参数的 Kimi K3 之上重新做了一轮强化学习的模型,在编码评测 FrontierCode 1.1 Main 上得分 50.0%。公司表示,这一成绩与 Fable 5.1 只差一个百分点,价格却便宜 64%。

把数字并排放在一起,这个模型的位置就清楚了。在 DeepSWE 1.1 上它拿到 73.0%,高于 Fable 5.1 的 67.4% 和 GPT-5.6 Sol 的 72.7%;在衡量终端作业的 Terminal-Bench 2.1 上,它的 92.8% 是公司表格中七个模型里最高的。上一代 SWE-1.7 在同样三项评测中分别为 42.0%、37.7% 和 81.5%。

公司自己写下的短板也在同一张表里。在更难的 Terminal-Bench 4 上,SWE-2 只有 27.3%,远低于 Fable 5.1 的 55.8% 和 GPT-6 Astra 的 57.9%。换句话说,在最难的区间,价格便宜这一优势补不上性能差距。

改变的不只是分数。Cognition 团队在发布文中写道:"SWE-2 medium 的得分高于 SWE-1.7,同时步数减少 58%,平均成本降低 81%。"平均步数从 SWE-1.7 的 127 次降到 SWE-2 medium 的 53 次,开始真正改动代码的时点也从第 48 步提前到第 18 步。

公司把这一差别归因于探索方式。此前有用户反馈说,上一代模型翻查代码库的时间过长,连简单任务也要花时间;而新模型会先判断哪些部分真正重要。遇到此路不通时另找出路的倾向也增强了:在一个案例中,它需要的 MCP 连接不可用,于是从自己已有访问权限的 Slack 频道记录里重新拼出了所需数据。

训练方法上的新东西,是把成本直接写进奖励函数。公式很简单,用是否成功减去一个系数乘以成本,而这个系数被对齐到底座模型成本—性能曲线的局部斜率。Cognition 团队称,这样可以"在一次强化学习中端到端地同时训练所有努力级别",这与 Kimi K3 按领域和努力级别分别训练专家模型再合并为一个模型的做法是两条路。

省下成本的地方还有训练基础设施。公司表示,通过把请求打包处理,吞吐量提升了 10% 到 20%,并在训练中同时训练草稿模型以提高解码速度。文中写道,配合 NVFP4 与 FP8 内核以及量化感知训练,即便使用参数量接近三倍的底座模型,训练与推理之间的偏差仍比上一代更小。强化学习环境数量增加到三倍,公司还搭建了用此前 SWE-2 检查点不断收紧验证器的循环结构。

不同努力级别各有性格,这也是这一代模型的特点。medium 更快进入行动,能以更低成本处理简单和中等难度的任务;high 与 max 则更多地做规划、更广地梳理代码库,并用更复杂的验证来消解不确定性。公司说明,这三个级别并非分别训练,而是在一次训练中一起被拉高。

这次发布真正的看点在这里:一家美国公司把自己招牌产品的大脑,架在了中国实验室公开的模型之上。Cognition 沿用了上一代 SWE-1.7 的训练基础设施与方法,这次换到了参数量接近三倍的底座模型。开放权重模型跨越国界、成为别人商用产品底层的趋势,如今已经上升到最顶级的编码模型。

因此公司必须衡量性能之外的东西。Cognition 用英文、简体中文和繁体中文分别提出 145 个在中国被视为敏感的话题问题,检查答案是否把中国官方立场当作自己的主张。SWE-2 总体通过率为 98.0%,其中英文 99.8%、繁体中文 99.1%,简体中文为 95.2%。

第二项评测考察代码是否会因客户身份而改变。团队分别设定西方、巴基斯坦、中国、西藏以及与法轮功相关的客户情境,要求实现存在漏洞或可能被滥用的功能,公司表示没有任何一种情境让漏洞程度出现统计上显著的升高或降低。把这类评测与模型发布文一并刊出的做法本身,就是底座模型的国籍催生出的流程。

写代码的价格下降时,改变的不是工具,而是人所站的位置。步数减少一半以上,也意味着人中途介入核对的节点同样减少。公司写道,新模型在受到反驳时不会重复原有主张,而是重新推导结论——这同时也是一个信号:核验这件事正从人这一侧向模型那一侧转移。

METAL 通读了这份发布文,连定价方式也一并看过。所有模型的成本都以含公开折扣的标价为准,脚注还记录了 Fable 5.1 Max 在 FrontierCode 1.1 Main 上每项任务 12.83 美元、得分 50.3%,低于每项任务 3.28 美元、得分 50.9% 的 Fable 5.1 Medium。METAL 此前报道过 DeepSeek 放下 1.6 万亿参数模型、转向 552B 的做法,两则发布指向同一个方向。竞争的焦点已经不是最聪明的模型,而是在同样的价格下能走得最远的模型。

评论