
图片:METAL
摘要
- Specific 用从真实公司获得授权的私有生产代码库,测评了八种模型与工具链组合。
- Fable 5.1 以 38.8% 居首,GPT-5.6 Sol 以 16.2% 垫底,十道题中有六道解决率低于 15%。
- 最常见的失败是漏掉指令要求的行为,而多花时间和多花钱都没能带来更好的成绩。
把 AI 编码智能体放到真实公司的私有代码库上跑,最好的组合也没能拿下十道题中的四道。Specific 于 9 月 12 日公开名为 Real-SWE 的基准,公布了用从真实企业获得授权的私有生产代码库测评前沿模型的结果。排名第一的是在 Claude Code 中运行的 Fable 5.1,解决率 38.8%,而八种组合中没有一种解出全部题目。
Real-SWE 与既有基准的分水岭在于题目的来源。研究团队说明,每一道题都取自真实公司的私有生产代码库,是这些公司的工程师实际承担过的工作。把发票上的税算对、把客户账号迁到另一套体系、对用量计费,这些活儿一旦出错,生意会立刻动摇。据 Specific 介绍,代码库选自这样一些公司:用户超过 20 万、曾进入 App Store 前 100 名的活动服务,以及处理超过 10 万份银行流水的消费级金融科技平台。
测评设计也没有把模型单独拿出来衡量。为了反映企业工程师的真实工作方式,团队把模型与工具链绑在一起打分:Fable 5.1 和 GLM 5.3 在 Claude Code,GPT-6 Astra 和 GPT-5.6 Sol 在 Codex CLI,Gemini 3.8 Flash 在 Gemini CLI,Grok 4.6 在 Grok Build,Muse Spark 1.3 在 Muse Code,Kimi K3 在 Kimi Code。十道题每个模型各跑八次,合计 640 次 rollout,解决率是八次取平均的 pass@1。智能体在隔离沙箱中运行,校验程序在评分时注入,直接沿用代码库中原有的测试或由其改写而来。
排名依次为 Fable 5.1 38.8%、GPT-6 Astra 33.8%、Gemini 3.8 Flash 31.2%、GLM 5.3 28.8%,其后是并列第五的 Grok 4.6 与 Muse Spark 1.3 均为 23.8%,Kimi K3 18.8%,GPT-5.6 Sol 16.2%。十道题中有六道解决率低于 15%。分析流 reducer 那道题,八种组合各试八次共 64 次,一次都没通过;税务辖区那道题只有 3.1%,可线性化扫描为 4.7%。相对好解的是多区域巡检 67.2%、API 密钥与环境配置 65.6%。
比分数更值得看的是出错的方式。按失败类型拆开,最多的是漏掉指令所要求的行为。Grok 4.6 在 61 次失败中有 41 次属于此类,占 67.2%;Kimi K3 是 65 次中的 35 次,占 53.8%。GPT-5.6 Sol 的失败里有 43.3% 是没在工作区核对、直接把代码堆在对系统的猜测之上;Gemini 3.8 Flash 有 49.1% 属于方向正确却与周边系统接错的集成错误。破坏既有行为的回归在多数组合中低于 10%,而把改动写进运行中应用根本不会调用的文件,在 GLM 5.3 上最高,为 7.0%。
多花时间也没有变好。十分钟内结束的 rollout,98 次中有 70 次失败,占 71.4%;耗时十分钟以上的 rollout,542 次中有 398 次失败,占 73.4%。在题上耗得久,并不等于离答案更近。花钱同样买不到成绩。单次 rollout 的估算成本在 2.50 美元到 6.96 美元之间:最贵的 Fable 5.1 以 6.96 美元排在第一,但最便宜的 Gemini 3.8 Flash 用 2.50 美元拿到 31.2%,而 2.65 美元的 GPT-5.6 Sol 垫底。
报告也写明了团队为何要专门去借别人公司的代码。私有代码库上的任务天然处于分布之外,任何模型都不太可能在训练时见过。报告写道:"真实企业中 99% 的 token 对前沿模型是隐藏的。"指令也并不友好。Real-SWE 指令的中位数为 1,742 个字符,参考解法改动的文件中位数是 11 个,而作为对照的 FrontierCode 与 DeepSWE 是 6 个。智能体拿到的是简短说明,实现细节得自己找出来。团队还主动写下指令偏欠具体这一点。报告称,任务提示"略欠具体,与 DeepSWE 和 Terminal Bench 大致相当,但具体到不至于遗漏指令"。出借代码库的公司名称没有公开,要查看分析所用的样本任务需要另行申请权限。
把其中一道税务题摊开,难度就看得见了。在一个各商家税务处理各不相同的计费服务里,有的自行维护税率,有的要求按买家地址通过外部税务服务重新定价,有的干脆不收;而登记为免税的客户,无论商家如何配置都不能被计税。要按账户状态区分税务服务的沙箱与生产环境,地址被拒时不能中断计费而要如实上报,结算完成的交易还要用该发票号重新申报,好让报表对得上。环境是用 TypeScript 写的 NestJS 服务,接着税务服务的沙箱与生产端点以及一套时序账本;换成人类工程师会转头问一句同事的事,智能体只能靠代码和工具自己推断。
把这份成绩单放到近期编码模型的消息旁边,含义就清楚了。METAL 曾报道过 Cognition 在自家基准上画出美国模型与中国模型的性价比边界,也报道过 Devin 借助 GPT-6 Astra 获得了检验并证明自身工作的能力。公开基准的分数快速攀升的同时,一旦把带着钱的活儿放进别人公司内部,同样的模型交出的成绩单会完全不同。
在 METAL 通读的这份报告里,团队写道公司层面的工程范式很重要,并称"如今的模型在理解公司的编码范式上更弱,经常漏掉需求或不去验证自己的假设"。对于 AI 写出的代码是否达到真实企业标准这一问题,团队给出的回答是离那个现实还很远。把编码智能体引入公司时卡住的瓶颈,不是模型的智力,而是公司多年积累下来的上下文,而这份上下文不会随着基准分数上升而自动变薄。让它变薄的办法,只有公司先把自己的规则和验证写成智能体能读的形式。





评论