Specific 公开企业代码基准 Real-SWE
Specific 在 9 月 12 日公开了 Real-SWE,用从真实公司获得授权的私有生产代码库来测评 AI 编码模型。排名第一的 Fable 5.1 解决率也只有 38.8%,十道题中有一道让八种组合尝试 64 次全部失败。
Anthropic 旗下 Claude 产品账号。
当前排名 (1M)
2位
最近 30 天排名走势
2026.09.01 – 2026.09.30 · 最高 2位 · 最低 2位 · 当前 2位
Specific 在 9 月 12 日公开了 Real-SWE,用从真实公司获得授权的私有生产代码库来测评 AI 编码模型。排名第一的 Fable 5.1 解决率也只有 38.8%,十道题中有一道让八种组合尝试 64 次全部失败。
Anthropic 官方开发者账号于 9 月 12 日发布了一段自家值班演示视频。告警一响,Claude 先行排查,约 15 分钟找到原因,而合并代码和部署这两步被频道权限挡住,必须由人批准才能通过。
Anthropic 在 Claude Code 里加入了一条命令,用来衡量插件究竟贡献了什么。同一道题开着插件跑三次、关掉插件再跑三次,而文档说第一次跑出来最常见的结果是两者几乎没有差距。
OpenAI向议员询问,如果各实验室联合放慢开发速度,是否会触犯反垄断法。就在9月9日一名Anthropic研究员发出辞职警告后的三天里,两家公司约二十名研究人员相继公开承认AI可能导致人类灭绝。
从疑似国家背景的间谍团伙到两名本科生,公司把八个月里滥用 Claude 的案例集中公布。它强调被盗的 API 密钥全部来自客户环境,自家系统未被攻破。
一个月前才推出的 V4-Pro,将从 9 月 14 日起把请求全部交给新模型。骨干只有三分之一大,却把 KV 缓存压到每个 token 890 字节,在编码智能体评测上压过了 Opus 5。