METAL

标签

벤치마크

AI

腾讯混元公开EvolveScaler论文

腾讯混元团队9月15日公开了信息演化数据框架EvolveScaler的论文和项目页面。用先以代码定义状态、再渲染成自然语言的数据测试14个模型,在最长难度层级上avg@5中位数跌至11.3。

作者 김현국

00

AI

Specific 公开企业代码基准 Real-SWE

Specific 在 9 月 12 日公开了 Real-SWE,用从真实公司获得授权的私有生产代码库来测评 AI 编码模型。排名第一的 Fable 5.1 解决率也只有 38.8%,十道题中有一道让八种组合尝试 64 次全部失败。

作者 김현국

30

AI

Sakana AI发布两款替你挑模型的模型

Fugu Max把每项任务交给能解决它的最轻量模型,输出价格比同类低40%到60%。Fugu Ultra v2则在模型池里没有Fable 5.1和GPT-6 Astra的情况下拿到最高分。

作者 김현국

20

AI

AI设计蛋白质,预测与实验结果出现分歧

Claude设计的1320个结合蛋白中,354个成功结合,15个靶点中命中14个。在人类竞赛命中率仅3.7%的靶点上,这次跑出了40%,但在合成之前挑出真正能结合的分子,依然是难题。

作者 김현국

170