Walden Yan 出镜讲述 Devin 用 GPT-6 Astra 做测试的视频
OpenAI 开发者账号 9 月 15 日发布了 Cognition 联合创始人 Walden Yan 的一分钟视频。在 Devin 里,GPT-6 Astra 用测试来证明代码确实能跑,从而减少人需要亲自审阅的代码量。
标签
OpenAI 开发者账号 9 月 15 日发布了 Cognition 联合创始人 Walden Yan 的一分钟视频。在 Devin 里,GPT-6 Astra 用测试来证明代码确实能跑,从而减少人需要亲自审阅的代码量。
腾讯混元团队9月15日公开了信息演化数据框架EvolveScaler的论文和项目页面。用先以代码定义状态、再渲染成自然语言的数据测试14个模型,在最长难度层级上avg@5中位数跌至11.3。
Specific 在 9 月 12 日公开了 Real-SWE,用从真实公司获得授权的私有生产代码库来测评 AI 编码模型。排名第一的 Fable 5.1 解决率也只有 38.8%,十道题中有一道让八种组合尝试 64 次全部失败。
Fugu Max把每项任务交给能解决它的最轻量模型,输出价格比同类低40%到60%。Fugu Ultra v2则在模型池里没有Fable 5.1和GPT-6 Astra的情况下拿到最高分。
Claude设计的1320个结合蛋白中,354个成功结合,15个靶点中命中14个。在人类竞赛命中率仅3.7%的靶点上,这次跑出了40%,但在合成之前挑出真正能结合的分子,依然是难题。