
图片:@OpenAIDevs (X)(视频截图)
摘要
- Walden Yan 表示,问题已经不是写代码的速度,而是如何在上线前审阅这些代码并建立信心。
- 在 Cognition 的基准 FrontierCode 1.1 上,GPT-6 Astra 与 Fable 5 只差 0.4 分,成本低 64%,并超过了 Fable 5.1。
- Astra 可以直接在 Devin Desktop 和 CLI 中使用,在 Devin Cloud 中则是模型混合的一部分。
OpenAI 开发者账号 9 月 15 日在 X 上公开了一段一分钟的视频。打造自主软件工程师 Devin 的公司 Cognition 的联合创始人 Walden Yan,在视频里亲口讲述自己如何在 Devin 里使用 GPT-6 Astra。帖子写道,Astra 帮助 Devin 在团队上线之前,用测试为"它能跑"这句话提供依据。视频发布一天内浏览量超过 5.7 万次,获得 580 个赞。
在 METAL 查看的视频中,Yan 自我介绍为 Cognition 联合创始人,并表示公司正在打造软件工程的未来。他解释说,主力产品 Devin 是一名 AI 软件工程师,公司与全球最大的一批企业合作,从大型银行到技术原生的初创公司都有。最近团队一直在 Devin 里试用 Astra,并用它改进整个产品线,范围不仅包括核心的云端代理 Devin,也包括 CLI 和桌面产品。
视频的核心在于如何定义问题。Yan 说:"我们和其他工程团队现在写的代码太多了,真正的问题变成了怎么审阅所有这些代码,怎么在上线前对它建立信心。" 他的判断是,瓶颈不在写代码的速度,而在读代码的速度。他给出的答案是 Astra 的测试能力,并补充道:"Astra 明显进步的一点,是它能够测试并证明自己的工作确实按你期望的方式运行。"
OpenAI 网站上的客户案例页面用文字讲了同一个故事。根据这份标注 9 月 11 日的页面,Devin 用 Astra 测试一款名为 Otter Run 的 iPhone 游戏,返回游戏在模拟器中运行的录像,并附上一份列出已通过检查项和未测试区域的报告。页面还描述了一个往返流程:客户发来一张 bug 截图,团队把它交给使用 Astra 的 Devin,Devin 修复问题后再回传一张结果截图。Yan 表示,这让团队能更快地回复客户。METAL 在该页面上线次日就报道过其内容,这一次,创始人亲自出镜讲述。
数字在 Cognition 自己的发布里。9 月 3 日,Cognition 在 X 上宣布 GPT-6 Astra 将进入 Devin,并表示在其基准 FrontierCode 1.1 上,Astra 与 Fable 5 只差 0.4 分,而成本低 64%。这条帖子浏览量超过 85.1 万次。公司博客又补了一句:FrontierCode 1.1 是 Cognition 自有的基准,按质量和可合并性给真实工程任务打分,在这个基准上 GPT-6 Astra 超过了 Fable 5.1,仅次于 Fable 5。公司表示,在驱动 Devin 的测试功能时,Astra 在内部测试基准上取得了最佳成绩,生成的测试更全面,报告更清晰,视频证据也更易于查看。
部署方式也写在发布里。GPT-6 Astra 现在可以直接在 Devin Desktop 和 Devin CLI 中使用,在 Devin Cloud 中则是混合多个模型的模型混合的一部分。这不是一家公司选一个模型,而是按任务分配不同模型的结构。METAL 曾报道 Cognition 把 Fable 5.1 引入 Devin,将编码任务成本降低了 54%。两周之后,另一家公司的模型作为测试担当进入了同一个产品。
从工程管理者的角度看,这段视频讲的是审阅成本的账。代理写的代码越多,人要读的代码也越多,团队的吞吐量最终被审阅速度捆住。Cognition 选择的方向不是取消审阅,而是改变审阅的对象:不再逐行读代码,而是看录像和报告,只深入报告里列出的未测试区域。Yan 这样展望:"我们预计随着时间推移,我们需要人工查看的代码会越来越少,最终一天结束时能上线更多东西。" 他在视频结尾说,这是他对 GPT-6 最期待的事情之一。
这段视频是 OpenAI 为 GPT-6 Astra 陆续推出的短视频客户案例之一。METAL 报道过早一天、也就是 9 月 14 日发布的 Perplexity 联合创始人 Johnny Ho 的 68 秒视频。两段视频借不同公司之口说的是同一句话:模型不止于写代码,还会搭建检验代码正确与否的装置,而人则更少地查看结果。OpenAI 正在用客户的面孔和声音而不是基准表格来推销模型,Cognition 则在这种方式上加上了自己的基准数字。





评论