METAL

Devin 开始自己证明自己的工作

OpenAI 于 9 月 11 日公开了 Cognition 的案例。自主软件工程师 Devin 用 GPT-6 Astra 直接测试自己写的代码,并把模拟器录屏和测试报告一并作为证据交出来。

Devin 开始自己证明自己的工作

图片:METAL

摘要

  • Cognition 把 GPT-6 Astra 接进 Devin,让写代码和证明代码可用变成了一件事。
  • Devin 会交回 iPhone 游戏在模拟器中运行的录屏,以及一份测试报告。
  • 报告里单独列出未被测试的区域,标明自动化没有覆盖到的地方。

做过代码评审的人都知道那个瓶颈:写的速度快过读的速度。这正是打造自主软件工程师 Devin 的 Cognition 眼下面临的问题,而这家公司给出的答案不是少读代码,而是让代码自己拿出证据。

OpenAI 于 9 月 11 日在自家网站发布了 Cognition 的案例。Cognition 打造的自主软件工程师 Devin,客户遍布全球,从大型银行到技术原生的初创公司。文中写道,随着 Cognition 工程团队写出越来越多的代码,评审这些工作本身成了一项挑战。这家公司在 GPT-6 Astra 身上看到的不是更聪明的作者,而是测试自己的产出并把结果展示出来的能力。

Cognition 联合创始人 Walden Yan 用一句话点明了这一点。他说:"Astra 改进的一大块,是它测试并证明自己的工作确实按预期运行的能力。"声称能跑通和拿出证据证明能跑通之间的距离,就是这个案例的全部。

文中有一个具体场景。据该文,Devin 用 Astra 测试一款名为 Otter Run 的 iPhone 游戏,并交回游戏在模拟器中运行的录屏。录屏旁附带一份报告,列出通过的检查项和仍未被测试的区域。录屏展示软件实际如何运行,报告则记录测试触及的边界在哪里。

这里公司承认的局限不该被略过。报告中单设一栏"未被测试的区域",意味着这套做法没有验证全部,而这一事实被直接写进了产品里。工程师看着那一栏去找仍需人手的地方。自动化在这里不是取消评审,而是收窄评审该去的位置。

客户支持环节也用上了同样的方式。据 Yan 所述,客户截图发来一个缺陷后,团队把这张图交给使用 Astra 的 Devin,Devin 修好问题后交回一张展示结果的截图。他说这让团队能更快地回复客户。缺陷报告以图片进来,又以图片出去。

适用范围不止一个产品。Yan 说:"我们一直用它改进整条产品线,不只是作为核心云端智能体的 Devin,还包括我们的 CLI 和桌面产品。"这家公司在用自己卖的东西造自己卖的东西,而这种自我使用正是工具弱点最先暴露的地方。

同一天公开的另一个案例把这幅图景扩大了。OpenAI 同时发布了打造答案引擎的 Perplexity 的案例。Perplexity 联合创始人兼首席战略官 Johnny Ho 说:"我们可以让模型撰写沟通内容、修改真实系统、监控我们的生产软件,而上一代做不到这些。"这个说法把写作的能力和触碰运行中系统的能力分了开来。

Perplexity 举的例子同样是测试。Ho 解释说,他用 Astra 生成测试程序,逼真地模拟语言模型 API 或连接器等外部服务的响应,从而不必逐步人工核对就能验证端到端的工作流。随后他这样描述信任的程度:"我们确实可以把完整的端到端系统交给它,而且比上一代模型少看很多次。"

重要的是这两个案例在说同一件事。智能体变好的信号,不再表现为基准测试分数,而是表现为人需要过问的次数。Yan 这样展望接下来:"我们预期随着时间推移,需要人工去看的代码会变少,最终每天能交付更多。"目标显然是评审成本,而不是代码质量。

Cognition 并不只是别人模型的使用者。METAL 曾报道该公司推出自研编码模型 SWE-2,并把它放在性能与成本的前沿线上。一家拥有自研模型的公司,在产品内部却用另一家的模型担任测试角色,这说明模型选择正在按任务而不是按厂商切分。

METAL 通读的这两个案例页面几乎没有数字。没有一行声称速度快了几倍或缺陷减少了百分之几。取而代之的,只有人能亲眼查看的产出物:录屏、报告、截图。企业正在用一份证据清单,来描述一项尚未固化为基准的变化。

从工程角度看,改变的是智能体的输出格式。过去交出来的是一段代码,由人去读、去判断;现在代码连同它运行的画面,以及一份写明检查了什么、没检查什么的文档一起交出来。评审者的工作从解读代码转向审查证据。剩下的问题是谁来检查这些证据,而此刻坐在那个位置上的,是同一个模型。

自己测试自己所写代码的结构天生有个洞。从外部很难分辨究竟是让代码去迎合测试,还是让测试去迎合代码。正因如此,报告里"未被测试的区域"那一栏才是这个产品中最重要的项目。自动化越多,涨价的不是产出本身,而是附在产出上的局限标记;Cognition 与 Perplexity 共同给出的答案,不是把人从评审中拿掉,而是缩小人需要看的范围。

评论