
图片:@OpenAIDevs (X)(视频截图)
摘要
- OpenAI开发者账号9月14日在X上发布视频,展示Perplexity如何使用GPT-6 Astra,OpenAI网站上的客户案例页面也记述了同样的内容。
- 联合创始人Johnny Ho让模型编写测试程序并替代外部服务生成响应,从而端到端验证工作流程。
- Perplexity表示,已把撰写沟通文案、修改软件和监控生产系统交给模型,检查频率比使用上一代模型时低得多。
OpenAI开发者账号9月14日在X上发布了一段68秒的视频。视频中,答案引擎Perplexity的联合创始人Johnny Ho讲述他如何在Codex中使用GPT-6 Astra。据帖子介绍,他用这个模型搭建测试框架并模拟第三方API响应,以检查各个部件能否协同运转。OpenAI网站上的客户案例页面也记述了同样的内容,页面标注的日期是9月14日。
METAL完整看过这段视频。Ho在视频中自我介绍为Perplexity联合创始人,称过去四年一直负责产品和工程。OpenAI页面上写明他的职务是联合创始人兼首席战略官。他解释说,Perplexity一直以搜索和准确性为核心,处理大量信息的能力对公司非常重要。
视频里最先出现的观点是代码与搜索的关系。Ho说:"每当模型写代码的能力变强,搜索和准确性也会随之提升。"原因在于,模型会自己写出检索网页或内部信息的代码,再把结果合并成一份人能读懂的简短摘要。对答案引擎来说,编程能力不是旁枝,而是拉高搜索质量的杠杆。
接下来才是这段视频的核心。据OpenAI页面介绍,Ho没有太多时间手动测试,于是让GPT-6 Astra围绕一个应用编写一个小型测试程序。模型会生成另一项服务可能返回的逼真响应,比如语言模型API或连接器的响应,并顶替这些服务的位置。这样他就能检查应用如何反应,并从头到尾测试整个工作流程。
从工程师的角度看,这改变了测试自动化的顺序。通常是人先把假响应写好,再在其上运行测试。这里连制造假响应的工作也交给了模型。既然模型已经知道外部服务大概会返回什么,模仿它的活也一并交给模型。这有点像盖房子的木匠连自己要用的模板都亲手搭好。
OpenAI页面列出了Perplexity交给这个模型的三项工作:撰写沟通文案、修改软件、监控生产系统。Ho在视频中说,这三件事是上一代模型做不到的。他在前面还补充了一句背景:随着AI不断进步,如何把处理信息的能力应用到真实系统上,一直是需要解决的课题。
由此引出的那句话是这个案例的结论。Ho说:"我们现在能把完整的端到端系统交给它,检查的频率比上一代模型低得多。"视频里他有一处自我纠正,从"不那么频繁"改口为"要少得多"。页面的摘要句也是同样的意思:检查次数比使用之前的模型时少了很多。他在视频结尾补充说,希望把这种能力做成新的产品形态,交付给客户。
这段视频是OpenAI围绕GPT-6 Astra接连推出的客户案例之一。METAL此前报道过Cognition的Devin用同一模型自行验证工作的案例,那篇报道也提到了Perplexity案例页面的第一句引言。这一次,原本只有文字的案例加上了创始人亲自出镜的视频。OpenAI通过API开放Codex框架一事,METAL也曾整理过。把框架向外开放,再推出在这个框架上跑检查的客户,这条线是连贯的。
OpenAI页面上标注的信息很朴素:公司规模是初创公司,地区是北美,行业是科技,使用的产品是API。视频发布几小时内播放量突破3.8万次,收到73条回复。OpenAI想展示的图景很清楚:模型不止于写代码,还会自己搭起检查代码是否正确的装置,而人看结果的次数变少。Perplexity表示,这种方式已经在生产环境中使用。





评论