
摘要
- OpenAI于9月3日通过YouTube公开GPT-6 Astra,称其在电脑操作长任务基准测试和软件工程方面均取得最佳成绩
- OpenAI表示,凭借诚实度提升和欺骗行为减少,这是史上对齐程度最高的模型;但同一模型两天前刚以OpenAI自有标准首次被评为网络安全"致命"等级
- 从今天起该模型优先面向企业客户、Trusted Access Program用户和ChatGPT Work开放,Codex、API和AWS将在数天内陆续开放
一个能代替你操作电脑的模型出现了
OpenAI于9月3日在YouTube发布视频,正式介绍了GPT-6 Astra。OpenAI将其称为"全球最智能、对齐程度最高的模型",并表示在需要操作电脑的长任务基准测试中,该模型在多种职业场景和桌面应用上都取得了最佳成绩。也就是说,只要是电脑能完成的工作,Astra都能替人快速处理。OpenAI还强调,在软件工程领域,这也是迄今为止OpenAI推出的模型中表现最出色的一款。
具体来看,OpenAI在9月1日公布的安全卡中提到,Astra在ExploitBench测试中取得满分,并且在自我修复测试中展示出独立发现并利用两个零日漏洞的能力,因此其网络安全风险被评为"致命"等级。这次OpenAI所说的"对齐程度最高的模型",并不意味着这项风险已经解除,而是指诚实度和减少欺骗行为这一独立指标上的改进。
OpenAI着重宣传了Astra在诚实度上的提升和欺骗行为的减少,称其为史上对齐程度最高的模型。但就在两天前,我们对同一模型的报道基调略有不同。
对齐提升与安全评级,同一模型的两面
根据OpenAI于9月1日公布的安全卡,Astra在ExploitBench测试中获得满分,在自我修复测试中甚至展示出独立发现并攻击两个零日漏洞的能力。这一结果使Astra成为OpenAI"准备框架"中首个网络安全项目突破"致命"临界值的模型。此次发布中提到的诚实度和欺骗行为改进,与网络安全风险属于两条不同的评估轴线:一条衡量模型是否会欺骗用户,另一条衡量模型能够突破什么系统,二者并不联动,因此某一项改善并不会连带降低安全等级。
直接接管桌面的场景
发布视频中展示了Astra处理桌面任务的多个片段。有人要求画一个黄色圆圈,结果被改成了火箭舷窗,随后这个设计又在Blender中被制作成3D模型。视频还演示了如何根据"华丽有趣"的语气要求,为下一季雨衣产品制作销售用演示文稿。当用户要求把几年前在跳蚤市场买的橙色桌子挂到eBay出售时,Astra找到了下载文件夹里的照片并附上,还把桌子有轻微划痕的说明写进了商品描述里。此外,视频还展示了在同一个会话中依次完成以下任务:制作一款用方向键移动、空格键加速躲避小行星的游戏;重新下单上周点过的牛肉盖饭;起草律所的许可协议,并将责任限制条款调整为对许可方更有利;预订网球场;将完成的火箭模型导出为可供3D打印使用的STL文件。
视频中还插入了一段"把它放到那里"的场景,画面注明由MIT媒体实验室、Chris Schmandt和Eric Hulteen提供。这是对早期自然语言交互演示的致敬——当年仅凭语音和手势就能移动屏幕上的物体,这段画面说明将语音操作与屏幕操控融为一体的尝试其实已经持续了几十年。
如何使用
根据用户群体不同,Astra的接入时间也有所差异。
| 时间 | 渠道 | 对象 |
|---|---|---|
| 今天(9月3日) | 企业版·Trusted Access Program | 优先接入客户 |
| 今天起 | ChatGPT Work | 广泛开放 |
| 数天内 | Codex | Plus、Pro、Business、Enterprise订阅用户 |
| 数天内 | API·AWS | API、AWS客户 |
OpenAI建议,若想真正体验到Astra的性能,最好使用ChatGPT桌面应用。桌面应用可以同时操作屏幕和其他应用程序,这与Astra代替用户操控电脑的功能正好契合。
从应用场景来看,视频里的演示完全可以直接搬到实际工作中。比如制作产品宣传资料时,可以用语言指定初稿的语气和色调,同时让Astra完成附件添加和图片插入等工作;在网上发布二手物品时,可以让它自动查找并粘贴照片、润色商品状态描述;处理合同条款时,也可以让它挑出具体条款并调整措辞——这类需要在多个应用之间切换的琐碎工作,都可以一次性交给它处理。
编辑视角
整个8月,OpenAI陆续发布了电脑操作历史回顾、Work教程、电脑与浏览器联动演示,一步步为Astra的登场铺路。这次发布是这条铺垫链条的最后一块拼图,也是迄今为止推出的电脑操作模型中形态最激进的一款。让模型直接操作屏幕所见内容、在多个应用间切换完成初稿、人类只负责最终审批——这套架构其实ChatGPT Work早就展示过,而Astra则用基准测试第一的成绩为其提供了支撑。
不过,把对齐改进和网络安全评级放在一起看,解读方式就不一样了。把这个体量的模型放到实际业务中检验,得出的结论往往大同小异:模型越智能,能做的事情范围会扩大,一旦被滥用,波及的范围也会同步扩大。诚实度提升,意味着模型对用户说谎的可能性降低了,但这并不代表它能够突破的系统范围也随之缩小。对于打算将Astra用于实际业务的企业来说,即便这两项指标出现在同一份发布文件中,也有必要分开审视。既然已经出现了防御合作伙伴优先接入、正常操作可能因误判而被中断等提示,在初期引入阶段,把自动批准的权限范围设得窄一些会更稳妥。
未来几周,随着Codex和API渠道相继开放,开发团队层面的实际使用反馈将率先积累起来。届时应该能看出,电脑操作基准测试第一这个数字,和"致命"这个安全标签,到底哪一个更能左右这款模型的实际普及速度。





评论