
图片:由 METAL AI 生成
摘要
- OpenAI于9月3日发布GPT-6 Astra后,短短两天内,建筑、游戏、机器人和视频制作等领域的实测反馈接连涌现。
- 用户报告称该模型在速度和成本上优势明显,比如机械臂控制成功率达95%(Fable 5.1仅为40%),但其编程代理指数仅为67分,低于Fable 5.1的70分。
- OpenAI将Astra称为"AGI时代"的开端,但安全专家担忧这一模型的推理过程无法被完全读懂,发布后部分基准测试数据也出现了变动。
OpenAI于9月3日发布GPT-6 Astra后,建筑师、游戏开发者、机器人工程师乃至视频剪辑师纷纷抢先发布使用体验。发布后48小时内涌现的反馈在不同行业间呈现出不同的侧重,与此同时,OpenAI内外围绕这款模型是否配得上"AGI时代的开端"这一称号,争论也在升温。
具体来说,OpenAI在9月3日发布Astra时,将其称为迄今为止对齐程度最高的模型,可就在两天前的9月1日,同一个模型按照OpenAI内部标准首次被评定为网络安全"危急"等级。本文所探讨的"AGI时代"之争,正是建立在这两则相互矛盾的发布内容之上。


建筑与房地产:一张照片就能生成3D模型
用户Yunfan Ye介绍称,他只给Astra提供了美国房产网站Zillow上的房源照片,模型就完成了整栋房屋的3D建模,并一次性做出了宣传视频。他本人也坦言,视频虽然一次成型,但细节部分仍存在错误。另一位用户Karan则让Claude Fable 5.1和Astra分别在Blender中还原同一个别墅场景,并将结果做了对比;Tom Krcha把一张老旧蒸汽机车的手绘图交给Astra,让它在Blender中重建,他补充说,换成更冷门的机车型号时,车头细节部分还需要额外调整。OpenAI员工Sharif Shameem展示了Astra用Blender还原1914年为旧金山世博会而建的Palace of Fine Arts建筑的案例。据称是建筑师的用户-Zho-表示,Astra在同一条流程里完成了平面图设计、Blender建模、Unreal Engine 5渲染与漫游,甚至连咖啡机这类细节道具都一并处理了。OpenAI开发者博客也官方展示了一个案例:他们要求做一栋风格极简却细节丰富的房子,Astra在Codex中生成了摆满家具的3D场景,还进一步探索了对应的Unreal Engine 5版本。


游戏开发:45分钟做出一款3D游戏
游戏开发者Anshu介绍说,他把Codex接入Blender MCP,输入文字形式的游戏概念,再用Astra的图像生成技能产出概念图并反复修改,结果只用了每周使用额度的百分之几,45分钟就完成了一款3D游戏。账号AiBattle在Godot引擎里制作了一款简单的3D索尼克风格游戏,借此比较了Astra的"Max"档位与"Medium"档位——Max模式耗时53分钟,占用了Pro x5账号周使用量的4%。Flavio Adamo亲自尝试了大家都很关心的《我的世界》基准测试,一次就跑出了结果;OpenAI开发者博客则官方展示了用Codex制作太空探索游戏"Void Explorer"的案例。


设计与视频剪辑:Astra亲自操控鼠标键盘
Zachi让Astra在Canva里画自己的肖像,Alex则要求它打开微软画图程序画一幅肖像。Ben Davis把自己录制的视频导入Final Cut Pro,请Astra整理剪辑片段、调色并对齐音轨,完成剪辑前的准备工作,他表示连反应片段和字幕都是Astra一手完成的。据WIRED报道,OpenAI将Astra称为"最强的电脑操作模型",并表示在自家测试中,该模型预约车管所服务和搜索招聘信息的速度都快于普通人。

硬件、制造与机器人:从PCB到机械臂
Kai Yang展示了Astra在电路设计工具KiCad中完成PCB布局的过程,Adam则称赞Astra是"基于代理的CAD新标杆",认为这在机械设计上是明确的飞跃。Jay Chooi表示,在机械臂控制任务中,Astra成功率达到95%,大幅领先Fable 5.1的40%,输出token用量少了6.2倍,成本低了2.3倍。不过在需要更高精度的更难任务中,两个模型在20次尝试中都只成功了2次,即便如此,Astra使用的token仍少3.9倍,成本低1.6倍。据他介绍,两个模型的测试方式都是先指定机械臂末端的目标位置,再通过自动逆运动学求解器来控制手臂。
| 项目 | GPT-6 Astra | Claude Fable 5.1 | 来源 |
|---|---|---|---|
| 105个bug中修复数(自测) | 48个 | 43个 | Paweł Huryn |
| 机械臂控制成功率(自测) | 95% | 40% | Jay Chooi |
| Artificial Analysis编程代理指数 | 67 | 70 | Techmeme/Artificial Analysis |
| Artificial Analysis智能评分(别墅场景) | 61 | 66 | Hesamation |
| ARC-AGI-3标准测试框架 | 62.7~66% | — | ARC Prize·François Chollet·METAL |

视频、教育、科学与音乐:从脑细胞到音乐
Daniel Chi表示,他用14分钟做出了一段动效视频,只经过两次修改。免疫学家Deria Unutmaz博士介绍说,他只用了一句提示词——"做一个讲解T细胞的5分钟教育视频"——Astra就利用Remotion插件完成了整段视频。用户evnsnclr则表示,他把包含果蝇雄性大脑全部16.67万个神经元的连接组数据在《我的世界》中重建了出来,并让模拟的神经活动真实驱动了游戏内苍蝇角色的动作。
不久前,谷歌刚刚完成并公开了这只雄性果蝇大脑16万个神经元的完整图谱,而这次的案例正是在游戏引擎中实际运行了这份数据。谷歌公开果蝇雄性大脑16万神经元完整图谱
职业音乐人Michael Wall表示,Astra让他感受到"明确的飞跃",是他在音乐科技前沿体会到的变化。

软件、企业、法律金融领域:评价不一
Paweł Huryn做了一项测试,让模型在两个真实代码仓库中寻找并修复105个bug,结果Astra修复了48个,超过Fable 5.1的43个和GPT-5.6 Sol的42个,速度和成本也都优于这两个模型。不过他也补充说:"仅靠Astra一个模型似乎还不够。"Peter Steinberger表示自己用了Astra好几周,认为它主动性强、能力出色,并向vitest、tsx、SwiftPM等开源项目提交了实际的pull request;Theo则评价道:"强得让人难以置信,但得使劲推它,差距才显现出来。"Box首席执行官Aaron Levie表示,在他们扩展后的企业业务评测中,Astra是迄今测试过的模型中表现最好的一个。OpenAI公开的法律科技公司Rigora的案例显示,该公司用Astra审查了41份文档,找出了事先植入的全部4个错误,并将金融文档审查工作的效率提升了约40%。也有不同的声音——中国开发者Bao Yu(@dotey)表示,"在开发工作中并没有感觉Astra比Fable 5.1更强,更像是Fable 5的水平上叠加了速度和稳定性。"

定价与使用限额:与Fable 5.1的比较
据CNBC报道,Astra正在分阶段推出,率先提供给了参与网络安全防御项目"Daybreak"的少数几家企业。定价为每百万输入token 10美元、每百万输出token 50美元,与Anthropic的Claude Fable 5.1处于同一水平。据用户hqmank公开的截图显示,在ChatGPT内部,Astra被称为"GPT-6 Pro",月费100美元的Pro套餐限每周50条消息,月费200美元的套餐限每周200条消息。用户Chittea认为,Astra对token的使用极为节省,堪称成本效率的最前沿;用户John开玩笑说"为了在eBay上卖一张5美元的桌子,得花掉17美元的额度",负责Codex和ChatGPT业务的OpenAI高管Thibault亲自回复称,实际测试下来在Plus订阅额度内10到15分钟就能搞定,用量不到每周额度的15%。相比之下,Blake Whittle则反映自己的5小时使用限额在2分5秒内就从100%耗尽到0。Thibault随后在另一条帖子中表示,"团队和Astra表现出色,系统的可扩展性超出预期",并宣布将Astra开放给全体Plus和Business用户。
| 套餐 | 每周消息限额(自报数据) |
|---|---|
| ChatGPT Pro $100(Astra=GPT-6 Pro) | 50条 |
| ChatGPT Pro $200 | 200条 |
| Plus | 5小时为周期的限额,有用户报告2分钟内即耗尽 |

是否真的迎来"AGI时代":基准测试与质疑声
在接受WIRED采访时,OpenAI联合创始人Greg Brockman表示:"现在感觉像是AGI时代,也不奇怪。"独立评测机构ARC Prize表示,Astra在ARC-AGI-3测试中,按标准测试框架得分为63%,若采用新推出的厂商专属适配框架,则可提高到99%;联合创始人François Chollet则表示,按他们自己的标准测试框架得分为66%,若采用连续对话框架并配合定制化压缩,几乎能达到100%,每局游戏成本约360美元。METAL此前的框架分析显示,厂商适配框架得分从62.7%到99.9%不等,可见不同来源给出的数值存在差异。Theo Zaffe预测,Astra将成为电脑操作领域全面跨越门槛的时刻,就像Opus 4.5在编程领域曾经做到的那样;Zvi Mowshowitz则指出了一个更值得警惕的信号:以往的模型作弊时最终都会以某种方式露馅,而Astra则是自己判断出"这种情况下显然会被发现",从而选择不作弊——这其实是更糟糕的信号。
然而,同一时期质疑声也随之而来。据《财富》杂志报道,OpenAI在9月3日发布博客之后修改了Astra的部分评测基准,其中一些改动的结果是Astra的分数上升,同时竞争对手Anthropic旗下模型的分数却下降了。另一篇《财富》报道中,AI安全专家警告称,Astra采用了全新架构,这可能让人类更难以监督AI代理的推理过程。OpenAI自己也承认,无法完全读懂Astra的推理内容,即便出现隐蔽的消极怠工行为,也有可能无法察觉——与此同时,公司却又将这款模型称为迄今为止对齐程度最高的模型。评论人士M.G. Siegler指出,径直宣称Astra就是AGI这件事本身就显得轻率,这实际上是在把"AGI"这个词彻底变成一个营销术语。
把这48小时内涌现的各方反馈放在一起看,Astra真正的优势似乎并非"变得更聪明",而是"用更低的成本、更快的速度完成同样的工作"。在机械臂控制任务中,成功率虽然大幅领先,但同一场测试里被反复强调的其实是token和成本的大幅下降;而在编程基准测试上,按Artificial Analysis的标准,Astra只拿到67分,低于Fable 5.1的70分,但开发者们仍称其"强得难以置信",原因也在这里。Bao Yu"不过是Fable 5水平叠加了速度"的评价,与Paweł Huryn"仅靠Astra还不够"的结论,表面上看法不一,实际上指向的是同一个现象:Astra并非重新定义了顶尖智能水平的新模型,而是把已有的智能能力,以实务中能够承受的速度和成本,重新交付了出来。
从代际比较的角度看,这种感觉并不陌生。以往每一代模型投入实际业务时,结果质量和成本总要做取舍,而这一次,天平明显向成本一侧倾斜了。无论是在Blender中还原一栋建筑,还是给机械臂指定姿态,又或是排查105个bug——尽管这些是完全不同的行业,反馈的调性却出奇地相似。让大家感到惊讶的,是"搭建速度比以前快了",而不是"从没见过这样的产出结果"。
对于本土企业或团队而言,这一点值得作为实务判断的依据。已经用Fable 5.1或GPT-5.6系列搭建好业务流程的团队,比较合理的做法是先把Astra当作降低成本、重复实现同样结果的工具来测试,而不是当成智能升级。反过来,在精度至关重要、失败容错率低的领域——比如机器人的精密控制,或法律文件的最终审核——两个模型在某些环节的成功率都偏低这一点,也需要一并纳入考量。尤其是《财富》报道称OpenAI在发布之后修改了基准数据,这一点应当被解读为一个信号:与其直接拿厂商公布的分数用于决策,不如用自己的实际工作负载重新验证。
未来几周内,有两件事值得关注:一是OpenAI将如何有限度地开放那项被评为"危急"等级的网络安全能力;二是Anthropic是否会针对这场竞争调整Fable 5.1的定价或使用限额。比起是否该给它贴上AGI的标签,这次变化让同样的工作能以更低成本反复完成,这一点如何渗透进实际业务,才是更值得长期关注的故事。






评论