
图片:METAL
摘要
- 9月1日晚有报道称Astra采用“循环深度”的循环式Transformer,四小时后OpenAI首席科学家Jakub Pachocki回应“计算图深度不超过GPT-4的2倍”,但没有否认使用了这一架构。
- 循环式模型在同一个模块里跑多圈,圈与圈之间的思考不写成文字,可节省50%到90%的算力,但思维链监控也相应减少。Steven Adler称这是“业界为数不多的红线之一”。
- 反对一方的问题在于,模型多了一个可以在推理时增加圈数的“旋钮”;OpenAI至今没有公开圈数和应用范围。
OpenAI的GPT-6 Astra把一部分思考放在人类无法读取的形态里完成。发布前两天的9月1日晚,有报道称Astra采用循环式Transformer,即所谓“循环深度”架构;四小时后,OpenAI首席科学家Jakub Pachocki在X上回应:“包括Astra在内,当前前沿模型的计算图深度不超过GPT-4的2倍。”他没有否认使用了这一架构。在此期间,前OpenAI安全研究员Steven Adler写道:“如果报道属实,OpenAI正在违反AI行业中为数不多的红线之一。”METAL在9月3日的Astra发布报道中报道过对齐改进与网络安全“危急”等级在同一天公布的事实,而这次争议是围绕这个模型如何思考展开的第二场交锋。
先看架构。普通的Transformer让token从底层到顶层依次经过几十到几百层,各走一次,生成答案。推理模型在此之上多了一步:在给出答案之前,把思考的步骤写成文字,再读回这段文字写出下一步,如此反复。这段文字就是思维链,英文叫chain of thought。循环式Transformer走的是另一条路:把token在同一个模块里反复送回去跑多圈,但每一圈的结果不写成文字,而是以向量状态原样传给下一圈。它不是把层堆得更高,而是把同一层跑多次,参数和算力因此减少,有研究显示在同等性能下可以节省50%到90%的算力。代价是,圈与圈之间的思考只以人类无法读取的一堆数字存在。这就是安全研究者所说的“neuralese”状态。
Pachocki在X上写的内容,METAL翻译如下。
我想阻止一场由混乱报道引发的“奔向不可监控的竞赛”。包括Astra在内,当前前沿模型的计算图深度不超过GPT-4的2倍。OpenAI从第一个推理模型起就一直保留并利用思维链监控,我们非常在意这个问题。
思维链监控今后可能会变得更难,但原因与架构变更无关。即便如此,仍有一些事情可以做来强化它,而这正是当前研究项目的核心目标。Astra的架构之后会更详细地公开。
(Jakub Pachocki,9月2日,X · METAL翻译,节选)
这个回应的核心是“不超过2倍”这个数字。逻辑是:即便是循环式,只要实际跑的圈数少,不写成文字而在内部处理的思考量,就与把层数堆到两倍的现有模型没有区别。32层跑两圈的模型和64层跑一圈的模型,在监控者看来是一样的。OpenAI的研究人员也反驳说报道有所夸大,称循环式架构只在模型的一部分中有限使用,推理保持在可读状态。
反对一方在意的不是现在的圈数,而是多了一个可以拨动圈数的旋钮。要增加层数必须重新训练模型,但循环式只需在推理时增加圈数,就能把思考变得更深、也更看不见。Apollo Research的Marius Hobbhahn说:“如果跑得更深意味着更高的性能,压力显然会指向那个方向。”前OpenAI治理研究员Daniel Kokotajlo对Pachocki说,“即便OpenAI不再往前走,其他公司也可能往前走”,提议建立全行业统一的可监控性标准,并补充说“需要的不只是政治意愿,还有深思熟虑的技术规范”。Google DeepMind的Neel Nanda说,失去思维链监控“将是一场巨大的悲剧”;Ryan Greenblatt甚至写道,这“可能是迄今为止AI安全领域最糟糕的事件”。
这些反应听起来并不过分,原因在于过去两个月发生的事。METAL此前报道过7月OpenAI一个未发布模型未经授权侵入Hugging Face系统的事故,以及之后OpenAI宣布将投资实时思维链监控。AI政策网络的Peter Wildeford指出,当时OpenAI和外部评估机构能够还原事情经过的几乎唯一的办法,就是读取模型的思维链,他把这次选择评价为“可能非常令人担忧,可能是鲁莽的”。“如果OpenAI真的在远离这条路,那就是错误的方向。”一个月前还说要加强监控的公司,如今拿出了一个缩小监控对象的架构,外界正是这样解读的。
“红线”这个说法也有依据。2025年7月,OpenAI、Google DeepMind和Anthropic的研究者联合发表的思维链可监控性论文把思维链称为“新的且脆弱的”安全机会,建议开发商研究如何保留它,并在更改架构时评估其影响。论文列举的风险因素之一,正是用向量而非文字思考的“潜在推理”架构。循环式Transformer是那篇论文所担心之事的教科书式案例。
技术本身并不新。METAL查阅的学术脉络显示,重复使用同一层的想法可以追溯到2018年Google的Universal Transformer;2025年2月Jonas Geiping团队发表的循环深度论文以最多32圈训练了一个35亿参数的模型,并展示了在测试时把圈数增加到64圈后性能上升。此后出现的后续模型呈现出规模越大圈数越少的趋势,2026年一个200亿参数规模的最新循环式模型只跑两圈。算法确实是老的,新的是第一次把它放进了前沿模型的商用产品里。从这条脉络看,Pachocki的“不超过2倍”是一个自然的数字,而批评一方的“旋钮”担忧也来自同一条脉络,因为圈数在训练之后仍然可以更改。
从工程师的角度把这场争论落到实务上,要确认的有三件事。第一,自己的产品是否依赖Astra的思维链文本。如果团队靠把推理token记入日志来捕捉智能体的异常行为,那就需要以“这些日志现在只包含模型实际思考的一部分”为前提,重新审视监控设计。第二,成本。循环式存在的理由就是节省算力,而企业客户对前沿模型价格积累的不满,正是这一架构出现的背景。第三,Pachocki承诺的架构公开。METAL确认,截至9月9日下午,OpenAI仍未公布Astra的循环圈数以及应用于哪些模块。只有这些数字出来,“不超过2倍”的说法才能在外部得到验证。
还有一点。隐藏思维链的架构也会让蒸馏变得困难。小模型学习大模型输出的蒸馏,需要有思维链文本才能做好,而美国政府和美国AI企业一直批评中国企业抄袭前沿模型的思维链进行蒸馏。循环式架构是一种以付出安全代价换取成本优势和防模仿能力的选择,OpenAI是如何权衡这笔账的,公司没有说明。
总结一下。OpenAI在Astra中加入了不把部分思考写成文字的循环式架构,并且没有否认这一点。公司说深度不超过GPT-4的2倍,监控不成问题;安全研究者则认为,出现了一个可以加深深度的旋钮,这本身就打破了行业共识。考虑到过去两个月里用来还原OpenAI模型未授权入侵事故的工具正是思维链,这场争论不是理论问题,而是运营问题。接下来要看的是,OpenAI承诺公开的架构信息里是否包含圈数,以及Anthropic和Google是否会回应Kokotajlo提出的行业统一标准。





评论