每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

图灵奖得主萨顿:"合成数据无法扩展AI"

强化学习创始人对LLM扩展战略提出异议……称世界无限复杂,并提出持续学习智能体方案

추상적 콜라주 배경 속 도시 풍경과 노인의 흑백 사진, AI 로고

이미지: The Decoder

摘要

  • 图灵奖得主理查德·萨顿批评作为大语言模型扩展战略的合成数据是"一个大错误"
  • 他指出,世界无限复杂,任何模拟都只能停留在"微观"层面,而筛选优质数据仍需人类专家参与,这使扩展存在极限
  • 萨顿提出,与其使用权重固定的语言模型,不如让智能体自主积累经验、持续学习,作为替代方案
Rich Sutton and Khurram Javed: Why AI Models Stop Learning, and How to Start It Again
발언자
리처드 서튼 (튜링상 수상, 강화학습 개척자, 'The Bitter Lesson' 저자)
발언 계기
신설 스타트업 Oak Lab 소개 인터뷰
공동창업자
커람 자비드(전 제자)
핵심 주장
합성 데이터는 LLM 확장 전략으로서 '큰 실수'(big mistake)
이론적 근거
Big World Hypothesis - 세계는 무한히 복잡해 시뮬레이션이 '미시적' 수준에 그침
두 번째 근거
좋은/나쁜 합성 데이터를 가리려면 인간 전문가가 필요해 확장에 병목 발생
대안 방법론
Continual Backprop - 서튼 연구팀이 네이처에 발표한 지속학습 기법
LLM 평가
"놀라운 과학적 성과"지만 지능의 "20%에서 25% 수준"이라 평가

强化学习创始人抛出的反驳

理查德·萨顿是强化学习领域标准教科书的作者,也是后来打造AlphaGo的戴维·西尔弗的导师。在2019年撰写的文章《The Bitter Lesson》中,他主张从长远看,比起注入人类先验知识的方法,随算力线性扩展的搜索与学习方式最终会胜出。此后,这篇文章在AI业界常被引用,作为为扩展法则正名的依据。

然而,正是这位萨顿,最近在与前学生克拉姆·贾维德共同创立的初创公司Oak Lab的介绍会上,正面批评了业界目前正在使用的一种扩展策略。那就是合成数据——即在人类生成的数据枯竭后,利用模型或模拟器大量生成数据用于训练的方式。萨顿断言:"那就是一个大错误。"

大语言模型为何撞上了瓶颈

萨顿认为,大语言模型同时是《The Bitter Lesson》中好的案例和坏的案例。之所以是好案例,是因为它像"吸入"整个互联网一样进行学习,性能确实随算力增加而提升。之所以是坏案例,是因为恰恰在这一点上碰到了极限。互联网是有限的,而现实世界"远大于我们存储在互联网上的一切"。萨顿的诊断是:一旦互联网这一资源枯竭,模型最终将更加依赖人类已经创造好的知识,而这反而成了拖累系统的因素。

对于合成数据能否突破这一瓶颈的问题,他给出了两个依据。第一是由贾维德正式提出、并被阿尔伯塔研究团队长期研究的"大世界假说"(Big World Hypothesis)。其前提是:世界无限复杂,远大于任何一个心智、任何一个智能体。模仿这个复杂世界的模拟,无论多么精细,最终都只能停留在"微观"规模。小程序只能造出小世界,而这个世界会在摩擦系数不同、或不准确还原机器人电机运动等方面与现实产生偏差。此外,世界中还存在其他行为者的内心活动,这是合成数据无法制造的对象。萨顿指出:"关于他人心智的合成数据,是没有办法制造出来的。"

第二个依据是人类瓶颈。判断哪些合成数据是好是坏,最终仍需人类来完成。贾维德举例说,若要训练一架像蝙蝠一样通过回声定位飞行的无人机,首先得雇佣该领域的专家。最终,这种方式会受限于人类专家的数量,因而无法扩展。依靠模拟训练的自动驾驶汽车也是同样的道理,模拟与实际道路之间的差距,最终仍需人工来弥补。

自主学习智能体这一替代方案

萨顿给出的解决方案,是把人从这个循环中抽离出来。他主张,智能体不应依赖人类预先设定好的固定模拟模型,而应自己学习并不断修正属于自己的世界模型。他的表述是:"模拟器应该是智能体自己创造出来的东西。"

他指出的另一个问题是,当前的语言模型一旦训练结束就停止学习了——"权重再也不会改变。"萨顿认为,真正需要的是持续学习。在他看来,这本身就是"学习"这一概念的应有之义。"所有的学习都应该是持续性的",同时又不能出现抹去旧知识的"灾难性遗忘"(catastrophic forgetting)。萨顿的研究团队曾提出发表于《自然》杂志的"Continual Backprop"技术,作为部分解决这一问题的方法。

尽管提出这些批评,萨顿并未全盘否定语言模型本身。他称语言模型是"了不起的科学成就",但同时也划清界限称,就整体智能而言,它只占"20%左右,或者说四分之一"。

围绕持续学习的最新动向

智能体应通过自主积累经验来进化这一问题意识,并非萨顿一人独有。正如《腾讯混元发布验证AI智能体"自我进化"的五阶段路线图》一文所述,腾讯混元研究团队于8月12日推出了L0至L4阶段框架,用于验证智能体自我进化的可靠性。同一时期,Oumi也发布了一个能让模型在生产流量中自我再训练的平台,Sakana AI也曾提出在物理世界中自我改进的智能体是下一个研究前沿。萨顿的发言与这一潮流方向一致,但不同之处在于,他更进一步,将业界目前用作数据枯竭解决方案的合成数据本身,从根本上判定为一种错误的方法。

编辑视角

萨顿的发言之所以有分量,是因为他近乎是扩展法则的理论奠基人。《The Bitter Lesson》曾是让如今各前沿实验室相信"只要不断堆算力最终就会取胜"的依据。而正是这样一位人物,如今正面瞄准了当前扩展战略的一个支柱——合成数据,这可以说是扩展信仰内部出现裂痕的信号。

从各代模型的发展来看,这种感受更加明显。在GPT-3时代,仅靠抓取互联网文本,性能就能不断提升。但如今随着训练用文本枯竭,各实验室不得不依赖一种自我参照结构,即用模型生成的数据来训练模型。正如萨顿所指出的,这种结构的弱点在于,判断这些数据是好是坏,最终仍然要靠人。也就是说,数据生成实现了自动化,但质量判断却没有实现自动化,这正是他所说的"人类瓶颈"。

对国内团队而言,这场争论带来的实务教训十分明确:通过合成数据扩充微调数据的方法依然有效,但如果不将数据质量验证环节自动化,即便数据量增加,性能也会停滞不前。对于目前正在运行合成数据流水线的团队来说,与其把人力和预算投入生成环节,不如更多投向筛选与评估环节,这与萨顿的诊断更为契合。

未来几个月可能发生的事情是可以预见的。各前沿实验室与其正面回应对合成数据的批评,不如会陆续推出在语言模型之上叠加持续学习和智能体式学习循环的混合方案。Oumi和腾讯混元最近的研究已经指出了这一方向,萨顿的Oak Lab也很有可能不久后就会拿出针对这场争论的具体成果。

评论