每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

数学家们表示"LLM擅长计算,但提不出新想法"

高尔斯与萨纳克:"AI擅长组合现有方法,但无法从根本上创造出全新概念"

신경망 노드와 연결선을 표현한 추상 콜라주 이미지

이미지: The Decoder

摘要

  • 菲尔兹奖得主蒂莫西·高尔斯与数学家彼得·萨纳克指出了LLM在数学创造力方面的局限性
  • 高尔斯诊断称,LLM缺乏在庞大搜索空间中选择出富有成效路径的直觉
  • 谷歌DeepMind研究员汤姆·扎哈维在论文《LLM无法跳跃》中得出了相同的结论
발언자
티모시 가워스(필즈상 수상자), 피터 사르나크
가워스 진단
기존 방법 조합·다중 경로 탐색엔 능하나 생산적 경로 선택할 직관 부족
사르나크 진단
기존 이론에서 결과 도출은 가능, 새 추상화 개발은 불가
관련 연구자
구글 딥마인드 톰 자하비
논문 제목
LLMs Can't Jump
병목 개념
manipulative abduction(언어적 선례 없는 새 기초 가정을 발명하는 능력)
제안된 대안
세계모델(world model)
출처
미국수학회(AMS) 인터뷰

会计算,但不会构思

证明一个新定理,与其说是计算,不如说更接近于想出"从未有人尝试过的第一步"。菲尔兹奖得主、数学家蒂莫西·高尔斯与数学家彼得·萨纳克近日在接受美国数学学会(AMS)采访时提出的诊断,正是针对这一点。两人都承认大型语言模型(LLM)在数学领域展现出相当的能力,但同时指出,在创造真正全新的想法方面,LLM存在根本性局限。

高尔斯评价称,目前的模型擅长组合已知方法、同时尝试多条搜索路径。问题出在接下来的环节。他指出,模型在庞大的搜索空间中缺乏挑选出真正富有成效路径的直觉。也就是说,模型不具备人类数学家经过数十年训练才获得的那种"这个方向是对的"的直觉。

萨纳克则给出了更具体的说明。他表示,AI能够从已确立的理论中推导出结果,但无法从最基础的问题出发,自主创造出支撑重大证明的新抽象概念。回想数论中重大定理最初问世时的情形,这句话的分量就更加清晰了。那些定理并非善用现有工具的结果,而是创造出此前根本不存在的概念本身的结果。

DeepMind研究员也得出相同结论

业界内部也出现了类似的诊断。谷歌DeepMind研究员汤姆·扎哈维在其论文《LLM无法跳跃》(LLMs Can't Jump)中为这一瓶颈命名。他用"操作性溯因"(manipulative abduction)这一概念来解释问题的核心,指的是在完全没有语言先例的情况下自主发明新基础假设的能力。这与重新排列现有句子或扩展模式不同,是名副其实地从零创造出前所未有之物的工作。

扎哈维提出,世界模型(world model)——一种不学习语言,而是学习视觉、物理信息等真实环境结构的AI模型——是有望突破这一局限的候选方案。其逻辑是:如果问题出在被语言束缚的学习方式上,那么直接学习语言之外结构的模型可能成为替代方案。不过,这一提议是否真能解决数学创造力问题,目前尚未得到验证。

基准测试分数在涨,创造力为何原地不动

这次的诊断与近来业界反复被提出的问题相呼应——LLM在各类考试分数上不断刷新纪录,但在实际业务和研究现场感受到的能力却并未同步提升。上月15日Moonshot AI公布的PerceptionBench结果显示,在16个前沿模型中,没有一个模型的纯视觉识别准确率超过60%,排名第一的模型也仅为59.7%。这意味着,那些以推理能力见长的模型,在准确读取图像这一最基础的环节就已站不稳。

高尔斯与萨纳克的指出方向也是一致的:基准测试分数与实际创造能力之间存在差距,而且这一差距并不会随着模型规模扩大而自动弥合。不过,两位数学家都认可LLM本身的计算与组合能力,因此将此番言论解读为"AI毫无用处"未免夸大。二人所指出的,是在特定领域——创造根本性全新数学概念——上的局限。

编辑视角

这番言论之所以耐人寻味,是因为二人并非AI怀疑论者。高尔斯长期以来一直倾向于认为AI能够帮助数学研究,萨纳克同样不否认AI作为计算工具的价值。正是这样两位人物不约而同地提到了"创造力的壁垒",这一事实本身就传递出一个信号:这堵墙即便在乐观派眼中,似乎也开始显现出来了。

对于在实际工作中使用过LLM的人来说,这番话并不陌生。在应用已知定理或填补证明特定环节方面,模型的速度和准确性令人惊讶。但像"这个问题一开始就该换个框架来看"这样的重新构思,却很少出现。代码审查或报告初稿工作也类似——模型能快速组合现有模式、产出看似合理的结果,但颠覆问题本身定义的提议却很罕见。这很可能并非模型偷懒,而是因为可供学习这种重构能力的数据本身就极为稀缺。

这给国内研究与教育现场带来的启示很明确:把LLM当作"填补证明特定环节的助手"来使用,现在依然有效且高效。但期待它"提出新的研究方向",目前仍属过度。在研究生研讨会或研发规划阶段,与其原样采纳AI的头脑风暴结果,不如将其用途限定为快速组合与验证已知方法,这样能降低失败的概率。

未来数月内,这场争论很可能会随着世界模型系列研究成果的发布而进一步升温。如果按扎哈维的提议,学习语言之外结构的模型真的展现出接近"操作性溯因"的能力,那么这两位数学家此次的诊断可能只是短暂的临时结论。反之,若此类尝试仍原地踏步,"LLM只是计算器"这一框架很可能在短期内固化为业界的默认判断。