METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

数学家们表示"LLM擅长计算,但提不出新想法"

高尔斯与萨尔纳克:"AI擅长组合现有方法,但无法从根本上创造出全新概念"

数学家们表示"LLM擅长计算,但提不出新想法"

图片:METAL

摘要

  • 菲尔兹奖得主提摩西·高尔斯与数学家彼得·萨尔纳克指出了LLM在数学创造力方面的局限性
  • 高尔斯诊断称,LLM在庞大的探索空间中缺乏挑选出有效路径的直觉
  • 谷歌DeepMind研究员汤姆·扎哈维在论文《LLM无法跃迁》中得出了相同的结论

会计算,却提不出新想法

证明一个新定理,与其说是计算,不如说更接近于想出"无人尝试过的第一步"。菲尔兹奖得主、数学家提摩西·高尔斯在自己的博客中,以及数论权威彼得·萨尔纳克在美国数学学会(AMS)会刊《Notices》的采访中,分别给出的诊断都指向了这一点。两人都承认大型语言模型(LLM)在数学领域展现出相当的能力,但同时也指出,在创造真正全新想法方面存在根本性的局限。

高尔斯在12日发布于自己博客的文章中评价称,目前的模型擅长组合已知方法、同时尝试多条探索路径。问题出在下一步。他指出,模型在庞大的探索空间中缺乏辨别哪条路径真正有效的直觉。也就是说,模型不具备人类数学家经过数十年训练才获得的"这个方向是对的"这种直觉判断。

萨尔纳克在AMS会刊采访中给出的说明更为具体。他表示,AI能够从已确立的理论中推导出结果,但无法从最基础的问题出发,自主创造出支撑重大证明的全新抽象概念。回想数论中重大定理最初出现时的情形,这句话的分量就更加清晰了。那些定理并非善用现有工具的产物,而是创造出此前根本不存在的全新概念本身的结果。

DeepMind研究员也得出相同结论

业界内部也出现了类似的诊断。谷歌DeepMind研究员汤姆·扎哈维在自己的论文《LLM无法跃迁》中,为这一瓶颈命名。他用"操作性溯因(manipulative abduction)"这一概念来解释问题的核心。这指的是在完全没有语言先例的情况下,自主发明全新基础假设的能力。这与重新排列现有句子或扩展模式不同,是真正从无到有创造出前所未有之物的工作。

扎哈维提出世界模型(world model)——一种不学习语言、而是学习视觉、物理信息等真实环境结构的AI模型——作为突破这一局限的候选方案。他的逻辑是,如果问题出在被语言束缚的学习方式上,那么直接学习语言之外结构的模型或许可以成为替代方案。不过,这一提议是否真的能解决数学创造力问题,目前尚未得到验证。

基准分数在上升,为何创造力却原地踏步

这次的诊断与近期业界普遍存在的疑问相呼应。有观点指出,LLM在各类测试分数上不断刷新纪录,但在实际业务或研究现场感受到的能力提升却没有那么明显。在15日Moonshot AI公布的PerceptionBench结果中,16个前沿模型中没有一个纯视觉识别准确率超过60%,排名第一的模型也仅为59.7%。这意味着,那些标榜推理能力的模型,竟然在准确读取图像这一基础环节就已经出现动摇。

高尔斯与萨尔纳克的指出方向是一致的。基准分数与实际创造能力之间存在差距,而这一差距不会随着模型规模扩大而自动填补。不过,两位数学家都承认LLM本身的计算与组合能力,因此将这次的发言解读为"AI毫无用处"未免夸大其词。两人指出的,是特定领域——创造出根本性全新数学概念——上的局限。

编辑视角

这次发言之所以有意思,是因为两人并非AI怀疑论者。高尔斯长期以来一直持有较为倾向于"AI能够帮助数学研究"的立场,萨尔纳克也从未否定过AI作为计算工具的实用性。这样两位人物几乎在同一时期、在不同场合不约而同地提到"创造力的壁垒",这一事实本身,就是一个信号——表明这堵墙如今连乐观派也开始看得见了。

对于实际使用过LLM的人来说,这样的说法并不陌生。在应用已知定理或填补证明中特定步骤这类工作上,模型的速度和准确度都令人惊叹。但像"这个问题从一开始就应该用不同框架去看待"这样的重新构建,却很难出现。代码审查或报告初稿的工作也类似——模型能组合现有模式,迅速产出看似合理的结果,但推翻问题定义本身的提议却很少见。这很可能不是因为模型偷懒,而是因为可供学习此类重构的数据本身就极为稀缺。

这对国内研究与教育现场的启示很明确。将LLM用作"填补证明特定步骤的助手",目前依然有效且高效。但期待它"提出新的研究方向"则还为时过早。在研究生研讨会或研发规划阶段,与其直接采纳AI的头脑风暴结果,不如将其用途限定在快速组合与验证已知方法上,这样能降低失败概率。

未来几个月内,这场争论将随着世界模型系列研究成果的发布而进一步升温。如果按照扎哈维所提议的方向,学习语言之外结构的模型真的展现出接近"操作性溯因"的能力,那么这两位数学家此次的诊断可能只是不会持续太久的临时结论。反之,如果此类尝试仍然停滞不前,"LLM只是计算器"这一框架很可能在短期内固化为业界的默认认知。

评论