METAL

Claude完成费马大定理首个计算机可验证证明

Anthropic的Claude用11天写出1300万行Lean代码,把数学界最大难题之一形式化

Claude完成费马大定理首个计算机可验证证明

图片:由 METAL AI 生成

摘要

  • Anthropic于9月4日宣布,已利用Claude将费马大定理完整转化为计算机可验证的形式
  • Claude近乎自主工作了11天,写出1300万行Lean代码,在3.03万条中间定理中有2.95万条被用于最终证明
  • 帝国理工学院教授Kevin Buzzard评价称,这项工作除数学公理外不依赖任何其他假设
Checking that a major mathematical proof is correct can take years. Formalization—converting the mathematical reasoning into a form computer proof assistants like Lean can verify—can help.

Anthropic于9月4日宣布,已利用自家AI模型Claude首次将费马大定理完整转化为计算机可以逐行核验的形式。Claude几乎没有借助人类干预,近乎自主地工作了11天,用名为Lean的证明语言写出多达1300万行代码,期间证明了2.95万条中间定理,最终完成整个证明。数学界原本预计这项工作需要数年时间,如今反响格外强烈。

左边是形状残缺的Wiles证明圆圈,代表这份经过人类验证、但曾一度被发现漏洞的证明。虚线箭头将其引向中间密密麻麻的点阵,也就是Claude——意味着数十个智能体在11天里不间断自主运作。实线箭头从Claude指向右侧完整的圆圈,即最终证明,显示Lean逐行机械核验后毫无缺漏地完成了整个证明。左边是形状残缺的Wiles证明圆圈,代表这份经过人类验证、但曾一度被发现漏洞的证明。虚线箭头将其引向中间密密麻麻的点阵,也就是Claude——意味着数十个智能体在11天里不间断自主运作。实线箭头从Claude指向右侧完整的圆圈,即最终证明,显示Lean逐行机械核验后毫无缺漏地完成了整个证明。
图片:METAL AI生成

费马大定理究竟是什么

1637年,皮埃尔·德·费马在丢番图《算术》一书的空白处写下一句话:对于任何大于2的指数n,不存在满足a^n + b^n = c^n的正整数a、b、c。他还留下一句话,说页边空白太小写不下证明——可这份证明足足350多年都没有出现。1995年安德鲁·怀尔斯给出长达129页的证明之前,历史上出现过无数次尝试;1908年甚至有人悬赏,奖金按当时币值折合100万到200万美元,结果仅第一年就收到621份错误答案。就连怀尔斯的证明,发表后不久也被发现存在重大漏洞,他又花了一年时间才最终补全。

十年后,荷兰计算机科学家Jan Bergstra提出应该把这份证明形式化,也就是把人类阅读的逻辑转换成计算机可以核验的形式。此后,帝国理工学院的Kevin Buzzard自2024年起主导了一项历时多年、借助Lean证明助手完成的社区协作项目,仅早期阶段的蓝图文档就长达86页。

换句话说,安德鲁·怀尔斯1995年手写完成的129页证明,当年就连人类阅读核验都花了数月时间;而把这份证明重新写成计算机能逐行核验的Lean语言,正是所谓的"形式化"工作。Anthropic这次把形式化任务交给Claude,11天就完成了——这也呼应了陶哲轩上个月发出的警告:AI或许已经能够胜任验证数学成果的"守门人"角色。

Claude这11天做了什么

哥伦比亚大学研究AI形式化工具的Anthropic研究员Tianyi Feng(音译)想测试Claude能否在费马大定理的形式化工作上取得进展,结果远超他的预期。Claude在11天内完成了从头到尾、计算机可验证的完整证明,期间共证明了3.03万条定理,其中2.95万条被用于最终证明。数十个Claude智能体协作,分别负责定义概念、证明中间定理,并逐步攻克越来越复杂的命题。

Claude的证明沿用了Darmon、Diamond和Taylor整理的怀尔斯证明简化版本。人类介入的部分,仅限于Tianyi Feng偶尔给出的高层次指引,比如"把雅可比簇当作概形来处理,看起来应该优先解决"这类建议。

对比项怀尔斯证明(1995)Claude形式化(2026)
篇幅129页1300万行Lean代码
验证耗时数月(人工审阅)11天(AI自主完成)
中间定理未单独统计使用2.95万条(共产出3.03万条)

越过失败,迎来Prove2Me

一开始并不顺利。早期尝试中,各智能体虽有一定进展,但很快就丢失了工作状态,彼此之间也协作不畅。这些失败的尝试最终占到了最终证明中非样板代码的约7%。

转折点出现在项目迁移到Prove2Me平台之后。这个开放协作平台由Tianyi Feng与哥伦比亚大学的同事共同打造,主要从三个方面提供了帮助:维护定理陈述之间的有向无环图(DAG),帮助智能体判断接下来该证明什么;把定理陈述和证明拆分成独立文件,提升Lean的编译速度;为每条定理附上自然语言说明,方便检索和复用。

Anthropic把完成的证明分享给了Kevin Buzzard,他给出了这样的评价:

"这项特别的自动形式化成果,除数学公理外不依赖任何其他假设,证明了费马大定理。" —— Kevin Buzzard(帝国理工学院)

클로드, 페르마의 마지막 정리 첫 컴퓨터 검증 증명 완성
이미지: @AnthropicAI (X)

证明代码已公开

完整的Lean代码和证明图谱可以在github.com/anthropics/fermats-last-theorem仓库中查看。数学家或开发者可以逐行代码查看Claude究竟按怎样的顺序一步步搭建起了整个证明体系。

黎曼猜想,以及随之而来的问题

这并不是Anthropic第一次让Claude挑战数学难题。上个月,他们就用一个未对外公开的研究版Claude尝试攻克黎曼猜想,据称提高了ζ函数零点比例下界的现有纪录。在这一背景下,菲尔兹奖得主陶哲轩在国际数学家大会的一篇文章中警告称,AI可能给数学界带来堪比20世纪初"基础危机"级别的震荡——这一次受到考验的,不是数学真理本身,而是学界评判成果、认定贡献归属的那套隐性价值体系。

编辑视角

这次发布真正意义上的新事物,不是"证明"本身,而是"验证"。如果说此前有关黎曼猜想的工作还指向发现新的数学结论,那么这次费马大定理的形式化,针对的是一个早在30年前就已被证明的结果,只不过这一次由计算机毫无保留地重新核验了一遍。Anthropic自己也在强调这一点:在逻辑上相信某个结论是对的,和像用计算器验算一样确认它确实是对的,完全是两码事。

放到时间线上对比,这种差异感更加明显。怀尔斯的证明在发表仅两个月后,就因审稿人的一个提问暴露出致命漏洞,单是补上这个漏洞就花了整整一年——这说明人类靠肉眼逐段核验129页逻辑链条,本身就存在根本性的局限。而Claude把同样的逻辑拆解成了1300万行机器可验证的代码,由Lean自动核对其中每一环,人类可能疏漏的缝隙,这次由机器补上了。

从实际影响看,这件事传递出两层信号:一层给数学研究者,另一层给所有关注这股趋势的知识产业从业者。对数学界而言,这意味着以往验证一项新成果动辄要花数年时间,现在有了缩短这一过程的工具;对其他领域而言,这树立了一个先例——那些人类难以逐一核验的复杂逻辑结构,AI或许可以代为进行形式化重构。不过也值得记住,这项工作在早期尝试中同样出现过智能体丢失状态、协作失败的情况——这恰恰说明,如果没有像Prove2Me这样良好的状态管理基础设施,AI智能体的自主工作很快就会乱套。

未来几周内,很可能会有更多难题采用类似方式被攻克。OpenAI最近也曾宣称破解了一个长期悬而未决的数学难题,看来两家公司围绕数学形式化与证明验证的竞争,恐怕才刚刚开始。

评论