
图片:METAL
摘要
- Anthropic 于 9 月 25 日发布客座文章,称 Fable 5.1 计算出了平面 N=4 超对称杨-米尔斯理论中九圈六粒子散射振幅。
- 计算在 Claude Science 中通过两条路径完成,成本约 1,000 至 2,000 美元,其中自举计算相当于 96 个 CPU 运行一周。
- Lance Dixon 教授验证了结果,中国科学院何颂团队在 GPT-6 的辅助下也几乎同时得到了大部分结果。
Anthropic 于 9 月 25 日在其研究网站上发表了一篇客座文章,称 Fable 5.1 计算出了粒子物理中的九圈散射振幅。计算对象是平面 N=4 超对称杨-米尔斯理论这一假想试验理论中六个粒子相互作用的振幅,也是该领域研究者多年来希望再推进一圈的课题。斯坦福大学和 SLAC 国家加速器实验室的 Lance Dixon 教授花了两周时间独立验证了结果。
事情起源于一份公开挑战书。前理论物理学家、现为科学作家的 Matt von Hippel 于 8 月 7 日在博客上写道:"如果 AI 公司想让我这样的人刮目相看",就去攻克他过去的领域,并要求给出 N=8 超引力七圈或 N=4 超对称杨-米尔斯九圈的结果。他解释说,这些问题之所以困难,不是因为缺乏新想法,而是因为每增加一圈,计算量就会呈指数级、有时甚至阶乘级增长。问题的核心在于,大学实验室级别的计算机能否越过这堵墙。
"圈"是衡量计算追踪粒子间相互作用复杂程度的单位。据 von Hippel 介绍,描述真实粒子反应的振幅公式大多只算到两圈,少数算到三圈,而粒子物理中最精确的预测也只用了五圈。这一课题的前一步,即八圈结果,是 Dixon 于 2023 年与 Andy Liu 一起,借助名为形状因子的相邻公式和名为对径对偶的对称性间接得到的。
接下挑战的是 Anthropic 的物理学家 Liam Fitzpatrick 和 Siddharth Mishra-Sharma。两人在面向科学家的付费平台 Claude Science 中运行了 Fable 5.1。他们先问 Claude 最有可能解决哪个问题,给出计算九圈六边形振幅的一行指令后,就只是反复让它继续,例如:"我要去睡觉了,接下来几个小时都联系不上。在我让你停下之前一直做下去,每 4 到 6 小时汇报一次进展。"
Claude 通过两条路径计算出同一个答案:一条是把 Dixon 团队打磨多年的自举方法原样再推进一圈,另一条是经由形状因子的间接路径。据 von Hippel 介绍,无论哪条路径,普通用户需要支付的费用都在 1,000 至 2,000 美元左右,大部分来自长时间运行 Claude。用 Python 的 SymPy 编写的自举计算本身只占其中约 100 美元,相当于 96 个 CPU 运行一周。
METAL 核实的结果页面以 9 月 16 日为日期公开了全部计算文件。两条路径得到的表示在比较的 107,053 个系数上没有一个不一致;用同一套程序重建已发表的八圈结果、随机比对 1,000 项的测试也全部吻合。据结果页面介绍,仅在一个对称面上把符号逐词展开,非零项就多达约 300 亿个。页面还注明,函数形式的结果目前只计算过一次,没有第二次独立计算,计算程序也不对外发布。
负责验证的 Dixon 表示,他是在 9 月 1 日得知这一消息的。他写道,这套计算流程极其脆弱,一个小错误就会让一切像失败的舒芙蕾一样塌掉,而让他惊讶的是,Claude 从零写出了论文中无法完整记录的细节代码。他还说:"我敢断言,除了我的合作者之外,Claude 比任何人都更理解我们 2019 年和 2023 年的论文。"他还补充估计,Claude 大概比他的团队自行开发的 Transformer 模型大 100 万倍以上。
人类也几乎走到了同一位置。在 von Hippel 收到 Anthropic 消息几天后,北京中国科学院的何颂团队告知,他们已经得到了大部分结果。该团队只在部分约束条件的计算中使用了基于 GPT-6 的 AI,整体框架由人来搭建。据报道,何颂、Jirong Jing 和 Xiang Li 于 9 月 17 日把直到九圈的符号数据上传到公开存储库。Dixon 写道:"两周之内,我先后被一台机器、又被借助机器的人类抢先了。"
Anthropic 披露,它邀请 von Hippel 撰写此文并为其时间支付了报酬,Dixon 则获得了 Claude 使用额度。解释这些结果的论文将由 Dixon 和何颂团队撰写。METAL 曾报道 Fable 5.1 破译一段 370 年未解密码的消息,而这一次接受检验的,是把既定计算毫无差错地推进到底的能力。
从 AI 工程师的角度看,这一结果的核心不是新物理,而是长时间任务的可靠性。von Hippel 本人评价说,Claude 只是用比以往稍多的算力运行了已知方法。不同之处在于,它在没有人类监督、只靠一句"继续"的情况下,一次性完成了为期一周的计算。他写道,就在 3 月,AI 还处在需要大量手把手指导的学生水平,而"现在它已经能可靠地完成这类工作"。他认为最大的教训是,在专家看来遥不可及的目标中,唾手可得的果实比想象的更多。研究机构接下来要问的,与其说是把哪些计算交出去,不如说是由谁、用什么工具来验证交回的结果。





评论