每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

OpenAI数学模型解出10道未解难题引发引用争议

提交数百页证明材料却悄悄修改出处说明……数学家反应不一

노란 배경 위에 놓인 회색 주판 3D 렌더 이미지

이미지: The Verge AI

摘要

  • OpenAI宣布其未公开名称的内部模型解出了量子博弈论、高维球体填充等10道数学未解难题
  • 发布初期曾称"过去十年未有进展",随后悄悄改为该成果基于两位研究者已有研究,引发引用标注争议
  • 同一系列模型在星期计算、基础算术等简单任务上仍会出错的问题也随之暴露
발표 주체
오픈AI
발표 형식
블로그 글 '10 Advances in Mathematics and Theoretical Computer Science', 수백 쪽 분량 증빙 문서 첨부
해결 주장 분야
양자 게임이론, 3차원을 넘는 고차원 구 채우기 등 10개 분야
사용 모델
이름 미공개 내부 모델(추정 아스트라), 오픈AI가 확인은 거부
이전 사례
지난 5월 오픈AI 내부 모델이 80년 된 '단위 거리 추측' 반증
논란
'10년간 진전 없음' 서술을 이후 두 연구자 기존 연구 인용으로 조용히 수정
취재
로버트 하트, 더버지 런던 주재 AI 기자

附带数百页证明材料的发布

OpenAI去年8月发布的一篇博客文章震动了数学界。标题是"10 Advances in Mathematics and Theoretical Computer Science"——顾名思义,声称解决了十个数学与理论计算机科学领域的问题。OpenAI还随文附上了数百页的证明文档,用以支撑这一说法。The Verge驻伦敦AI记者Robert Hart对此次发布进行了报道并采访了多位数学家,部分内容此前也曾出现在菲尔兹奖得主坦言,面对AI攻克数学,身份认同陷入困惑一文中。

OpenAI并未公开这一模型的名称。Hart在播客节目"Decoder"中表示,他认为这个模型很可能是Astral,但在向OpenAI求证时未得到答复。此前5月,OpenAI一个未公开名称的内部模型也曾反驳了一个存在80年之久的"单位距离猜想",Hart推测这次的模型应属同一系列。

从量子博弈论到球体填充

此次发布的10个问题清单中,包括量子博弈论、超越三维的高维空间球体填充问题等。没有一个是轻量级课题。Hart在采访中援引一位研究者的话说:"哪怕只解出其中一个,学术生涯就有保障了。"此前常有人指出,AI模型在数学上的成果大多局限于学界并不十分关注的边缘问题,但这次的十个问题确实是多位数学家长期钻研的对象,因此各方反应出现分歧。

悄悄改动的一句话

争议的核心在于引用标注问题。OpenAI在发布初期对这10个问题的说明是:近十年来未有明显进展。但实际查阅论文可以发现,其中一项成果的论文中明确写着,这项工作是建立在两位现有研究者已有成果基础之上的。这部分内容后来在没有任何说明的情况下被悄悄修改。Hart联系到的部分研究者对此表示不满,认为对实际贡献重大的先行研究未做充分说明。不过Hart也提到,其中一位被提及姓名的研究者对此问题态度较为含糊。Hart认为,与其说这是抄袭,不如说更接近一种夸大成果的拙劣新闻稿问题。

但依然数不清星期

抛开这些高难度数学成果不谈,同一系列模型在基础任务上仍然表现糟糕。诸如星期计算、时间识别等简单任务出错的案例不断被报告出来。Hart指出,数学并非一个统一的单一领域。正如生物学涵盖从动物观察到细胞生物化学的广泛范畴一样,数学的范围也从简单计算延伸到高度抽象的理论。AI模型擅长以新方式组合现有方法、连接不同领域,但在处理需要精确数值的计算上仍显薄弱。

编辑视角

此次争议中值得关注的一点是,OpenAI特意强调了"10个"这个数字。如果逐一发布单个问题,验证需要时间,话题性也会打折扣。而一次性打包推出十个问题,则可以在媒体和学界完全仔细核实之前,先制造出强烈的印象。若结合此前8月10日Anthropic用其未公开的研究型Claude挑战黎曼猜想并宣布部分成果这一事件来看,前沿模型开发商正在竞相利用数学这一"可验证的舞台"这一图景就变得更加清晰。

这与菲尔兹奖得主Timothy Gowers和数学家Peter Sarnak此前的指出如出一辙:大语言模型擅长在庞大的搜索空间中组合现有方法,却缺乏判断哪条路径具有生产力的直觉。这次的十个问题中,相当一部分也是在延续或扩展已有研究的基础上完成的,而最初对这一事实的淡化处理,恰恰暴露了同样的局限。凭空创造全新的抽象理论,与快速拼接现有片段得出答案,是两件不同的事情。

从实务角度看,学界和研究机构现在应该做的事情很明确:面对AI实验室发布的数学成果,比起结果本身,更应优先查看随附的证明文档和先行研究引用列表。如果只看新闻稿里的数字下判断,就很容易像这次一样错过被悄悄修改的关键表述。对大学数学系和科研资助机构而言,这反而更加印证了必须持续投入新问题发掘与指导能力建设的结论——因为快速解决现有问题的能力,与提出新问题的能力,仍然是两码事。

未来数月内,包括OpenAI和Anthropic在内的前沿实验室将继续发布数学成果。为避免下一次发布再度出现这种引用标注被悄悄修改的情况,学界预计将要求建立事前验证或共同作者确认等程序。

评论