METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

OpenAI在GitHub公开722篇数学论文

OpenAI将一个未公开内部模型生成的722篇数学论文按372个结果族整理后发布到GitHub。其中包括涉及准黎曼猜想和霍奇猜想的结果,但许多结果尚未形式化,模型名称和提示词也未公开。

OpenAI在GitHub公开722篇数学论文

图片:METAL

摘要

  • OpenAI于10月6日在GitHub仓库openai/math中公开了一个未发布内部模型生成的722篇数学论文,按372个结果族归类。
  • 该模型共接到约4000道题,每个结果平均消耗约相当于ChatGPT Pro三小时思考的算力;许多结果附有Lean形式化,但公司表示未形式化的结果可能存在问题。
  • OpenAI称参考了普林斯顿高等研究院咨询小组的建议,但未公开模型名称和逐项提示词,并预告将资助研讨会和学术会议、推进模型发布。

OpenAI于10月6日把一个尚未公开的内部前沿模型生成的722篇数学论文一次性上传到GitHub仓库openai/math。论文按相关结果归并为372个结果族,其中许多附有可让计算机检查证明的Lean形式化。公司表示,该模型在本次评估期间共接到约4000道题,每个结果平均消耗的算力约相当于ChatGPT Pro三小时的思考。仓库中还注明,没有形式化的结果可能存在问题。

METAL查阅的仓库中41页的概览PDF,把结果按数论、代数几何、理论计算机科学、组合数学、算子代数、偏微分方程等17个领域分类列出。清单上的每一项主张都指向数学界的老问题,包括所谓准黎曼猜想(狄利克雷L函数在实部大于7/8的区域没有零点)、有理数域上希尔伯特第十问题的否定性解决、卡塔兰常数的无理性、CM阿贝尔簇的有理霍奇猜想、所有非交换自由群因子彼此同构的结果,以及循环阿达马猜想。OpenAI注明编号并不代表排名。

公司也公开了结果的产生方式。根据README,大多数结果由同一个内部模型按同一流程产生。由于现有数学评估的成绩已经饱和,公司将评估扩展到未解决的研究问题,部分结果建立在模型此前产出的结果之上。例外有两项:黎曼ζ函数无零点区域的研究,以及CM阿贝尔簇霍奇猜想的证明;关于实部11/12区域的稿件经过人工编辑以便阅读。仓库还收录了10个结果的模型推理摘要,包括π的无理性指数、马勒猜想和自旋玻璃的梅扎尔—帕里西公式。

发布方式考虑了外部建议。OpenAI表示,它在与设于普林斯顿高等研究院的独立机构“数学与人工智能咨询小组”商议后制定了公开原则。METAL曾报道OpenAI宣布成立这一咨询小组。据报道,该咨询小组于9月29日根据数学界600多份回复发布建议,要求实验室为每个结果公开模型名称、提示词、推理摘要、所用时间和计算成本,并把结果存放在不受任何AI实验室控制的学术仓库中。建议针对用未公开模型测试高难度数学问题的做法写道:“我们不支持这种做法,并要求他们停止。”

오픈AI가 모델 추론 요약을 공개한 10개 결과군 번호와 주제 목록 표

此次公开只满足了其中一部分要求。OpenAI提供了推理摘要、尝试题目数量、算力估算,以及保留旧版本的修订政策,但没有公开模型名称和逐项提示词,成本也只给出平均值而非逐项数据。仓库本身也是由OpenAI管理的GitHub仓库,公司表示将继续寻找符合咨询小组标准的社区托管仓库。据报道,OpenAI划定界限:咨询小组可以就如何发布结果提供建议,但不能干预是否产出结果以及产出速度。

一个月前,这个模型曾处于争议中心。OpenAI于9月8日宣布,同一内部系统证明了纳维—斯托克斯方程存在有限时间奇点;据报道,公司当时称该模型远强于GPT-6 Astra。METAL曾报道这一发布引发了优先权之争。纽约大学数学家Tristan Buckmaster指称OpenAI沿用了他的研究方向后,OpenAI数学家Sébastien Bubeck在记者会上反驳称:“我们没有用他们的提示词或证明来提示我们的模型或指挥我们的智能体。”

数学界的警惕自那时起不断上升。菲尔兹奖得主、数学家陶哲轩当时在Mastodon上写道:“我们现在已经看到,哪怕只是有人在研究某个问题的传闻,也可能引发大规模的AI驱动攻关,在原有研究充分发挥潜力之前就把这个问题碾平。”METAL曾报道25位菲尔兹奖得主发表公开信,指出AI公司与数学的目标已经背离。据报道,参与咨询小组的菲尔兹奖得主蒂莫西·高尔斯曾警告,在一二十年内,数学文献可能急剧膨胀,却不再有真正理解它的人类群体。

OpenAI把资金和模型作为下一步的筹码。公司表示将资助旨在理解AI重大成果的研讨会、学术会议和专项项目,并正在推进以负责任的方式发布产生这些结果的模型。公司称希望“以最先进的能力直接赋能科学家”。但它没有公布资助规模、时间表和模型发布时间。

这次发布的分量与其说在论文数量,不如说在验证的顺序。Lean形式化能够用机器确认证明在逻辑上是否正确,却无法说明一个结果有多新、多重要。722篇论文中哪些是真正的突破、哪些需要修补,如今要由学术界来分辨。产出结果的一方与必须阅读结果的一方之间的速度差,将成为数学界今后的议题。

评论