METAL

陶哲轩警告 好的数学难题正在枯竭

菲尔兹奖得主警告未解难题正被耗尽。同一周,德累斯顿工大一位教授写道,OpenAI 就他的 ChatGPT 对话所作的否认并不诚实。

陶哲轩警告 好的数学难题正在枯竭

图片:METAL

摘要

  • 陶哲轩 9 月 8 日在 Mastodon 上写道,好的未解难题正以不可再生的方式被开采,如今稀缺的资源已是识别出一个有希望的问题本身。
  • 德累斯顿工业大学教授安德烈亚斯·托姆询问 OpenAI,他与加博尔·库恩的 ChatGPT 对话是否进入了训练数据,得到研究员马克·塞尔克一句"没有发生过"的回复。
  • OpenAI 在另一起事件中表示未访问特定用户数据,但同时补充说,无法排除源自产品使用的去标识化数据帮助改进了模型。

在德累斯顿工业大学主持几何学教席的安德烈亚斯·托姆教授,于 8 月 OpenAI 宣布找到非索菲群之后不久,给该公司发了一封邮件。他问的是:自己与加博尔·库恩围绕扩张子匹配问题与 ChatGPT 讨论了数月,这些内容是否进入了训练数据,或者在求解过程中是否可被访问。回信只有一句话。OpenAI 研究员马克·塞尔克写道:"关于您与 ChatGPT 的对话:那并没有发生。"

托姆教授不满的地方在于,这一句话把两个不同的问题揉成了一个。他在邮件里明确区分过:一是是否进入训练数据,二是求解过程中是否可被访问。而回复没有说明否认的是哪一项,也没有附上任何依据或解释。托姆 9 月 9 日在 Mastodon 上留下的记录中写道,那个回答"至少是不当地宽泛且实质上具有误导性的;现在回头看,它明显不诚实"。

同一时期 OpenAI 就另一起事件给出的说法,调子并不一样。针对特里斯坦·巴克马斯特与莱文特·阿尔珀格一案,公司表示未访问特定用户数据,但又补充说,无法排除源自其产品使用的去标识化数据帮助改进了模型。托姆主张,公司在那起案件中划出的这条界线,在给他的回复里被抹掉了。

菲尔兹奖得主陶哲轩则在另一个层面上给出了诊断。他 9 月 8 日在 Mastodon 上写道,好的未解难题正以不可再生的方式被开采。既然问题可以无限生成,说枯竭听上去有些奇怪,陶哲轩是这样解释的:"一个国家或地区可能被广阔的海洋环绕,却同时遭遇严重的饮用水短缺。"像求圆周率第 10 的 10 的 10 次方位数字这样的问题,随时都能造出来,但绝大多数这类问题什么也教不了人。

陶哲轩写道,判断一个问题是否值得投入本身就是漫长而主观的工作。了解难度地形,即哪些问题用已知方法就能轻易解决、哪些要费力气、哪些根本不可能,是这种判断的核心。工具变好会把难度地形推平,通常这种推平会被抵消,因为可及范围随之扩大,新的边界随之出现。

而当下 AI 时代的特点,陶哲轩指出,恰恰是这种边界消失了。没有一条清晰的线把 AI 够得着的问题与够不着的问题分开,一部分原因是技术变化太快,另一部分则是公司既不公开失败的尝试,也不披露抵达答案的过程。于是他写道:"如今稀缺而珍贵的资源,已是识别出一个有希望的问题本身。"

最沉重的一段紧随其后。陶哲轩写道,他已经看到,仅仅是某人正在攻某个问题的传闻,就能引来大规模的 AI 算力涌入,在原本的研究成熟之前把那个问题推平。因此激励正在向着不再与更广泛的共同体分享有希望的研究方向倾斜,而这将颠覆数百年来的开放科学传统,对这个领域的未来造成长期的严重损害。

若从法律的角度看,这起事件的核心是谁需要举证。托姆教授说他在 6 月 29 日关闭了模型训练,但那个开关是用户无法审计的承诺,而且只对之后生效。它对此前往来的对话、对已经被提取的衍生物,都给不出答案。OpenAI 的回复既没有提到那项设置,也没有提到按账户核查过。他写道,用户没有理由去逆向推演公司内部的训练流程,掌握相关数据的只有公司一方。

去标识化这个词到底覆盖到哪里,问题也在同一处。托姆写道:"去标识化可以抹掉一个名字,却抹不掉一个数学想法的知识内容。"名字一去,隐私问题就算收拾干净了,但想法本身仍在,并成为下一代模型的能力。他提到,自己与库恩的路径并非攻克非索菲性的主线,量子博弈那边有更被看好的路子,正因如此,模型偏偏对那条路径了如指掌才加深了他的疑问。

9 月 10 日托姆再次发文,把问题推向了制度层面。他写道,这一类智能不应被当作条件完全由少数几家公司设定的普通消费品。他所指的结构是:提供方收集人们的想法和信息,独占关于这些内容如何被使用的全部证据,再把这份优势反过来用在自己的用户身上。他的结论是,一旦智能成为社会的基础设施,它就必须置于可与水或电相比的公共义务与独立监督之下。

METAL 核实过的陶哲轩这组文章共四篇,在最后一篇里他承认,要彻底禁止自动化的解法提取工具在技术上并不现实。他转而建议,划出一类问题,对这类问题而言解出答案本身不是重点,工作还应从求解过程中提炼洞见,并让人对邻近问题的难度地形有所了解。他把这比作如今的食物捐赠:不再因为某样东西技术上能吃就照单全收,而是维持明确的标准。METAL 曾报道过 OpenAI 宣称攻克难题后引发的优先权之争,以及 巴克马斯特记录下发布前一天接到的那通电话,而这一周,正是那些个案转向整个领域规则问题的节点。

目前能确认的是:托姆分两路提问,OpenAI 只答了一路;以及公司在另一起事件中,为去标识化衍生数据的贡献留了口子。能显示训练流程实际如何运作的材料,只在公司手里。接下来要看的有两点:OpenAI 会不会拿产品设置、数据集与检查点来支撑自己的否认,以及数学家们是否真的开始把未发表的想法挡在商用模型之外。

评论