数学家称 OpenAI 一次性发布近 400 项 AI 生成数学成果是纯粹疯狂,消化或需数年
‘Pure insanity’: Mathematicians will need years to make sense of OpenAI’s latest drop
OpenAI 本周突然发布近 400 项 AI 生成的数学结果,分布在 719 份手稿中,涵盖数论、组合数学、几何、拓扑等多个学科,并为此在 GitHub 上发布了导航指南。
同一新闻,精选展示《OpenAI 发布内部前沿模型产出的数学研究成果》
“令人震惊。”“铺天盖地。”“前所未有。”“超现实。”“纯粹疯狂。”
这是超过三四十位数学家在与我交谈时用来形容自己感受的词语,他们试图理解 OpenAI 本周突然抛向这一领域的海量数学成果。惊叹、兴奋,以及对这场洪流之规模的难以置信之余,还有一种深层的焦虑:这一切意味着什么——接下来又会怎样。尽管反应各异,研究人员一致认为,仅仅理解 OpenAI 发布了什么就可能需要数年时间,更不用说弄清楚数学家们自己在一个正围绕他们发生变化的领域中该处于什么位置了。许多人担心,OpenAI 不会等那么久才继续前进——或者发布更多成果。
总体而言,OpenAI 发布了近 400 项 AI 生成的成果。这些成果散布在 700 多份手稿中,涵盖了多个数学学科,包括组合数学、几何学的若干分支、数论、理论计算机科学、代数、拓扑学、概率论与统计力学,以及数学物理。这个合集如此庞大,以至于 OpenAI 觉得有必要发布指南,说明如何浏览这个规模庞大的 GitHub 仓库。
工作量之巨大,使得即便只是初步评估该公司究竟发布了什么也很困难。在发布后的数小时和数天里,大多数接受我采访的数学家表示,他们仍在努力消化所有内容;有几位说,仅仅通读大约 40 页的目录和摘要就花了他们将近一个小时。“光是浏览整个摘要列表就让人不堪重负,”康涅狄格大学数学教授 Álvaro Lozano-Robledo 说。
在数百份手稿中,零星散布着 Lean 形式化,Lean 是一种编程语言和证明助手,允许以计算方式验证结果。这些形式化已被证明在评估 OpenAI 此前一些数学主张时发挥了关键作用,让研究人员即便没有完全理解其背后的论证,也能对某个主张在逻辑上是否正确抱有信心。
“如果这些 AI 现在消失,就像有外星人来到地球然后又离开了,我们也会在未来 10 年里一直研究这个,试图理解一切。”
但每项成果经过验证的程度差异极大。在 GitHub 上,OpenAI 承认,这些成果“处于不同的验证阶段”,并且“许多,但并非全部,手稿已被形式化”。截至撰稿时,该合集中似乎只有不到一半的手稿得到了形式化描述。OpenAI 表示,719 份手稿中只有 300 项顶级结果已被形式化,约占 42%,并且它“将在获得更多形式化结果时更新该仓库”。
多位数学家向 The Verge 抱怨缺乏形式化,尤其是考虑到成果数量之庞大,并强调即便某项结果附有 Lean 代码,评估也并非即时可成。研究人员必须核实形式化是否真正证明了该结果所宣称的内容,这又是一项耗时的过程;几位深入研读论文的人表示,即便提供了可由计算机验证的证明,质量也参差不齐,而且它们所验证的命题并不总能与随附手稿中的主张严丝合缝地对应。
伦敦帝国理工学院数学教授 Kevin Buzzard 表示,他在自己所属的代数数论领域识别出了大量定理,其中只有大约六个立刻“脱颖而出”。这些定理中,即便有,也几乎没有在 Lean 中被形式化验证过。“因此,我要么得去读那些可能并不正确的垃圾内容,要么等着别人去做同样的事,要么等着有人把它们形式化,之后我才能确定这些结果是否正确。”Buzzard 的担忧得到了众多其他研究人员的呼应。
对 AI“垃圾内容”感到担忧的远不止 Buzzard 一人。这个词是低质量、常常错误的 AI 生成材料的简称,这类内容正越来越多地出现在网上——以及现实世界中——包括学术论文。与其他领域一样,数学家们告诉 The Verge,近年来他们看到用 ChatGPT 和 Claude 等工具生成此类材料的情况急剧上升。其中许多内容令人困惑、难以阅读,且显示出对该主题理解甚少;在给其他研究人员署名方面尤其粗制滥造。
OpenAI 此前的数学文稿因其草率而受到专家广泛批评,尤其是署名不当或完全缺失。在发布前与 The Verge 的交谈中,几位研究人员已把即将涌来的论文洪流称为“slopocalypse”(垃圾末日),或类似的变体说法。
所担忧的“slopocalypse”是否真的成为现实,很难说,很大程度上是因为发布出来的材料数量之多令人眼花缭乱。早期迹象表明,OpenAI 这一次在论文上更为用心,至少对其中一些如此。几位数学家告诉 The Verge,他们的第一印象远好于预期,不过他们自己也承认,鉴于该公司此前劣质的发表记录,这算不上什么高标准。
“这是一团大乱。它可能导致学术文化的巨大崩塌,并直接毁掉大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视这一问题。”
但更好并不一定意味着好,更不用说达到人们通常对作出如此重大主张的学术工作所期望的标准了。由于 OpenAI 的许多主张缺乏形式化验证,随附论文的质量就变得尤为重要;它们是数学家们确认、理解、审视这些结果并将其置于语境中的主要手段。
即使是在最理想的情况下,撰写严谨的数学论文也是一项艰难的工作。以这种规模来做这件事,更是一项艰巨的任务。OpenAI 的模型正以令人眼花缭乱的速度、横跨广泛的专业领域大量产出数学内容,远远超出了其人类员工的处理能力。该公司根本不具备足够的专业广度或资源,来适当审查其在数学前沿的发现。研究人员告诉 The Verge,这一点已经显现出来。
许多人描述了那些难以理解、有时几乎无法跟上思路的论文。“对我最熟悉的问题的那篇论述,快速读一遍几乎不知所云,”布朗大学的数学教授 Brendan Hassett 告诉 The Verge。“如果这是人写的,我不会再花时间去试图理解它。当然,这还剩下另外 721 篇预印本!”(Hassett 说这话时,OpenAI 尚未撤回三篇论文)。
一些研究人员告诉 The Verge,他们或同事注意到有几篇论文似乎覆盖了其他数学家已经涉足的领域,但在有机会适当审阅材料之前,他们不愿公开这么说。其他人则指出这些工作异常简短,通常预期需要数百页才能展开的结果被压缩到几十页甚至更少。
澳大利亚悉尼大学的数学教授 Nalini Joshi 表示,快速检索这次发布的内容后,发现与她自己工作重叠的很少,但她指出,她检查过的一些论文“参考文献很短”。鉴于此前对 OpenAI 署名做法的批评,她说她“担心论文中的归属可能缺少完整的信息。”
但尽管有种种粗制滥造和不确定性,总体共识是,这次发布中包含了一些确实令人印象深刻的工作。
在强调评估如此大量材料的困难——以及妥善核实结果的必要性——的同时,许多接受 The Verge 采访的研究人员表示,尽管呈现方式存在缺陷,这些工作似乎水准非常高。他们说,在人工智能出现之前的世界里,OpenAI 的许多成果显然值得发表在顶级期刊上,并足以让作者获得一份学术生涯。其中少数成果被描述为那种能让一位数学家成为菲尔兹奖——该领域最高荣誉之一——有力竞争者的工作。
“我要么得去读那些可能不正确的粗制滥造之作,要么等其他人也这么做,要么等有人将它们形式化,然后我才能确定这些结果是否正确。”
斯坦福数学家 Jared Duker Lichtman 表示,他会把“数十项”成果归入这一类,包括向黎曼猜想取得的进展、Hodge 猜想的一个特殊情形,以及四维 Kakeya 猜想的解决。这些都是数学中的重大难题。黎曼——可以说是整个学科中最臭名昭著的未解难题——和 Hodge 都位列七个著名的千禧年大奖难题之中。它们分别关乎素数的分布,以及(粗略地说)如何用更简单的构件来理解复杂的几何形状。与此同时,Kakeya 大致问的是,要让一根针或铅笔朝各个方向旋转,所需的空间能有多小。三维 Kakeya 的证明正是纽约大学数学家王虹今年早些时候被授予菲尔兹奖的成果之一。
“并不是说这些只是没人听说过的无聊小问题,”数学家 Scott Armstrong 说。“其中许多都是非常著名的问题,很多人已经尝试了几十年。”
随着尘埃开始落定,数学家们发现自己面对的是一片已经骤然改变的地貌。他们中的许多人刚刚目睹多年的工作和精心制定的研究计划在瞬间化为乌有,或者认识那些遭遇了这种情况的同事。在整个领域,无论反应中夹杂着兴奋、恐惧、绝望,还是介于其间的东西,都有一种深深的迷失方向之感。
到第二天早上,这种情绪并没有太大改变。Armstrong 在穿过巴黎时通过电话表示,他想像如果索邦大学没有因持续的学生抗议而关闭,他的同事们正围聚在往常的咖啡机旁,那么气氛会相当“肃穆”。
在苏格兰,圣安德鲁斯大学数学教授 Colva Roney-Dougal 描述了同事和学生之间类似的黯淡气氛。她说,这场洪流感觉有些“可怕”,但在数周的不确定性之后,它的到来也带来了一些解脱。“我有一群朋友和同事的经费申请刚刚被彻底抹掉,”她说。
“我有一群朋友和同事的经费申请刚刚被彻底抹掉。”
Armstrong 说,他知道有一个团队,其整个研究计划几乎被这次发布“抹掉”了。与此同时,曾处于 OpenAI 早先关于 Navier-Stokes 问题争议中心的纽约大学数学家 Tristan Buckmaster 表示,他已经听说“有三个人整个研究计划都被摧毁了”。
在 The Verge 与数学家的交谈中,类似的故事反复出现,尽管这种 disruption 在该领域的某些方向尤为集中。苏格兰赫瑞瓦特大学数学教授 Francesco Fournier-Facio 表示,概率论、组合学和理论计算机科学的研究人员似乎“尤其震惊”,并补充说,他所在领域中的群论等一些方向已被“推平”。
Armstrong 和其他研究人员表示,一些领域似乎是以近乎军事级的精确度被瞄准的。“确实有一些目标,”Armstrong 说。他特别指出了 Wang 今年获得菲尔兹奖的领域,以及几个千禧年大奖难题。他说,数学物理领域的一组成果清楚表明,OpenAI 正在研究 Yang-Mills 理论——这一支撑现代粒子物理学诸多内容的数学框架——及其未解决的“质量间隙”问题,该问题是七个大奖难题之一。
在其他地方,研究人员对自己工作似乎很少被触及表达了一种惊讶的宽慰。Roney-Dougal 说,她自己所在的那个领域角落——主要围绕群论——似乎相对未受波及。她开玩笑说,幸好她研究的是一个“非常不时髦的领域”,不过后来她发消息说,在发现自己工作被其中一篇论文引用后,她感到“不确定”。
Joshi 同样发现,与自己主要聚焦于可积系统——一类可以精确求解的复杂系统——的工作重叠很少。她推测,这可能是因为她的领域较少由长期存在、被正式表述的猜想和定义驱动,而更多由随物理学发展而起伏的问题驱动。
截至 10 月 8 日,该记录已经列出了大量更正,包括对十几篇手稿的修订,以及因所谓“符号错误”使某项论证失效而撤下三篇论文。
无论他们自己的工作是否受到直接影响,大多数接受 The Verge 采访的数学家都感到,这个领域已经跨过了某种门槛,不再是一天前的样子。普林斯顿高等研究院研究员 Constantin Kogler 称之为“数学史上最重要的单一时刻”,而伦敦数学科学研究所研究员 Yang-Hui He 则回溯数千年,将今年 AI 驱动的发展比作欧几里得《几何原本》的出版——那是该学科最具影响力的著作之一。
很少有研究人员的评价如此宏大,但人们普遍认为,数学正在迅速变化——数学工作者也必须随之改变。
OpenAI 知道这次发布将带来颠覆性影响,并做出了一些努力来缓和冲击并与数学界接触。在今年早些时候与研究人员发生多次激烈交锋后,该公司转向数学家本人寻求帮助,与新成立的数学与人工智能咨询小组(AGMAI)合作,探讨如何负责任地发布这些成果。
AGMAI 已经 阐明 了它认为负责任的参与方式。AI 实验室最好发布“人类能理解”的论文,或者提供必要的“支持,以进行额外的数学活动,使人类能够理解和吸收其 AI 生成的数学输出,并识别其可能的应用。”他们表示,在可能的情况下,证明应该形式化,公司应公开他们用来创建这些证明的模型和提示。该组织还敦促 AI 实验室停止将数学发布视为“推广其模型的营销工具”,并应“停止在专有模型上测试高级数学问题”,这些模型对更广泛的科学界来说是无法访问的。
“并不是说这些只是没人听说过的愚蠢问题。其中许多是非常著名的问题,许多人已经尝试了几十年。”
OpenAI 遵循了该组织的一些建议。它表示将围绕其在数学方面的工作资助一系列研讨会和会议,以帮助社区处理和理解其工作,尽管它没有提供这些活动可能是什么样子或何时举行的细节。该公司还披露了比以往发布中更多的信息——研究人员再次表示,这是一个低标准——包括其模型尝试了 4000 多个问题,一个典型结果使用了大约三个小时的 ChatGPT Pro 思考计算。它还实施了“论文修订和引用协议”,并在 GitHub 上表示它“将保留公开的发布历史”。截至 10 月 8 日,该记录已列出许多更正,包括对十几篇手稿的修订以及因“符号错误”而删除的三篇论文,该错误称其使一个论点无效。OpenAI 没有公开回应 The Verge 对更多细节的请求。
这一变化解决了与数学家产生摩擦的一个关键根源,其中一些人谈到围绕该公司公布的声明有一种“偏执”。该公司有 习惯 在回应批评时暗中修改新闻稿和论文,而不明确披露这些更改。
但 OpenAI 并没有遵循该组织的所有建议——包括一些最重要的建议。它没有指明发布背后的模型,也没有披露使用的提示或模型尝试的完整问题集。OpenAI 似乎也承认其形式化工作有所欠缺——它表示将在获得更多形式化后添加——并且论文质量不达标,称“对于未来的发布,我们致力于通过引用、数学阐述和结果展示进一步提高论文质量,以便更好地理解。”
“我最了解的那个问题的写稿在快速阅读后几乎毫无意义。”
接受 The Verge 采访的研究人员质疑为什么 OpenAI 不能提高这些论文的质量,并对它似乎懒得提前形式化——甚至检查,在撤稿论文的情况下——许多结果表示失望。诸如使用的提示之类的信息也会非常有用,可以减轻许多人认为评估该公司突然抛给他们的海量材料的负担。
最重要的是,该公司表示没有计划停止在数学问题上测试其模型,并暗示它认为这样做是一种必然。"我们希望直接赋予科学家最先进的能力,并正在努力负责任地发布产生这些结果的模型,"它在宣布最新结果时表示。"这就是为什么继续在数学和其他科学领域评估我们的内部前沿模型很重要,这样我们才能加速开发推动这些领域进步的工具。"
在 OpenAI 公布其结果后,AGMAI 称该发布是"第一步",并再次呼吁公平获取算力和研究工具。更根本地,该组织认为"数学研究的未来不能仅仅是理解 AI 实验室产生的结果。"
尽管 OpenAI 声称解决了数百个长期存在的问题,但数学家们表示还有大量工作要做。许多人估计,理解该公司刚刚发布的所有内容可能需要数学界花费数年时间。
Armstrong 将如此多新数学的突然涌现比作一次短暂的外星访问可能引发的骚动。"如果 AI 现在消失了,就像外星人来到地球然后离开了一样,我们会在接下来的 10 年里研究这些,试图理解一切。"
其中很多工作本身就令人兴奋。研究人员将不得不填补空白、提取有用的想法和联系,并将解决方案置于更广泛的数学背景中,所有这些通常与为人类产生解决方案相伴而行。"对于许多这些结果,相关专家非常关心解决方案,我相信他们能够消化并呈现给更广泛的世界,"Lichtman 说。他认为,随着 AI 改变这些领域,解释、验证和背景化结果的工作需要得到更多重视。"作为一个社会,我们应该更多地奖励这些消化工作。"
留给人类去做的数学可能还有很多。据他所知,Lichtman 说所有结果,尽管"令人惊叹",都"来自现有的方法和技术"。它们填补了已知数学版图的某些部分,而不是创造全新的领域。"事实证明,需要填补的空间比专家们之前知道的要多得多!"Lozano-Robledo 呼应了这一观点:"他们都在以非常巧妙的方式使用现有技术。"
而现有的版图几乎不是极限。"数学研究本质上是无限的,"Lozano-Robledo 说。"研究将继续下去。"伦敦研究所的 He 表示,他特别兴奋地看到接下来会出现什么,并推测研究人员最终可能会创造出新的想法,"甚至可能是新的数学领域"。
这些公司似乎准备立即继续前进,远在数学界有任何合理机会消化他们所产生的内容之前。
The Verge 采访的数学家中很少有人原则上反对 AI 产生新数学。事实上,许多人对此表示欢迎,并在不同程度上表示他们是 AI 工具的狂热用户。大部分不安针对的是构建这些工具的 AI 公司进入他们领域的方式。
看看 OpenAI 和其他 AI 实验室发布的数学成果,你会觉得研究数学基本上就是把问题从清单上一项项划掉。AI 实验室公布结果的方式强化了这一印象:一场炫目的发布会、一份初步的文稿,剩下的就扔给数学家去弄明白并加以阐释。多位研究人员告诉 The Verge,这些公司似乎立刻就准备翻篇了,而学界根本还没来得及对他们产出的东西进行合理的消化。
研究人员形容这是对数学研究实际运作方式的贫乏理解。解答固然重要,但通往解答过程中的一切同样重要:发展想法、建立联系、发现新问题或开辟其他研究途径。当 OpenAI 这样的公司只是找到答案而不做任何周边工作时,数学家们说,这些工作的负担就落回了学界身上。
“有新结果当然是好事,但这个规模是另一个层级,”波兰波兹南密茨凯维奇大学的数学家 Bartosz Naskręcki 说。“这是一团大乱麻,”他说。“它可能导致学术文化的巨大崩塌,甚至直接扼杀大多数院系。这是一个社会问题,而 AI 实验室似乎完全无视这个问题。”
需要数年才能理解的不仅仅是数学本身。研究人员也在艰难地思考这场剧变对他们意味着什么。许多人描述了一种笼罩着学界的黯淡、近乎存在主义式的情绪,因为数学家们在弄清自己在快速变化的领域中处于什么位置。他们可能没有多少时间来想清楚。
数学家之间已经在流传关于 OpenAI 进一步发布的传闻,而 OpenAI 没有回应 The Verge 关于是否还有更多发布计划的问题。
Roney-Dougal 说,她害怕又一次发布——或者害怕 Anthropic 或其他 AI 实验室加入战局。
这场冲击对博士生、初级研究人员以及其他没有终身教职的人打击尤其沉重。像 OpenAI 的模型正在横扫的那些开放问题,可能支撑着博士论文、经费申请、求职材料和多年规划的研究,而这些都是学术生涯的重要基石。几位研究人员描述了一种日益弥漫的焦虑:他们赖以为事业根基的工作可能突然成为下一个目标,而且 AI 模型在关闭一些路径的同时,几乎不产生未来探究的新途径。“对于经费即将到期或正在找工作的人来说,这极具破坏性,”瑞士苏黎世联邦理工学院的数学家 Simon Machado 说,他即将加入法国国家科学研究中心(CNRS)。
“数学研究本质上是无限的。研究将继续下去。”
士气可能尤其低落,因为一切都让人感觉没完没了。OpenAI 的发现一波比一波大,其间几乎没有停顿,而且公司频繁暗示还有更多即将到来。“你会感觉到他们其实并不在乎这些单个结果,”Roney-Dougal 说。“这是一种非常难受的感觉。”
数学家们还没来得及消化一组结果,下一组更大的结果就砸了下来。“再过两个月就会有东西把这一切彻底盖过去,”Armstrong 说。“这就像,越来越大的一轮又一轮轰炸。”
Armstrong 说,他认为自己属于对 AI 最热情、最乐观的数学家中一员。他在自己的工作中使用这项技术,并认为它潜力巨大。但即便是他,也越来越感到不安。“晚上有点难以入睡,”他承认道。
当被问及接下来打算做什么时,Armstrong 不太确定。仍在巴黎街头走去吃午饭的他表示,他的当务之急是完成他一直在做的一些工作——有时借助 OpenAI 的 Codex 帮忙——“赶在 OpenAI 抢先我们之前。”
除此之外,就连这位自称的 AI 乐观主义者也不确定,并质疑数学领域对他来说还有怎样的未来。他尤其担心该领域的年轻研究者。“数学界接下来的几年会非常怪异,”他说道。
关注本报道的话题和作者,以便在个性化主页信息流中看到更多类似内容,并接收邮件更新。
- Robert Hart
来源:The Verge:订阅版科技 · theverge.com