OpenAI 公开 700 多篇 AI 数学论文,声称解决多个数十年难题
未发布模型写出的 722 篇论文,声称证明了唯一博弈猜想、马勒猜想,以及黎曼 ζ 函数在实部大于 7/8 处无零点等结果。约 42% 的主结果附计算机形式化证明;次日已有 3 篇因错误撤回,外部审查刚刚开始。
发生了什么
10 月 6 日,OpenAI 在 GitHub 上公开了一个名为 openai/math 的仓库,里面是一个尚未发布的内部模型写出的数学手稿,同时附上部分用 Lean 语言写的形式化证明,以及 10 份模型推理过程的摘要。按仓库说明:
- 发布时手稿数
- 722 篇
- 归为相关结果「家族」
- 372 组
- 评测中向模型提出的问题
- 约 4,000 个
- 有形式化证明的主结果
- 约 42%
来源:openai/math 仓库说明与更新记录,2026 年 10 月 9 日查阅。
据 The Next Web 报道,产出这些结果的,就是 9 月给出纳维-斯托克斯方程证明的同一个内部模型。OpenAI 说,平均每项结果用了大约相当于 3 小时 ChatGPT Pro 的思考算力;绝大多数结果走的是同一套固定流程;OpenAI 对《科学美国人》说,几乎每篇都来自给单个 AI 智能体的一条提示。只有两项例外(黎曼 ζ 函数的一个结果和霍奇猜想的一个特例),其中 11/12 那一版的文字经过人工润色。
OpenAI 研究负责人 Dan Roberts 对《纽约时报》说,在开放问题上测试内部模型是为了做出更好的工具,这些证明是「副产品」(据 The Next Web 转述)。
有多厉害:挑几项来看
722 篇不等于 722 个难题,有些是同一结果的不同证明或推论。真正引人注目的,是目录里点名的几个老问题。下表列出其中几项(「此前状态」根据维基百科等公开资料,「OpenAI 声称」根据仓库目录原文):
| 问题 | 通俗地说是什么 | 此前状态 | OpenAI 声称 |
|---|---|---|---|
| 唯一博弈猜想 | 计算机科学的著名猜想:一大类问题是否连「近似求解」都极难 | 2002 年提出,理论计算机科学的核心未解问题之一 | 证明成立(附 Lean 文件) |
| 准黎曼猜想 | 黎曼 ζ 函数的零点能不能被挡在某条竖线以右之外 | 1899 年以来只知道零点不能太靠近实部 = 1 的那条线,任何固定的「无零点半平面」都没有被证明 | 实部大于 7/8 时没有零点(附 Lean 文件) |
| π 的无理性指数 | π 能被分数逼近得多好 | 猜想等于 2,已知的最好上界约为 7.1 | 证明恰好等于 2(附 Lean 文件) |
| 马勒猜想 | 凸体与其「对偶体」体积乘积的最小值 | 只有二维和三维对称情形被证明 | 所有维度都成立(附 Lean 文件) |
| 霍奇猜想(特例) | 千禧年七大难题之一;这里只是其中一类叫「CM 阿贝尔簇」的对象 | 这类对象上只知道零星特例 | 对这一整类成立(无 Lean 文件) |
| 自由群因子同构问题 | 算子代数里几种基本对象是否其实一样 | 数十年来该领域最著名的未解问题之一 | 它们全部同构(附 Lean 文件) |
| 卡普兰斯基直接有限猜想 | 某类代数中「左逆一定是右逆」吗 | 1970 年代以来只在部分情形(如特征 0)被证明 | 构造反例,推翻了这个猜想(附 Lean 文件) |
哪些地方还不确定
已经出现错误。 发布第二天(10 月 7 日),OpenAI 在更新记录中撤回了 3 篇手稿:一篇关于「分裂阿贝尔八维簇上的韦伊类」的论文中,一个符号错误使关键论证失效,连带影响依赖它的另外两篇(其中一篇声称证明了 K3 曲面乘积的霍奇猜想)。另有 14 篇修补了证明、修正了命题或引用。
大部分结果还没有人仔细读过。 据 The Next Web 转述:
- 纽约大学数学家 Tristan Buckmaster(他曾与 OpenAI 就纳维-斯托克斯问题发生署名争议)对《纽约时报》说,他怀疑 OpenAI 是否检查过同时发布的这么多结果:「我认为他们根本没有做足应有的核查。」
- 麻省理工学院数学家 Andrew Sutherland 对《科学美国人》说,在其他人能运行这个模型、重复这些结果之前,应把它们视为未经验证。
数学界对发布方式有意见。 设在普林斯顿高等研究院的独立顾问组 AGMAI 曾为这次发布提供建议。它在 9 月 29 日的准则中要求 AI 实验室「停止在专有模型上测试高等数学问题」,并公开每个结果使用的提示词、耗时和算力成本。10 月 6 日它又声明:提供建议「不应被理解为对这些结果影响力的判断,或对 OpenAI 获取结果方式的背书」,「这次发布是人类理解这些工作的开始,而不是完成」。
模型没有公开。 外界无法用同一个模型复现结果,也不知道约 4,000 个问题中有多少失败了、失败在哪里。
和上个月的纳维-斯托克斯证明有什么不同
9 月那次是一道千禧年难题、一个团队、约 1 万个智能体、88 小时;这次是同一个模型在数千个问题上批量作答,平均每题几小时。前者像一次集中攻坚,后者更像一份「普查」:它展示的不是某一个突破,而是这个模型能在多大范围内产出看起来像研究论文的成果。也正因为数量太大,人工审查跟不上,成了这次最大的争议。
对普通人意味着什么
- AI 做数学研究的能力已经到了需要严肃对待的程度。 即使最后只有一部分结论成立,也意味着一台机器在几周内产出了相当于许多数学家多年工作的候选成果。
- 「声称」和「确认」之间隔着很长的路。 数学结果要经过同行逐行审读,通常需要数月到数年。看到「AI 解决了某某难题」的标题时,值得先问三个问题:有没有公开证明?有没有独立专家检查过?有没有被撤回或修改?
- 你现在用不到这个模型。 OpenAI 表示正在研究如何「负责任地发布」它,但没有给出时间。
我们会跟进这批结果的独立审查进展,重要结论有了定论再更新本文。