
作者 | 许有阳
来源 | 盒饭财经(ID:daxiongfan)
头图及封面来源 | GPT
一个负号,牵动了三份证明。
北京时间 10 月 7 日,OpenAI 在 GitHub 公开了一批内部模型产生的数学结果。首版目录有 722 份手稿,归为 372 个结果家族。本文 10 月 8 日核对的目录中,在列手稿变成 719 份,家族数仍为 372。

其中,一份标注 9 月 18 日、讨论 Weil 类代数性的几何手稿,在撤回说明中写道:"The proof contains a sign error"。意思是 " 证明存在符号错误 "。
这份证明需要把几何交点的正负计数补到零,才能调用后面的定理。原以为某种操作增加正数,实际却增加负数。用简化数值打比方:想做 " 2+2=0",却做成了 " 2 2= 4"。定理的使用条件没有满足,两份借用该构造的手稿也失去支撑。
这批成果也收到了很高的评价。
10 月 7 日,组合数学家吉尔 · 卡莱称这次发布为 " 数学的一个惊人里程碑 "(an amazing milestone for mathematics)。紧接着,他提醒:证明仍需人类数学家核验、消化。
围绕 AI 数学研究的讨论,也早就开始了。
9 月,Claude 的临界渗流证明主张引发讨论;9 月 11 日,陶哲轩等 25 位菲尔兹奖得主作为初始署名者发表声明,承认 AI 数学能力的进步,同时批评企业把解题作为评测竞赛、忽视理解与知识传承的做法。
一边是可能改变领域的重要结果,一边是已经发生的撤回。这些手稿究竟 " 突破 " 了什么?为什么 AI 能批量解开这些曾困住数学天才的难题?

这次,OpenAI 一口气公开的数学材料,内容丰富。
打开 GitHub 上公开资料库,就能看到论文 PDF 和排版源文件,同行还可逐步检查论证。有部分手稿附有 Lean 证明材料——这是把数学命题和推理写成严格代码,交给程序检查。有意思的是,其中还有 10 份删节推理摘要,展示了部分探索过程,包括没有走通的尝试。
这些手稿也可称为 " 预印本 ",一般是作者先公开研究文本,供别人阅读、讨论和检查。预印本中可以有重要成果,但不说明它经过了怎样的外部审查。
OpenAI 称,绝大多数结果来自同一流程、同一个内部模型。如果其中的重要主张得到确认,就意味着同一套模型能力参与了多个数学领域的研究。
公告还把每项结果平均消耗的算力,折算成相当于 ChatGPT Pro 思考 " 大约三小时 "(roughly three hours)。

722 和 719 数的是手稿,372 数的是把相关手稿归在一起的组。OpenAI 把这样的组称为 " 结果家族 "。

我们可以把一个家族想成一个研究资料夹。这个研究资料夹中,它们各司其职,有的文章证明主结论,有的补上其中一个关键步骤,有的把结论推广到其他条件。同时,它们各有一份手稿,在目录里则共用一个家族编号。
也就是说,一篇文章可以有多个结论,一个资料夹也可能回答不同问题。


最大的家族共有 14 篇,它们的关系是?
第 034 族有 14 份手稿,是当前最大的家族,属于代数与复几何。目录里既有一般论证,也有专门处理四维对象的版本。
要理解相关研究为何会分成多篇,可以先看只有两篇的第 088 族。两篇研究的是同一项几何指标,粗略说,与一个形状在各个方向投下的 " 影子 " 有关。
其中一篇研究,什么形状能让这项指标最小。另一篇给出反例,说明原先猜测的最大者并非最大。它们围绕同一个指标,却回答不同的问题,所以归在同一个家族里,又各自写成手稿。
这种成组现象很普遍。372 族中,205 族只有一篇,167 族有多篇。多篇家族不到总数的一半,却包含 514 篇,占当前手稿的约 71%。

按 OpenAI 目录的领域分类逐项统计,372 个家族分布在 17 个领域。最大的七组共 227 族,占约 61%。理论计算机科学 40 族,组合数学 37 族,代数与复几何 36 族,排在前面。
那这些领域分别在研究什么?比如,理论计算机科学,他们研究的是算法需要多少计算。比如,组合数学,主要研究的是离散的东西怎样排列和计数。比如,代数与复几何,主要研究的是方程定义的形状有什么性质


这次 OpenAI 公布的 722 份手稿,其 " 突破 " 到底意味着什么?
我们依据抽读的手稿,可以分出五种贡献。这并非 OpenAI 给出的等级划分,一篇论文也可能兼具几种。
(1)给未知问题一个答案。比如,π 可以被分数不断逼近。这里研究的是:误差相对于分母,能无穷多次下降得多快?新稿声称,衡量这种速度的 " 无理度 " 指标等于 2。
(2)让结论适用于更多情况。研究粒子与电磁场时,已有多类结果要求起始状态足够小,或具有特殊对称。新稿主张,在论文规定的模型和其他初态条件下,可以去掉这两类限制,仍保证解长期平滑存在。
(3)越过一条被猜测无法突破的界线。比如,整数越长,乘法需要的计算步骤通常越多。新稿声称,在同一固定机器模型下,步骤数的增长可以比长期猜测的极限更慢。
(4)补上许多结论共同依赖的前提。比如,不少研究先假定唯一游戏猜想成立,再据此证明某些算法任务难以达到怎样的近似精度。新稿若成立,这些结论就不必继续把它列为未经证明的假设。
(5)给已知答案另一种证明。比如,一份几何反例稿先承认:"Their result already gives a negative answer",也就是前人的结果已经给出否定答案,随后提出直接构造。这里新增的是证明路线,需要看它能否带来更清楚的解释或可供其他研究使用的方法。

这次的公开,究竟 " 突破 " 了什么?
具体到一项成果,我们可以把三件事放在一起对比着看:前人已经证明到哪里,新稿声称推进到哪里,以及它还保留哪些条件。
下面七个案例,按这个顺序展开。

它若成立,就推进了关于计算效率的理论研究,同时真实设备能否因此提速,还要看算法怎样实现,以及计算的整数有多长。


撤回的三篇稿件,分别是《分裂阿贝尔八维簇上 Weil 类的代数性》《K3 曲面 Kuga – Satake 对应的代数性》《K3 曲面乘积的有理霍奇猜想》。
后两篇都涉及一类称为 K3 的曲面,也都用到了第一篇中那项出错构造的改写。
然而,撤回说明并没有宣布原命题为假:这条论证有缺口,不代表命题已经被推翻,也不排除存在另一条有效证明。
这撤回的三稿同属第 032 家族。撤回后,这一族从八篇变成五篇,其中关于 CM 阿贝尔簇的霍奇主稿仍保留。CM 阿贝尔簇是一类具有特殊算术对称性的几何对象。这份留下的主稿,还连接着一项 27 年前的研究。

数学家 James Milne 在 1999 年发表的一篇论文中,证明了一条联系:只要一个猜想成立,另一个猜想就能随之成立。当时还缺的,是前一个猜想本身的证明。
具体来说,就是前者是复数上所有 CM 阿贝尔簇的有理霍奇猜想,而后者是有限域上所有阿贝尔簇的泰特猜想。前一个问题限定了一类有特殊算术对称性的几何对象,后一个问题则进入只有有限个数的运算系统。
这次的手稿声称补上了前一个猜想的证明。如果它成立,就可以接上 Milne 论文中已经证明的联系,推出后一个猜想。新结果的影响因此会超出它直接研究的对象。
10 月 7 日,Milne 在自己的论文目录中加注,提到 OpenAI 的宣布,并用 "it seems",也就是 " 看来 " 描述这一后果。这表明他也注意到了新稿与旧定理的联系。

OpenAI 表示,扩大数学研究测试的起点,是 " 评测趋于饱和 "(evaluations saturated),也就是原有考题越来越难区分模型能力。OpenAI 累计向模型提供约 4000 个研究问题,再筛选、归组输出。
这些它们的共通点是,即使问题尚无已知答案,研究任务也可以写得很明确。一份公开任务列出了研究对象、输入条件、需要证明的结论,以及什么样的反例足以推翻它。
而证明路线则要由模型寻找。
公开的删节推理摘要中,记录了一次设计测试的尝试。这项测试需要让符合要求的答案容易通过,同时挡住不符合要求的答案。然而,模型也发现,一种方案暴露了可被利用的结构,使不符合要求的答案也能蒙混过关。
加入更密集的随机扰动,可以阻止这种蒙混方式,却又降低了本该通过的答案通过测试的概率。模型于是继续寻找——怎样堵住漏洞,又不破坏另一项保证。
于是," 寻找证明 " 更加具象,而不是一个努力中的 " 形容词 "。它们可以拆分为可多次重复的步骤:提出办法,检查它会在哪里失效,再调整路线,当然过程中还会调用前人已经证明的定理。
倒推来看,从这些材料可以看出几项有利条件:目标写得清楚,已有研究提供可调用的工具,部分结果还能接受形式化检查。

除了工具,研究者还需要时间理解这些证明:哪些步骤是关键,哪些方法可以讲给学生,哪些思路能够用于其他问题。
这种讨论和关注,早于这次公布。
9 月 11 日,加州大学洛杉矶分校数学教授、2006 年菲尔兹奖得主陶哲轩等 25 位得主,作为初始署名者发表联合声明。声明承认 AI 数学能力的进步,也强调解题应服务于 " 概念理解与洞见 "(conceptual understanding and insight)。

10 月 6 日,OpenAI 宣布将资助 " 研讨班、会议和专项活动 ",帮助人类理解 AI 产生的重要数学结果。
关于这类支持可以做什么,AGMAI 此前在 9 月 29 日的建议中列出了工作组、暑期学校、学生或博士后资助,以及讲解文章和书籍。它还建议,由既有非营利机构按成熟流程决定资助哪些项目,让理解工作保持 " 由社区自然发展并主导 "。
截止目前,这些安排仍是咨询组的建议。现阶段,OpenAI 已经作出资助承诺,但 10 月 6 日公告尚未列出预算、受资助名单或实施日期,也未确认上述分配机制已经落实。
参考资料:
1.《Sharing AI progress in mathematics》,OpenAI
2.OpenAI 数学成果公开仓库:项目说明、成果目录及修订记录,OpenAI,GitHub
3.《Algebraicity of Weil classes on split abelian eightfolds》撤回说明,OpenAI
4.《Algebraicity of Kuga – Satake Correspondences for K3 Surfaces》撤回说明,OpenAI
5.《The rational Hodge conjecture for products of K3 surfaces》撤回说明,OpenAI
6.《Updates: Sharing AI progress on mathematics ( amazing! ) ; and my lecture plans》,Gil Kalai,Combinatorics and more
7.《Amazing: There is no Percolation at the Critical Probability in all Dimensions》,Gil Kalai,Combinatorics and more
8.《A Severe Misalignment of AI in Mathematics》,陶哲轩等 25 位菲尔兹奖得主初始署名的联合声明,陶哲轩个人博客
9.Comparator 项目文档,leanprover,GitHub
10.《The irrationality exponent of π is 2》,OpenAI
11.《Integer multiplication below n log n》,OpenAI
12.《The Unique Games Theorem》,OpenAI
13.《Quasipolynomial Bounds for Arithmetic Progressions》,OpenAI
14.《The Quasi-Riemann Hypothesis: A Zero-Free Half-Plane Re ( s ) >7/8》,OpenAI
15.《The rational Hodge conjecture for CM abelian varieties》,OpenAI
16.《Global classical solutions of the three-dimensional relativistic Vlasov – Maxwell system》,OpenAI
17.《A product counterexample to the simplex maximum for projection-body volume》,OpenAI
18.《On the Unique Games Conjecture》,Subhash Khot
19.《The Mathocalypse》及文后讨论,Scott Aaronson 个人博客;含 Dana Moshkovitz 读稿经历及其评论
20.《Lefschetz Motives and the Tate Conjecture》,J. S. Milne,1999 年
21.《Mathematical Articles ( with abstracts ) 》及 2026 年 10 月 7 日更新,J. S. Milne 个人网站
22.《Ordinary NP-Hardness at the Basic Semidefinite Threshold》删节推理摘要,OpenAI
23. 数学与人工智能咨询组成员及独立性说明,AGMAI 官网
24.《On OpenAI ’ s Release of Mathematical Results》,数学与人工智能咨询组(AGMAI),2026 年 10 月 6 日
25.《Responsible Release of AI-Generated Mathematics》,数学与人工智能咨询组(AGMAI),2026 年 9 月 29 日
欢迎在评论区留言 ~ 如需开白请加微信:YPYP01234567