OpenAI发布722篇AI数学手稿:争议、错误与学术生态冲击

2026/10/10 20:12阅读量 3

OpenAI于2026年10月7日在GitHub发布722篇由内部模型生成的数学手稿,宣称解决了372个悬而未决的难题,包括黎曼猜想弱化版和平面染色问题。尽管部分成果被评价具有极高含金量,但大量证明存在逻辑错误、无法验证或机器检查不通过,且未经同行评审。此举引发数学界强烈两极分化反应,批评者指责其破坏渐进式研究模式并转嫁验证负担,支持者则认为加速了发现进程,目前学界正面临巨大的甄别压力。

事件概述

2026年10月7日,美国人工智能公司 OpenAI 在代码托管平台 GitHub 上一次性发布了 722 篇数学手稿。这些手稿出自一个未公开的内部 AI 模型,覆盖数论、几何、概率、理论计算机等 17 个数学分支。OpenAI 声称该模型尝试了约 4000 个悬而未决的数学问题,最终在 372 组问题上给出了结果,平均每个结果的算力消耗相当于 ChatGPT Plus 用户思考 3 小时。由于缺乏人类作者署名及同行评审,这一举动在数学界引发了巨大震动和两极分化的反响。

核心信息与争议焦点

1. 高含金量与低可信度并存

  • 重大突破声称: 手稿中关于“平面点集染色问题”的研究将答案范围从已知的 4-7 种压缩至 6 或 7 种;另一项关于“黎曼猜想”的弱化版本证明(声称实部大于 7/8 的区域无零点)被罗格斯大学数学家 Alex Kontorovich 评价为若由人类完成可“立刻获得菲尔兹奖”。
  • 质量堪忧: 截至 10 月 10 日,仅约 42% 的结果通过了 Lean 等交互式定理证明器的机器检查。发布次日,OpenAI 即撤回 3 篇论文(因符号错误导致关键抵消不成立),另有 14 篇进行了修补。多位数学家指出,部分证明含糊不清、无法阅读,甚至机器验证通过的结论与论文原题不对应。

2. 学术验证负担转嫁

  • 人工甄别困境: 由于手稿总量庞大且质量参差不齐,弄清全部内容的预计耗时需数年。OpenAI 表示将继续发布后续手稿,迫使数学家必须在自身研究之余,花费大量精力去甄别哪些是“金子”,哪些是“烂稿”。
  • 形式化验证局限: 虽然 Lean 等工具能检查逻辑严密性,但无法自动确认形式化命题是否与原始数学问题等价,仍需人工核对,这进一步增加了工作负荷。

3. 对数学研究生态的冲击

  • 传统模式受阻: 菲尔兹奖得主陶哲轩批评此举破坏了数学界传统的“露天开矿”式渐进研究模式。传统上,难题攻克后通过报告、研讨班和教科书传承新方法,而 AI 直接给出答案导致方法断层,年轻研究者难以从中学习。
  • 经费与职业危机: 许多博士论文、经费申请和求职材料依赖于解决特定未解问题。手稿的批量发布导致相关方向的经费申请瞬间失效,研究人员担心下一代数学家将失去啃难题的动力,导致知识传承断裂。
  • 抵制与合作暂停: 9 月,20 多位菲尔兹奖得主联名发表宣言,批评 AI 公司将数学难题作为测试考题;10 月 7 日,由 800 多名数学家组成的“人类数学协会”(Association for Human Mathematics)发表声明,呼吁停止与 OpenAI 合作,认为此举仅为“秀肌肉”而非严谨学术。

值得关注

  • 学界态度分裂: 尽管批评声浪高涨,仍有部分学者持乐观态度。多伦多大学 Daniel Litt 等学者认为 AI 加速了发现进程,使研究者感觉“从爬行变为飞行”。法国国家科学研究中心 Scott Armstrong 则表示,当前最紧迫的是尽快完成手头研究,以免被 AI 抢先。
  • 后续影响待定: 面对海量未经证实的手稿,数学界正陷入被动应对状态。如何建立有效的 AI 生成数学成果的审核与整合机制,以及 AI 辅助研究与传统人文主义数学观的冲突,将是未来一段时间的核心议题。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。