每题200美元攻克数学世纪难题,AI科研范式正被重写

2026/08/03 19:13阅读量 2

OpenAI新一代模型Astra以约2000美元推理成本攻克十道数学与理论计算机科学前沿难题,平均每题200美元,全部通过Lean形式化验证并开源。AI数学能力在八个月内完成从文献检索到独立原创证明的跃迁,DeepMind、北大AI4Math等团队同步推进,科研边际成本从百万美元级降至百元级,基础科学发现范式正被重塑。

事件概述

OpenAI确认,其下一代模型Astra以约2000美元推理成本攻克十道数学与理论计算机科学前沿难题,平均每题约200美元,涵盖高维球堆积、编码理论、群论、量子复杂性和极值组合学等领域,每道题学术积压均超十年。全部成果通过Lean形式化验证,代码已开源至GitHub。

需要说明的是,这十道题是从多次尝试中筛选出的成功案例。据OpenAI披露,模型早期探索存在大量失败,GPT-5.2 Pro对Erdős问题的一次通过率仅1%—2%。Astra呈现的是“成功精选集”,而非全面碾压。即便如此,其标志性意义在于:AI已从“解已知答案的题”跨越为“产出人类也未知的原创证明”。

能力跃迁:从文献检索到独立发现

AI数学能力的进化曲线记录了这次范式转变:

  • 2025年10月,OpenAI宣称GPT-5解决十个Erdős问题,后被澄清为文献搜索——在已有论文中找到未被数据库收录的解答,并非原创证明。
  • 2026年1月,软件工程师Neel Somani用GPT-5.2 Pro生成Erdős问题#397的原创证明,经Harmonic的Aristotle系统完成Lean验证,陶哲轩确认该论证不存在于此前文献。随后#728、#729号问题在数日内相继被攻克。
  • 2026年5月20日,OpenAI内部通用推理模型推翻自1946年提出的平面单位距离问题核心猜想,借用代数数论中Golod-Shafarevich定理构造反例族,实现多项式级别改进。Tim Gowers称之为“AI数学的里程碑”。
  • 2026年8月,Astra以2000美元解决十题。

从GPT-5的“查资料”到GPT-5.2的“原创三题”,再到5月模型“推翻80年猜想”、Astra“2000美元横扫十题”,八个月完成从“图书馆管理员”到“独立研究者”的跃迁。

多智能体协同与全球竞争

Astra的核心不是参数规模更大,而是组织方式根本不同:多个智能体协同工作,由协调者将问题拆解为子命题,分配给不同专长的子智能体并行执行,再由验证智能体筛选、合并、检查逻辑一致性,可连续推进数小时甚至数天。Anthropic的Managed Agents、OpenAI的Agents SDK、微软Agent Framework 1.0、LangChain的supervisor-as-tool均指向同一共识:管理者分配任务、执行者交付结果,优于多个AI自由讨论。

全球范围内同类进展密集:

  • Google DeepMind的AlphaProof Nexus自主解决9个Erdős开放问题,最早一题困扰学界56年,单题成本最低7.5美元。
  • 北京大学AI4Math团队用双智能体框架(Rethlas+Archon)推翻Anderson猜想,生成约19000行Lean代码,完成国内首次AI自主解决数学开放问题并大规模形式化验证。
  • Math Inc的Gauss在5天内完成8维(E8)球堆积定理形式化,再用约一周完成24维(Leech格)情形,产出约20万行Lean代码;原人类团队估计剩余工作量需6个月。
  • Anthropic、字节跳动Seed-Prover、月之暗面Kimina-Prover、DeepSeek-Prover-V2等也在推进神经定理证明自动化。

信任锚点:Lean形式化验证

Lean是由微软研究院开发的交互式定理证明器,将数学证明写成可被计算机逐行检查的代码,验证结果“非对即错”。Astra十项成果的GitHub仓库中“sorry”计数为零,意味着无任何步骤遗漏。Lean提供了独立于AI的“终极裁判”,人类无需逐行审阅数千行推理,只需确认编译器通过。

生态数据:据Mines Paris PSL官方数据,Lean数学库Mathlib已积累约210万行代码、超27万条形式化定理;Meta的ATLAS项目消耗1830亿token,将26本数学教材翻译为Lean代码库。

产业界已率先买单。芯片验证领域,Axiom Math的AxiomProver在2025年12月Putnam数学竞赛获满分12/12,2026年3月以超16亿美元估值完成2亿美元A轮融资;密码学领域,形式化验证被用于后量子密码原语安全性证明;生物医药领域,“靶点-疾病”因果链推演迁移进入早期探索。

成本崩塌与连锁影响

2000美元仅指推理算力的边际成本,不含模型训练(数亿美元级)、基础设施投入和人类研究者的选题与验证时间。传统上,一个Erdős级别开放问题可能耗费顶尖数学家数年乃至数十年,考虑终身教职薪资、研究经费和博士生培养,折算成本在百万美元量级以上。Astra每题200美元,约等于初级软件工程师一周工资。

成本下行趋势明确:2026年5月单位距离问题推理成本约1000美元;8月Astra十题合计2000美元;同期DeepMind单题最低7.5美元。

两大连锁反应值得关注:

  • 密码学冲击波:7月28日,Anthropic披露Claude Mythos Preview在约60小时、10万美元成本内发现NIST后量子签名候选算法HAWK-256的格结构对称性缺陷,将密钥恢复理论工作量从2的64次方降至2的38次方。次日HAWK开发者宣布从NIST标准化进程撤回方案。这是纯粹由AI推理驱动的密码分析,不需要量子比特和超低温冷却。
  • 科研预算结构重配:科研能耗正从实验密集型转向推理密集型,高校计算中心采购将从“更多GPU”扩展为“更多形式化推理管线算力配额”。OpenAI 7月29日推出“ChatGPT学术研究者计划”,向十万名科学家免费提供前沿模型访问,承诺2027年前投入2.5亿美元。

科学家的新任务与验证困境

6月2日,国际数学联盟(IMU)正式背书《莱顿人工智能与数学宣言》,截至撰写时已获超3000人签署,陶哲轩称其为“必要框架”,《自然》6月18日发表社论全面支持。宣言指出AI对数学的五大威胁:不可靠结果、归属缺失、依赖不平等、过度炒作、自主性丧失。

Astra解决的是“证明长期猜想是否成立”的证明型突破;“提出全新交叉方向、需要直觉跳跃的猜想”的概念型突破仍是人类最稀缺的能力。不过,单位距离问题的突破也展现了AI将代数数论工具应用于离散几何的跨域联想能力,被数学家Arul Shankar评价为“具备原创、精妙的独立思想”。人类数学家的工作重心预计将从“产生证明”向上游迁移到“提出好问题”。莱顿宣言的务实建议是:人类研究者选择问题、设定标准、批判想法、验证结果;AI贡献广度、速度和并行探索能力。

陶哲轩在2026年初演讲中判断:“AI将成为数学研究中值得信赖的合作者。”Tim Gowers在5月20日当晚误以为AI“证明”了单位距离猜想,写道“数学家的好日子可能很快就要结束了”;次日得知AI是“推翻”猜想后明确表示“如释重负”。这一细节折射出数学界对AI能力的复杂心态。

更大的挑战在于验证的递归困境:若Astra以每天几十个问题的速度产生候选解,人类同行评议体系无法消化。Lean提供部分答案,但将自然语言证明翻译为Lean代码本身需要成本,AI辅助自动形式化仍在缩小差距。要规模化验证AI的产出,需要AI来自动化验证过程,这又回到“谁来验证验证AI的AI”的递归问题。当AI产出速度超过人类验证百倍以上,最终裁决权可能退化为抽样检查权。

2000美元是一道分水岭:左边是科学发现作为人类智力专属领地的时代——昂贵、缓慢、依赖天才的偶然出现;右边是科学发现被工程化、规模化、定价服务的时代。当数学猜想的边际解决成本降到200美元,它从“科研”变成“查询”,而重新定义成本结构往往意味着产业变革的开始。“什么值得发现、发现之后如何理解、谁来为发现负责”,这些问题仍然只属于人类。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。