Claude完成费马大定理首个完整形式化证明,1300万行代码验证350年数学难题

2026/09/05 09:17阅读量 2

Anthropic宣布其模型Claude在11天内完成了费马大定理的首个端到端、可由计算机完整检查的形式化证明。该工程生成约1300万行Lean代码和超过3万个中间定理,规模是核心数学库Mathlib的5倍。项目由清华姚班校友Tianyi Peng主导,通过引入Prove2Me协作平台解决多Agent协作难题,标志着复杂现代数学证明自动形式化的重大突破。

事件概述

Anthropic近日宣布,其AI模型Claude成功完成了费马大定理(Fermat's Last Theorem)的首个端到端、可由计算机完整检查的形式化证明。这一成果仅耗时11天,生成的代码量约为1300万行,包含超过3万个中间定理,最终证明使用了其中约29500个定理。整个工程的规模达到了Lean核心数学库Mathlib的5倍以上。

需要明确的是,Claude并未发现新的数学证明路径,而是将人类数学家Andrew Wiles于1994年完成的经典证明,彻底翻译并转化为计算机可逐行验证的形式化逻辑。这解决了数学界长期以来关于“如何让计算机百分之百确认大型现代数学证明成立”的工程挑战。

核心信息与技术细节

1. 项目背景与意义
费马大定理指出,对于任意整数n>2,不存在正整数a、b、c使得 aⁿ+bⁿ=cⁿ。尽管该命题在1994年被Wiles和Richard Taylor攻克,但传统数学论文依赖人类直觉(如“显然成立”),无法直接被计算机严格验证。形式化证明旨在消除这种不确定性,确保每一步推导均符合公理系统。此前,帝国理工学院Kevin Buzzard团队曾启动一个预计耗时多年的社区项目来推进此事,而此次Claude的成果大幅压缩了这一时间线。

2. 主导团队与架构
该项目由Anthropic研究员、哥伦比亚大学助理教授Tianyi Peng(清华姚班校友、MIT博士)主导。初期尝试使用多Agent并行工作,包括补全定义、攻取引理及拼凑定理等角色,但很快面临状态混乱和协作失效的问题,早期失败尝试留下的非模板代码仅占成品的7%。

3. 关键转折点:Prove2Me平台
项目的成功得益于引入了名为Prove2Me的协作系统。该系统为多Agent提供了类似数学版项目管理的功能:

  • DAG管理:将证明拆解为由定理节点组成的有向无环图(DAG),明确前置条件与后续步骤。
  • 分离管理:将定理陈述与证明过程分开管理,加速Lean编译。
  • 自然语言索引:保留每个定理的自然语言描述,便于Agent搜索和复用已有结果。

结合基于Claude Code的多Agent Harness,系统最终消耗了约60亿个输出Token,内部使用的通用研究模型能力大致相当于Claude Fable 5.1。人类仅提供高层级的优先级提示,大量的定义构建、中间证明及任务拆分均由AI自主完成。

4. 验证标准
最终证明仅依赖Lean的三个标准公理。Anthropic通过比较程序确认,Claude输出的定理陈述与Mathlib中的费马大定理完全一致。这意味着验证权不在模型自身,而在严格的Lean编译器,确保了逻辑的绝对正确性。

值得关注

此次成果不仅是AI在特定数学问题上的胜利,更预示着数学文献形式化进程可能迎来大规模提速。如果像费马大定理这样高度复杂、依赖深厚背景的现代数学成果都能被AI自动搬入形式化系统,过去极度依赖人工、推进缓慢的数学验证工作有望实现自动化突破。此外,这也展示了当前大型语言模型在多Agent协作、长链路任务处理及专业领域知识整合方面的显著进步。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。