FrontierMath Tier 4 饱和:GPT-6 Astra 攻克最后一道研究级数学难题
2026/09/12 15:33阅读量 3
OpenAI 的 GPT-6 Astra 模型成功解决了 FrontierMath 测试中最后一道未被攻破的 Tier 4 题目,标志着该层级所有 43 道题均已被 AI 至少解出一次。这一进展使得曾被视为“大模型数学噩梦”的研究级防线被彻底刷穿,但项目方已转向更具挑战性的开放问题(Open Problems)和形式化验证领域。
事件概述
2026年9月12日,Epoch AI 宣布 FrontierMath Tier 4 测试达到“饱和”状态。此前唯一未被 AI 成功解答的一道难题,被 OpenAI 发布的 GPT-6 Astra 模型攻克。至此,这套由数学家设计、旨在测试前沿模型极限的研究级数学基准测试中,所有题目均已出现过至少一次成功解答。
核心数据与进展
- 最终成绩:GPT-6 Astra 在 FrontierMath Tier 4 上的准确率为 97.6%。虽然未达 100%,但根据 Epoch AI 的定义,“饱和”指累积不同模型和时间的尝试后,题库内每道题均有成功记录。Astra 补全了最后缺失的一环。
- 时间跨度:Tier 4 于 2025 年 7 月推出时,最高正确率仅约 5%;经过一年零两个月的迭代,该层级已被完全跨越。
- 解题质量:马凯特大学数学副教授 Jay Pantone 指出,以往 AI 常通过数值捷径绕过复杂推理,而此次 Astra 的解法与人类数学家的思路高度接近。
背景与挑战
- Tier 4 的构成:该层级包含 50 道原题,覆盖分析、数论、组合数学、拓扑及代数几何等领域,由数学教授和博士后基于短期研究成果压缩而成。2026年6月版本修正并移除了部分题目后,剩余 43 道题。
- 历史对比:在 Tier 4 发布初期,所有模型历次测试累计仅解出 3 题,且依赖未充分论证的假设。当时出题人甚至预估部分题目可能几十年内无法被 AI 解决。
- 其他模型表现:在 GPT-6 Astra 之前,GPT-5.6 Sol 达到 83.0%,Claude Fable 5 达到 90.2%,显示出模型能力的快速跃升。
未来方向
尽管 Tier 4 被刷穿,但这并不意味着 AI 已完全掌握数学。FrontierMath 项目已启动下一阶段评估:
- Open Problems:直接引入尚未被数学界解决的真正开放性问题。
- FrontierMath Erdős:要求 AI 将 Erdős 开放问题形式化进 Lean 证明助手,并输出可通过形式化验证的完整证明。
在最新的 FrontierMath Erdős 测试中,Astra 在 68 道问题里仅解决了 2 道,表明在严格的形式化证明和真正的前沿探索上,AI 仍面临巨大挑战。
