AI科研能力新基准:最强模型论文复现率仅13.98%,揭示端到端科学验证短板

2026/10/08 17:28阅读量 3

UniPat AI发布PaperBenchX基准测试,评估AI在真实科学环境中的端到端论文复现能力。结果显示,表现最强的GPT-6 Astra完整复现率仅为13.98%,暴露出当前AI在建模、执行与验证环节的系统性不足。该基准通过隔离重跑和证据溯源机制,首次量化了AI从“解题”到“可靠科研”的距离。

事件概述

尽管OpenAI等机构近期展示了AI破解千禧年数学难题(如N-S方程)的能力,但在更广泛的科学研究领域,AI能否进行可靠的端到端复现仍存疑。UniPat AI发布了首个多学科端到端论文结果复现基准PaperBenchX,旨在衡量AI Agent在真实科学工作流中的表现。测评显示,即便是在数学推理上表现优异的模型,在复杂科学复现任务中也面临巨大挑战。

核心信息

  • 评测结果:在93个涵盖电磁、光子、化学、材料等12个研究方向的复现任务中,表现最强的模型GPT-6 Astra完整复现率仅为13.98%。这意味着不到七分之一的任务能从头到尾生成可验证且与论文一致的证据。
  • 瓶颈分析:
    • 阶段得分差异:Agent在建模(平均62.70%)和执行(平均61.84%)环节表现尚可,但在验证环节得分骤降至42.80%。这表明Agent难以将各环节串联以完成可信复现。
    • 交互效率低:长时间运行往往伴随反复尝试或错误设定下的无效计算,交互轮数多并不等同于高分。
    • 前期决策关键性:如Fable 5模型虽前期投入时间占比高(37.1%用于论文重建),但能更高效地取得部分得分,说明合理的科学建模和参数选择决定了后续计算的价值。
  • 技术挑战:与机器学习代码不同,科学仿真涉及复杂的物理模型、边界条件设置及收敛判断。错误的参数可能导致看似合理但科学上无效的数值结果,且缺乏像Lean那样的自动证明兜底机制。

PaperBenchX的设计与差异化

PaperBenchX并非简单的代码执行测试,而是构建了一套严谨的科学验证范式,其核心设计包括:

  1. 真实科学软件环境:覆盖Ansys HFSS、Meep、PySCF等10种领域原生求解器,要求Agent直接面对学科特定的参数体系和计算流程。
  2. 隔离重跑机制:Agent提交工作流后,系统删除所有输出并断网,在隔离环境中重新执行。只有能重新生成的科学产物才进入评分,杜绝手动拼凑或依赖缓存。
  3. 三层验证体系:
    • 可重跑性:过滤掉无法独立运行的任务。
    • 证据溯源:要求提供完整的计算过程和诊断记录,确保结果可追溯。
    • 科学性判定:结合程序自动检查(如数值一致性)和大模型评审(如领域知识判断),确认结果在科学上站得住脚。
  4. 时间预算约束:单任务预算4-24小时(中位数7小时),模拟真实科研中的资源取舍和决策过程。

值得关注

  • 开源情况:UniPat AI已开源12个代表性测试任务,覆盖不同研究方向和软件栈,供社区评测Agent和调试工作流;其余81个任务保持封闭以维持评测有效性。
  • 行业意义:该基准揭示了当前AI Agent距离成为“General AI Scientist”仍有显著差距。它强调了衡量AI科研进步的标准应从“解决孤立问题”转向“完成可验证的完整科学工作流”,即具备“读懂科学、执行科学、判断科学”的综合能力。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。