AI复现审计揭示顶会论文问题:ICML口头报告仅8篇复现率超八成,99.2%论文被检出错误
2026/08/10 21:58阅读量 2
多起AI Agent论文复现与审计结果显示,顶会论文可验证性堪忧:ICML 2026口头报告中仅8篇能复现八成以上结论;基于GPT-5的检查系统发现99.2%顶会论文存在至少一个客观错误。AI正在成为大规模重审科学文献的新工具,但自动化核查仍需人工把关。
事件概述
近期多项研究利用AI Agent对已发表的顶会论文进行自动化复现与错误检测,结果普遍不乐观。AI不仅开始承担论文验证工作,也可能引发对历史科学文献的大规模重审。
核心信息
- ICML 2026口头报告复现审计:7月22日,一家美国研究审查公司对ICML 2026全部168篇口头报告论文进行系统性复现审计。其中92篇拥有至少5条可验证结论,AI Agent能成功复现超过四成结论的仅34篇,能复现八成以上结论的仅8篇。
- 复现失败原因包括代码缺少关键文件、依赖库版本断裂、运行结果与论文不符,另有4篇论文依赖的模型已下线,导致实验结果永久无法复现。
- 典型问题案例:一篇论文声称“仅训练基础模型0.77%的参数”,但实际开源checkpoint训练了6.31%的参数,相差约8倍;另一篇论文展示的可靠性表格,其开源代码中根本不含相关评判模型,也没有任何生成该表格的脚本。
- Agent Reproduction Challenge:抱抱脸(Hugging Face)与AlphaXiv联合发起针对ICML 2026的挑战赛,邀请研究者用AI Coding Agent自动复现论文,结果同样不乐观。
- GPT-5论文检查系统:2025年底的一项研究,用基于GPT-5的系统检测已发表顶级AI论文的客观错误,平均每篇论文被查出4.7个错误,99.2%的论文至少被标记一个问题。其中数学与公式错误占比最高(54.0%),包括方程式错误、推导逻辑漏洞、证明中的错误假设等。约30.8%的NeurIPS论文和23.8%的ICLR论文包含至少一个可能影响结果解读的实质性错误。NeurIPS论文的篇均错误数从2021年的3.8个上升至2025年的5.9个,涨幅55.3%。
- 历史数据纠错案例:浙江实验室理论化学家Pios用AI预测分子沸点时,发现结果与一份75年前的化学数据库冲突,人工回溯原始文献后确认AI正确;进一步核查还发现一份约一个世纪前、被学界公认权威的沸点测量值也是错的。
值得关注
- 现代科学论文规模已远超个体阅读能力,例如ICLR年度投稿量从2018年的1013篇增至2026年的19619篇。错误一旦被后续文献反复引用,可能沿引用链扩散并形成事实上的错误“共识”。
- AI首次使大规模重审历史文献成为可能,但工具本身仍有局限:以GPT-5驱动的Paper Correctness Checker检测精确率为83.2%,每次检测中约有四成真实错误未被检出,输出结果仍需人工审核。
