AI基准测试陷入饱和与信任危机:OpenAI停用SWE-bench,业界呼吁引入预算维度
2026/08/26 13:31阅读量 2
随着大模型能力趋同,传统Benchmark基准测试正面临分数饱和、区分度下降及与真实体验脱节的信任危机。OpenAI宣布停止报告SWE-bench Verified分数,Anthropic调整叙事策略,而OpenAI科学家Noam Brown提出应将Token消耗、金钱和延迟等“预算维度”纳入评估体系。学术界对评测可信度的关注也在ICML 2025中显著上升,行业亟需重建评估范式。
事件概述
当前AI领域的基准测试(Benchmark)正陷入饱和与信任危机。由于前沿模型能力快速趋同,传统分数逐渐失去区分度,且高分往往无法转化为用户可感知的体验提升。OpenAI近期宣布不再报告SWE-bench Verified基准测试的分数,这一举动标志着评估范式的潜在转变。与此同时,业界开始呼吁在评估中引入算力预算维度,以反映模型在资源约束下的真实效率。
核心信息
1. Benchmark沦为“消耗品”,分数与体验脱节
- 能力趋同导致饱和: 斯坦福《AI Index报告》指出,当模型间能力差异缩小,用于评估的工具难以保证有效性,基准测试趋于饱和。独立测试结果也常无法印证开发者报告的情况。
- 体验无显著变化: 尽管新版模型分数刷新频繁,但用户普遍反馈实际使用体验并无大幅改善。这种“分数通胀”削弱了公开排名的公信力。
- 数据增长放缓: OpenAI观察到,在软件工程能力基准测试SWE-bench Verified上,模型性能提升明显放缓,过去6个月内准确率仅从74.9%提升至80.9%。
2. OpenAI停用SWE-bench,历史重演
- 短期退役: OpenAI宣布停止报告SWE-bench Verified分数,该基准测试被使用的时间不足两年。
- 历史先例: 这一现象类似于2017年Chrome浏览器退役其打造的JavaScript引擎基准测试套件Octane。技术历史上,当基准测试无法有效区分产品优劣或引发过度优化时,退役是常见选择。
3. 现实场景复杂性挑战现有评估体系
- 局限性与不匹配: 尽管Benchmark数量激增(涵盖语言、数学、代码、多模态等),但每项测试在数据、方式和反馈机制上均有局限。测试结果不等于真实环境表现,导致用户质疑“高分与我何干”。
- 针对性优化问题: 厂商针对特定基准进行的优化进一步降低了分数的通用参考价值。
4. 业界新方向:叙事管理与预算维度
- Anthropic的策略调整: 在发布Sonnet 5时,Anthropic不再与其他竞品直接对比,而是仅与自家历史版本比较。这被视为一种有意识的“叙事管理”,旨在避免无效的横向分数竞争。
- OpenAI的科学倡议: OpenAI推理研究科学家Noam Brown提出,当前Benchmark缺乏对“预算”的考量。他主张将Token消耗量、金钱成本和延迟作为X轴,把模型性能绘制为算力预算的函数。例如,在固定预算下,GPT-5.5比GPT-5.4表现出更强的效率优势,即便两者在最大算力下表现持平。
5. 学术关注点转移
- ICML 2025趋势: 在机器学习顶会ICML 2025的立场论文中,关于评估和基准的论文占比超过1/4,成为仅次于安全与对齐的第三大主题。
- 聚焦核心问题: 学术研究正聚焦于基准的可信度、评估的实用价值以及验证困境,反映出行业对现有评估标准的不满和迭代需求。
值得关注
基准测试的价值并未消失,而是在发生角色转换。在模型研发和企业部署验证环节,内部基准仍具不可替代性。然而,当基准从“工程手段”异化为“营销工具”时,争议的消散依赖于评测标准的迭代和行业规则的重建。未来,能够结合预算约束、反映真实应用适配能力的评估体系,将成为衡量模型实力的关键指标。
