OpenAI发布GPT-6 Astra宣称AGI时代到来,测试数据争议与商业压力并存

2026/09/05 16:21阅读量 2

OpenAI发布旗舰模型GPT-6 Astra,总裁布罗克曼基于ARC-AGI-3测试中99.9%的高分宣布“AGI时代来了”,但CEO奥尔特曼此前称AGI为“营销术语”。该高分在统一中立测试环境下骤降至62.7%,引发学界对单项测试能否定义AGI的质疑。此举被视为OpenAI在企业市场份额和估值被Anthropic超越背景下,为IPO前重塑技术领先地位而进行的战略宣发。

事件概述

当地时间9月3日,OpenAI发布新一代旗舰模型GPT-6 Astra。联合创始人兼总裁格雷格·布罗克曼(Greg Brockman)高调宣布“欢迎来到AGI时代”,理由是其在ARC-AGI-3测试中取得最高99.9%的成绩。然而,首席执行官山姆·奥尔特曼(Sam Altman)在两天前曾公开表示AGI是“无关紧要的营销术语”,两者表态形成鲜明反差。与此同时,第三方数据显示该模型在统一测试环境下的表现大幅缩水,且OpenAI正面临来自竞争对手Anthropic在商业层面的严峻挑战。

核心信息

1. 测试成绩存在显著差异

  • 高分来源: GPT-6 Astra在OpenAI自有的Provider Adapter框架下,于ARC-AGI-3测试中获得99.9%的得分。该框架允许模型保留内部推理状态并对长对话进行压缩,相当于特定的优化环境。
  • 统一环境表现: 在所有模型使用的中立Standard Harness环境中,GPT-6 Astra的得分仅为62.7%。
  • 第三方评估: 在Artificial Analysis的“智能指数4.1.1”测试中,GPT-6 Astra得分为61.2,低于Anthropic的Claude Fable 5.1(65.7)和Claude Opus 5(63.1),仅略高于上一代GPT-5.6 Sol(60.9)。

2. 能力跃升与局限

  • 复杂场景突破: GPT-6 Astra在电脑操作、软件工程、专业工作自动化及网络安全等复杂场景中表现提升。例如,在ExploitBench网络安全测试中获得100%满分,成为首个达到OpenAI Preparedness Framework中网络安全“关键”级别的模型,能自主发现未知漏洞。
  • 专家质疑: 纽约大学教授加里·马库斯(Gary Marcus)及多位学者指出,AGI需在多个认知领域达到人类水平,不能仅凭单一基准测试的高分就宣称实现。在开放式真实任务中,该模型仍可能暴露大量问题。

3. AGI定义的演变与矛盾

  • 定义多次调整: OpenAI对AGI的定义从2018年的“在经济价值工作上超越人类”,调整为2023年的“总体上比人类更聪明”,再到设定1000亿美元利润的经济门槛(后取消合同约束)。
  • 高层态度反复: 奥尔特曼对AGI的态度经历变化,从认为其早日到来,到近期强调“什么是AGI并不重要”,并批评其为糟糕的术语;而布罗克曼则将其视为精神概念而非合同义务。

4. 商业竞争背景

  • 市场份额流失: 在企业大模型支出方面,Anthropic的市场份额从2023年的12%升至2025年的40%,而OpenAI从50%降至27%。在编程场景,Anthropic占比约54%,OpenAI仅约21%。
  • 营收与估值压力: Anthropic的年度经常性收入(ARR)已超650亿美元,估值达9650亿美元,均超过OpenAI(ARR近600亿美元,估值8520亿美元)。OpenAI 2025年支出约340亿美元,亏损约80亿美元。
  • 市场反应: GPT-6 Astra发布后,OpenAI Pre-IPO衍生品市值飙升21.6%,显示市场对其重新确立技术领先地位的预期。

值得关注

业界普遍认为,尽管GPT-6 Astra在局部任务上接近或达到专家水平,但尚未稳定覆盖“大多数具有经济价值的工作”。在缺乏统一验收标准的情况下,将技术突破描述为“AGI时代到来”,更多被视为强化技术领导者形象、应对上市预期及市场竞争的营销策略,而非技术终点的确认。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。