AGI是否已至?GPT-6 Astra高分背后的定义分歧与叙事博弈

2026/09/08 20:30阅读量 2

OpenAI发布GPT-6 Astra后,其总裁及英伟达CEO黄仁勋相继宣布“AGI时代到来”,但内部及评测团队对此存在显著分歧。GPT-6 Astra在ARC-AGI-3上取得99.9%的高分依赖于专用适配框架,裸机能力仅62.7%,且在复杂现实任务中表现不稳定。各科技巨头对AGI的定义迥异,导致技术评估标准不一,“AGI到来”更多被视为影响资本与市场预期的商业叙事,而非明确的单一技术拐点。

事件概述

2026年9月3日,OpenAI发布新模型GPT-6 Astra,总裁格雷格·布罗克曼(Greg Brockman)随即表示“欢迎来到AGI时代”。三天后,英伟达CEO黄仁勋进一步强调从ChatGPT到GPT-6 Astra仅用四年,宣称“AGI已经到来”。然而,OpenAI CEO山姆·奥尔特曼此前曾称AGI为“定义模糊的词”,负责关键评测的ARC Prize团队也明确表示不声称该模型即为AGI。这一矛盾揭示了当前行业对AGI缺乏统一共识,且“AGI到来”的宣告更多涉及商业叙事与资本预期。

核心信息:性能表现与评测争议

1. 高分背后的框架依赖
GPT-6 Astra在ARC-AGI-3评测中获得99.9%的得分,但该成绩需接入OpenAI提供的专用适配框架。该框架允许模型保留跨请求的隐藏推理状态并利用上下文压缩延续探索经验。若使用ARC Prize提供的标准测试框架,其得分仅为62.7%。这表明99.9%反映的是经过专门优化的完整系统能力,而非单个模型的裸机能力。

2. 复杂任务中的局限性
尽管在高难数学测试(FrontierMath Tier 4, 97.6%)和计算机操作测试(OSWorld 2.0, 72.6%)中表现优异,但在更接近真实办公流程的AutomationBench中得分降至41.4%,在复杂专业任务测试Agents’Last Exam中也仅得59.3%。数据显示,当任务规则清晰、答案可验证时,模型表现接近或超越人类;但在流程冗长、目标模糊的现实环境中,仍频繁失败。

行业现状:AGI定义的多元视角

目前主要科技公司对AGI的定义决定了其产品路线与资源分配:

  • OpenAI(经济导向):将AGI定义为“在大多数具有经济价值的工作上超越人类的高度自主系统”。重点在于覆盖广泛工作、表现超人类及高度自主性,意识与情感非必要条件。其产品线(如推理模型、智能体、Codex)均指向让AI承担更完整工作并转化为生产力。
  • Anthropic(风险绑定):CEO达里奥·阿莫迪倾向于使用“强大的AI”一词,描述能在多数重要领域达到顶尖专家水平、独立执行长时间任务并可大规模复制的系统。其战略重点是将能力扩展与风险治理同步升级,关注滥用与失控风险。
  • Google DeepMind(多维测量):通过《Levels of AGI》将通用智能划分为五个等级,并拆解为感知、生成、注意力等十个认知维度。旨在建立统一尺度,识别能力缺口,并通过设立奖金征集薄弱维度的测试方案。

深度分析:叙事之争与技术拐点

1. “AGI到来”作为商业叙事工具
“AGI时代到来”是一种将零散的技术进步压缩为历史节点的叙事策略。对于争夺用户、人才和资本的公司而言,这种表述比详细罗列评测数据更具传播力。黄仁勋的表态隐含了“大规模算力投入→智能跃迁”的因果链,旨在强化英伟达作为AI基础设施首选合作伙伴的地位。事实上,黄仁勋曾多次在不同时间点暗示AGI临近,显示其作为影响市场预期的叙事资源的属性。

2. 平滑融入而非陡峭拐点
知名AI研究者Andrej Karpathy指出,AGI不会带来陡然拐起的曲线,而是平滑地融入已有的增长中,事后甚至难以找到明确的拐点。这意味着AGI的实现可能是一个潜移默化的过程,而非某一次模型发布或单一评测纪录所标志的瞬间突破。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。