AGI定义之争:从评测数据到资本叙事的现实审视
2026/09/09 18:59阅读量 3
随着OpenAI发布GPT-6 Astra及英伟达黄仁勋宣称“AGI已到来”,业界对通用人工智能的界定再次引发争议。核心分歧在于:高评分是否等同于AGI?不同科技巨头对AGI的定义标准(经济价值、能力规模或认知维度)存在显著差异,且这一概念常被用作塑造产品叙事和引导资本预期的工具。
事件概述
2026年9月,OpenAI发布新模型GPT-6 Astra后,其总裁格雷格·布罗克曼宣布“欢迎来到AGI时代”;随后英伟达CEO黄仁勋在社交平台表示“AGI已经到来”。然而,OpenAI CEO山姆·奥尔特曼此前曾称AGI为“定义模糊的词”,负责评测的ARC Prize团队也强调不声称该模型即为AGI。这反映出当前业界对于“AGI何时真正到来”缺乏统一共识,且技术进展与商业叙事之间存在张力。
核心信息:评测数据的真相与局限
GPT-6 Astra在ARC-AGI-3测试中取得99.9%的高分,但该成绩需置于特定语境下理解:
- 框架差异:在OpenAI提供的标准测试框架中,得分为62.7%;接入专用适配框架后升至99.9%。后者允许模型保留跨请求的隐藏推理状态并利用上下文压缩,这测量的是“经过专门优化的完整系统”而非单一裸机模型能力。
- 现实表现落差:在规则清晰的封闭测试中(如FrontierMath Tier 4达到97.6%),模型表现优异;但在贴近真实办公流程的任务(AutomationBench仅41.4%)和复杂专业任务(Agents’ Last Exam仅59.3%)中,频繁出现失败。
- 结论:AI在封闭考试中表现出色并不新鲜,但这与现实世界中目标模糊、流程冗长的环境仍有巨大差距。将高测试得分直接换算为“AGI实现程度”存在逻辑谬误。
行业视角:AGI定义的三种路径
不同公司对AGI的定义决定了其产品路线、资源配置及安全重点:
- OpenAI(经济导向):定义AGI为“在大多数具有经济价值的工作上超越人类的高度自主系统”。核心指标是产出效率与自主性,意识与情感非必要条件。其战略聚焦于让AI承担完整工作并转化为生产力。
- Anthropic(谨慎/能力导向):CEO达里奥·阿莫迪更倾向于使用“强大的AI”一词。定义包含三个变量:能力(达到顶尖专家水平)、自主性(独立持续数小时至数周的任务)和复制规模(数百万实例同时工作)。其战略将能力扩展与风险治理绑定。
- Google DeepMind(测量/认知导向):关注建立统一的测量标准。2023年提出以“性能”和“通用性”为轴的五级分类(新兴至超人类);2026年进一步拆解为感知、生成、推理等十个认知维度。旨在通过可比较的认知能力图谱识别能力缺口。
深度分析:AGI作为叙事资源
“AGI是否到来”不仅是技术问题,更是影响资本、市场和政策预期的叙事之争:
- 叙事价值:“AGI时代来了”能将零散的技术进步压缩为具有历史意义的节点,有助于争夺用户、人才和资本。这种表述保留了巨大的解释空间,既制造了历史时刻感,又避免了具体的技术承诺。
- 资本关联:英伟达与OpenAI在2025年达成战略合作意向,涉及OpenAI部署至少10吉瓦英伟达系统及潜在的最高1000亿美元投资。黄仁勋强调算力投入带来智能跃迁,隐含了扩大算力投资的必要性,作为算力主要受益者,英伟达有动力强化这一叙事。
- 未来展望:知名研究者Andrej Karpathy指出,AGI不会带来陡然拐起的曲线,而是平滑地融入现有增长中,事后可能难以找到明确的拐点。因此,AGI的实现可能是一个潜移默化的过程,而非某个瞬间的宣告。
