GPT-6 Astra ARC-AGI-3 高分背后的符号世界模型与算力争议
2026/09/04 19:07阅读量 2
OpenAI 最强模型 GPT-6 Astra 在 ARC-AGI-3 测试中成绩逼近 100%,其核心突破在于将“符号世界模型”能力内化至模型权重,通过自创 DSL 和虚拟沙盒模拟实现高效推理。然而,ARC Prize 基金会总裁指出该成绩依赖昂贵的定制 Harness 框架,单题消耗约 360 美元算力,质疑其是否为真正的 AGI 突破。
事件概述
OpenAI 发布的最新模型 GPT-6 Astra 在公认的 AI “智商”评测基准 ARC-AGI-3 中表现惊人,得分接近满分。相比上一代模型 GPT-5.6 Sol 的 38.3% 得分,这一飞跃引发了关于 AI 是否已具备通用智能(AGI)的广泛讨论。评测显示,Astra 在 96% 的关卡中操作效率高于人类,平均动作步数减少 51.7%。
核心技术:符号世界模型的内化
GPT-6 Astra 的高分主要归功于其对“符号世界模型”(Symbolic World Model)的应用,且该技术已从外部辅助工具转变为模型内部能力。
- 机制原理:不同于传统大模型依靠像素级暴力试错,Astra 进入新环境后,会使用自创的代数符号系统(DSL)对物理规律和因果关系进行抽象记录。它将环境状态映射为精确坐标系,并在内部构建“虚拟沙盒”进行逻辑推演。
- 执行流程:模型先在脑中编写 Python 式逻辑代码(如“按 A 左转 90 度”),确认闭环无误后才执行现实操作。这种确定性表述消除了自然语言的歧义,大幅提升了准确率。
- 技术演进:早期此类高阶推理依赖外部 Harness 框架(如 PRO-LONG、Tycho 等),存在高延迟和部署困难问题。GPT-6 Astra 将大量 Harness 功能(无损内存、程序化分析、显式假设检验等)内化进模型权重,实现了端侧部署的可能性和更低的交互延迟。
争议焦点:算力成本与 AGI 定义
尽管成绩亮眼,但 ARC Prize 基金会总裁 Greg Kamradt 对“AGI 已来”的说法持保留态度,指出了高分背后的巨大代价。
- 高昂的算力账单:Astra 的成绩依赖于定制的“供应商适配器基座”,利用连续对话和上下文压缩支撑长逻辑链。每解决一道题目需消耗约 360 美元的算力,完整跑完一场测试总成本高达 1.8 万美元(约合 13.5 万人民币)。
- 效率对比:相比之下,人类解同类谜题的电费成本不足半美分,即使计入人力补贴也仅为 12.78 美元/局。这种依赖巨额算力堆砌的“钞能力”刷分模式,引发了业界对其经济可行性的质疑。
- 黑盒风险:随着推理过程的不透明化,开发者难以区分模型是真正理解了逻辑,还是找到了高效的“作弊”路径。Kamradt 认为,目前的测试仅是图形规律匹配,距离人类适应任何未知世界的通用智能仍有本质差距。
