GPT-6 Astra发布:性能饱和且Token消耗大幅降低,开启“干活”时代
2026/09/06 11:22阅读量 2
OpenAI于9月5日全量推送GPT-6 Astra模型,该模型在编程、长程任务及抽象推理等基准测试中表现卓越,部分指标达到“饱和”状态。得益于采用“循环深度”新架构,GPT-6 Astra在提升处理速度的同时显著降低了Token消耗,单次任务成本低于竞品Fable 5.1。尽管训练规模高达10万GPU集群,但其在实际工作流中的高效与低成本使其成为当前最具实用价值的AI工具之一。
事件概述
2026年9月3日晚全球AI大宕机后,OpenAI于9月4日凌晨发布GPT-6 Astra,并于9月5日向所有付费用户全量推送。OpenAI总裁Greg Brockman宣布其标志着AGI时代的到来。该模型不仅在多项关键基准测试中取得突破性成绩,更在实际应用场景中展现出“又快又省”的特性,迅速抢占了市场风头。
核心信息
1. 性能突破:从“刷题”到“人类水平”
GPT-6 Astra在多个权威基准测试中表现出接近满分的成绩,被官方形容为“饱和”:
- FrontierMath Tier 4(研究级数学): 得分98%,达到测试上限。
- ARC-AGI-3(抽象推理): 得分从上一代GPT-5.6 Sol的7.8%跃升至99.9%。在排除自家优化框架Harness后,独立测评得分仍达62.7%,是第二名Claude Opus 5的两倍。Greg Kamradt指出,在96%的测试层级上,Astra超越了人类行为效率基线。
- ExploitBench(漏洞利用): 满分100%,而GPT-5.6 Sol仅为78.5%。
- 偏科现象: 在“人类终极测试”(Humanity’s Last Exam)中,Astra得分为57.2%,低于Sol和Fable 5.1,显示其在某些通用知识或推理维度上存在短板。
2. 技术革新:“循环深度”架构实现降本增效
GPT-6 Astra的性能跃迁主要得益于两项核心技术改进:
- 循环深度(Recurrent Depth)架构: 据The Information报道,新架构通过复用同一组网络层进行多次内部循环计算,中间推理在隐藏状态中完成,而非全部转化为输出文本。这解决了传统思维链(Chain of Thought)啰嗦、Token消耗大的问题,实现了内部思考更深、外部输出更精简。
- 训练规模: 动用了10万GPU集群,是OpenAI迄今最大规模的训练,验证了Scaling Law的有效性。
3. 实际应用:效率与成本的显著提升
相比跑分,GPT-6 Astra在实际“干活”场景中的优势更为明显:
- Token节省:
- 在Agents' Last Exam中,比Claude Opus 5少用约65%的输出Token。
- 在Terminal-Bench 4.0中,API成本比Sol缩减约9%,比Fable 5.1降幅高达63%。
- Higgsfield AI CEO Alex Mashrabov表示,Astra比其他模型少用高达20%的Token。
- 速度提升:
- OSWorld 2.0(计算机操作)平均耗时40分钟,比Sol减少47%。
- Mind2Web基准下,Codex任务完成速度达到上一代的1.9倍。
- 功能增强:
- Computer Use: 被称为“世界上最好的Computer Use模型”,能自主操作软件填表、更新CRM、整理日程、搭建网站并进行前端QA。
- 跨上下文记忆: Codex新增跨上下文管理机制,可保存“工作笔记”并回溯早期完整上下文,避免细节丢失。
- 异步提问机制: 遇到歧义时不再卡死等待人工确认,而是先推进独立部分,攒好问题后续处理,大幅提升开发者体验。
4. 生态影响
- 竞品对比: Perplexity评估显示,Astra的单次任务花销低于Anthropic的新模型Fable 5.1。
- 应用落地: 网友实测显示,Astra已能生成媲美真实水平的射击游戏、开放世界冒险游戏,并能从零搭建包含墙体、门窗等细节的房屋3D模型,甚至将电子原理图排成可投产的PCB。
值得关注
尽管GPT-6 Astra展现了强大的实用能力,但其是否真正代表AGI的到来仍有争议。正如电力时代的发展轨迹所示,当AI解决复杂工作变得足够快速和便宜时,“用不用AI”的讨论将逐渐退居幕后,取而代之的是各种AI原生产品的普及。目前,Astra更多被视为一个极具商业价值的高效工具,而非终极智能形态。
