OpenAI发布GPT-6 Astra:强化Agent能力,AGI时代开启?
OpenAI于9月3日正式发布旗舰模型GPT-6 Astra,官方将其定义为AGI时代的开端。该模型在软件工程、科研及网络安全等复杂任务上表现显著提升,特别是Computer Use(电脑操作)和Judgment(自主判断)两大核心能力的增强,使其更擅长独立执行长程Agent任务。尽管API价格翻倍至与Anthropic的Claude Fable 5.1持平,但OpenAI正试图通过提升B端企业客户的使用价值和任务完成率,来应对来自Anthropic在商业化盈利上的激烈竞争压力。
事件概述
2026年9月3日凌晨,OpenAI正式发布预热已久的旗舰模型GPT-6 Astra。公司总裁Greg Brockman在媒体沟通会上宣布“欢迎来到AGI时代”,认为该模型可能被视为通用人工智能(AGI)时代开始的节点。目前,GPT-6 Astra仅向少量机构开放,Plus、Pro及Business付费用户将在未来几天陆续获得访问权限,API也将逐步开放。针对延迟开放,OpenAI提供补偿方案:付费用户每等待一天,可获得一次额度重置机会。
核心性能与技术突破
1. 基准测试成绩
- 接近上限的能力: 在ARC-AGI-3(陌生环境规则适应)、ExploitBench(漏洞利用程序构造)和FrontierMath Tier 4 v2(高难度数学推理)等测试中,得分分别达到99.9%、100%和97.6%,显示其在研究级推理和复杂安全任务上的强大实力。
- 综合排名: 在第三方Artificial Analysis智能指数中,GPT-6 Astra最高推理档得分为61分,排名第5,与上一代GPT-5.6 Sol持平,略低于Anthropic最新旗舰Claude Fable 5.1(66分)。这表明其进步并非全面碾压,而是集中在特定领域。
2. Agent能力显著增强
相比上一代,GPT-6 Astra在以下方面提升明显:
- 长程任务执行: 科研工作流测试Terminal-Bench Science 0.1得分从22.4%跃升至64.6%;其他长程Agent和自动化任务测试普遍提高约20个百分点。
- 电脑操作(Computer Use): ScreenSpot-Pro得分从76.9%提升至92.7%;OSWorld 2.0完成模拟平均时间从75分钟缩短至40分钟。实测案例显示,模型可连续运行多日完善虚拟场景,或独立完成从Blender建模到Unreal Engine渲染的全流程3D空间搭建。
3. 两大关键特性
- Computer Use(电脑操作): 模型通过截图理解图形界面,直接进行点击、输入等操作,无需依赖API或MCP接口。这补全了传统Agent在无现成接口软件中的操作短板,但也意味着底层模型正在接管部分原属Agent层的执行能力。
- Judgment(自主判断): 模型能区分信息缺失的重要程度。对于不影响最终方向的小问题自行决策,仅在涉及关键结果时才暂停询问用户。这一机制大幅降低了人机协作的监督成本,使Agent能承接更复杂的长任务。
商业竞争与市场背景
1. API定价策略
GPT-6 Astra的API价格为输入每百万Token 10美元、输出50美元,是GPT-5.6 Sol的2.5倍,与Anthropic的Claude Fable 5.1处于同一水平。Fast Mode生成速度提升约2倍,但价格同样翻倍。
2. 应对Anthropic的竞争压力
- 收入对比: Anthropic近期季度收入超115亿美元并实现运营盈利,年化收入预估超650亿美元;而OpenAI同期经营亏损扩大至123亿美元,年化收入预估约400亿美元。Anthropic在企业级AI Coding和Agent商业化上已占据先机。
- B端转型需求: OpenAI企业业务收入占比已超40%,且企业数量达200万。Codex产生的Token占企业端输出的64%,表明使用习惯正从问答转向复杂Agent任务。GPT-6 Astra的升级旨在通过更强的独立任务处理能力,巩固其在B端市场的竞争力。
3. 行业更新密集
同期,Anthropic发布Claude Fable 5.1,Google推出Gemini 3.8 Flash,Meta更新Muse Spark 1.3。前沿模型更新窗口期缩短,OpenAI需通过产品力证明其高额算力投入(预计今年计算支出约500亿美元)能转化为持续增长的企业收入。
