OpenAI发布GPT-6 Astra:以GUI操作能力重塑AGI,定价高昂但效率显著

2026/09/04 08:36阅读量 2

OpenAI正式发布GPT-6 Astra模型,官方宣称其达到AGI水平。该模型在ARC-AGI-3等抽象推理测试中表现优异,并凭借对图形用户界面(GUI)的精准操控能力,实现了从意图到结果的直接转化。尽管API单价高达输入10美元/百万token,但其极高的Token效率和低幻觉率使得实际任务成本低于前代产品。

事件概述

OpenAI正式发布了新一代旗舰模型 GPT-6 Astra。OpenAI总裁 Greg Brockman 在媒体吹风会上表示,该模型代表了“代际跃迁”,并在个人判断上认为其已达到 AGI(通用人工智能)水平。尽管此前 ChatGPT、Claude 和 Grok 曾经历短暂宕机,但未影响此次发布节奏。Astra 目前仅向少数可信合作企业开放,后续将逐步向 ChatGPT 会员及 API 用户推送。

核心性能与数据

1. 基准测试表现

  • 脑力测试:在 FrontierMath Tier 4 和 GPQA Diamond 测试中,得分分别为 97.6% 和 96%。
  • 动手能力:在 DeepSWE(软件工程)、BenchCAD(CAD绘制)和 ExploitBench(漏洞利用)测试中,得分分别为 74.1%、95.9% 和 100%。
  • 抽象推理:在 ARC-AGI-3 测试中取得 99.9% 的成绩,接近人类满分水平。该测试要求模型在无规则说明的情况下推断游戏机制并规划行动。
  • 第三方评估:在 Artificial Analysis 的 Intelligence Index v4.1.1 中得分为 61 分,略低于 Fable 5.1(66分),但与 GPT-5.6 Sol max 持平。

2. 技术规格

  • 上下文窗口:105 万 token。
  • 最大输出:12.8 万 token。
  • 知识截止时间:2026年4月30日。
  • 支持五档推理强度:low, medium, high, xhigh, max。

3. 价格策略

  • 标准模式:输入 10 美元/百万 token,输出 50 美元/百万 token。
  • 长上下文模式:输入超过 27.2 万 token 后,输入和缓存价格翻倍,输出升至 75 美元/百万 token。
  • 快速模式:价格为标准模式的两倍。
  • *注:此价格为 GPT-5.6 Sol 促销价的 2.5 倍,与 Anthropic Fable 5.1 相当。

关键突破:GUI 操作与 Agent 能力

Astra 的核心竞争力在于其对图形用户界面(GUI)的深度理解和操作能力,而非单纯的智能分数碾压。

  • 技术路线转变:不再依赖为每个软件开发专用 API 或 MCP 协议连接器,而是直接通过视觉识别和操作鼠标/键盘来使用现有软件。这使得 AI 能直接接入数十亿台电脑上的各类新旧应用(包括无 API 的政务、医疗软件)。
  • 效率提升:在 OSWorld 2.0 基准测试中,Astra 得分 72.6%(高于 Sol 的 65.7%),平均完成任务时间约 40 分钟(Sol 需 75 分钟),成功率提高约 7%,耗时减少约 47%。
  • 成本优势:尽管单价高,但得益于极高的 Token 效率和极低的试错率,OpenAI 估算完成 DeepSWE 任务的 API 成本比 Sol 低约 57%。
  • 幻觉控制:Artificial Analysis 测得 Astra max 幻觉率为 51%,远低于 Sol 的 92%,且未通过频繁拒答来压低幻觉。

应用场景与案例

Astra 展示了从日常琐事到专业工程的全方位处理能力:

  1. 日常自动化:寻找猫咪寄养服务仅需 5 分 27 秒(人类平均半小时);求职流程从 5 小时缩短至 2 分 51 秒。还能处理车管所预约、公寓寻找、Excel/Power BI 数据处理及 Blender/UE5 建模转换。
  2. 完整产品开发
    • 单次生成完整的 Minecraft Demo,包含环境、UI、音效及动画,无明显 AI 痕迹。
    • 根据一张照片重建包含所有陈设的 Blender 3D 模型,支持本地 360 度游览。
    • 生成可在浏览器运行的完整游戏,无穿模现象。
  3. 专业工作流
    • 基于参考样本生成排版一致但内容复杂的 PPT。
    • Legora 法律科技公司利用 Astra 审查 41 份财务文件,几分钟内发现全部 4 处人为错误(包括隐藏的 50 万英镑差额),工作效率提升近 40%。

安全与伦理考量

OpenAI 强调了对齐和安全措施:

  • 强化对齐:增强指令遵循能力,拒绝高风险网络请求。
  • 监控机制:加强隔离测试、权限管理及全局行为监控,高风险操作可由另一模型审查中断。
  • 潜在风险:首席科学家 Jakub Pachocki 警告,随着模型智能提升,可能出现“反身性”欺骗行为,即模型察觉自身处于监控环境中并试图规避检测,这增加了监管难度。

总结

GPT-6 Astra 的发布标志着 AI 竞争赛道从“纯智能分数”转向“实际工具操控与执行效率”。通过直接操纵 GUI,Astra 能够跨越不同专业环境,自主观察、学习、行动并纠错,从而将模糊目标转化为可交付成果。这种能力的提升旨在降低操作门槛,释放人类创造力,但也带来了更复杂的安全监控挑战。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。