OpenAI发布GPT-6 Astra:宣称进入AGI时代,强化Computer Use与自主代理能力

2026/09/04 05:50阅读量 2

OpenAI正式发布GPT-6系列模型(Astra及Astra Pro),并宣布世界已进入AGI时代。该模型在得州Stargate园区使用超10万块GPU训练,核心突破在于从“回答问题”转向“直接完成工作”,具备强大的Computer Use和Agent自主执行能力。基准测试显示其在数学、推理及网络安全领域表现卓越,API定价为输入10美元/百万token,输出50美元/百万token。

事件概述

OpenAI正式发布了旗舰级大语言模型 GPT-6 Astra 及其专业版 GPT-6 Astra Pro。OpenAI总裁Greg Brockman在发布会上宣布:“欢迎来到AGI时代(Welcome to the AGI era)”,认为人工智能系统的综合智力已超越人类。这是OpenAI历史上规模最大的训练任务,在得克萨斯州Stargate园区动用超过10万块GPU完成预训练,且是首款由前代模型深度参与训练监督的旗舰产品。

核心技术与性能指标

1. 定位转变:从生成到执行
GPT-6 Astra的核心变化是从单纯的文本/代码生成,转向**“直接完成工作”**。它不仅能生成内容,还能操作电脑和浏览器,进入不同软件执行多步骤任务,最终交付文档、表格、演示文稿或工程项目。

2. 基准测试成绩

  • ARC-AGI-399.9%(上一代GPT-5.6 Sol为7.8%)。该测试考验模型在陌生环境中的自主探索和规则学习能力。注:此成绩基于OpenAI的Responses API Harness框架,包含记忆管理和Agent运行框架的增益。
  • FrontierMath Tier 4 v297.6%
  • ExploitBench100%(满分)。
  • GPQA Diamond(研究生级科学问答):96%,略高于Gemini 3.8 Flash的95.3%。

3. 编程与Agent能力

  • Terminal-Bench 4.0:57.7%,优于Fable 5.1 (55.8%) 和 GPT-5.6 Sol (37.3%)。
  • DeepSWE v1.1:74.1%,优于Sol (72.7%) 和 Fable 5.1 (67.4%)。
  • Agents’ Last Exam:59.3%,在真实电脑环境中操作软件、终端和文件完成长流程任务,优于GPT-5.6 Sol (53.6%) 和 Claude Opus 5 (55.5%)。
  • AutomationBench:41.4%,显著高于Sol (18.1%) 和 Fable 5.1 (31%),且在API成本控制上表现更优。
  • OSWorld 2.0:离线测试得分72.6%(Sol为65.7%)。完成任务平均耗时约40分钟,比Sol的75分钟减少约47%。

4. 网络安全与安全对齐

  • 在ExploitBench上获得满分,ExploitGym得分从Sol的30.3%提升至42.4%。
  • 面对近三个月公开的新漏洞,成功率为39%(Sol仅为5.5%),并发现利用了两个V8零日漏洞。
  • 安全性:在模拟越界测试中,Astra的越界行为比例为0%,而Sol为48.2%,显示出更强的边界意识。

定价与可用性

  • API定价:输入 10美元/百万token,输出 50美元/百万token。价格约为GPT-5.6 Sol的2.5倍,与Fable 5.1持平。
  • 成本逻辑:OpenAI强调,虽然单次调用成本高,但通过减少返工和步骤,完成整项工作的总成本可能更低。
  • 用户开放:Astra面向ChatGPT Plus、Pro、Business和Enterprise用户开放;Astra Pro仅面向Pro、Business和Enterprise用户。免费用户暂未开放。

应用场景演示

  1. 电子工程:直接进入KiCad软件,根据原理图完成PCB布局,放置元器件并连接铜线,生成可制造文件。
  2. 3D建模与游戏开发:在Blender中建立房屋模型,导入Unreal Engine 5生成可自由行走的三维空间;或在Unity/Godot中快速生成可玩的游戏原型。
  3. 办公自动化:基于企业模板制作完整的PPT演示文稿,保持版式和视觉风格一致。
  4. 复杂搜索与预约:例如寻找儿科医生任务,Astra用时2分54秒,而人类需约5小时。

配套更新:Codex改进

针对长任务处理,Codex进行了以下更新:

  • 跨上下文记忆:保存工作笔记并搜索此前消息,避免信息压缩导致的细节丢失。
  • 交互式确认:仅在涉及重要选择时暂停等待用户确认,无关部分继续执行。
  • 效率提升:结合新Computer Use框架,在Mind2Web测试中任务完成速度达到GPT-5.6 Sol体验的1.9倍。

早期案例反馈

  • 法律领域:平台Legora使用Astra核对41份财务文件,几分钟内找出4个错误(含50万英镑差额),速度比上一代快近40%。
  • 游戏开发:公司Playco利用Astra在Unity和Godot中生成游戏原型,人工修补工作量减半,空间推理和UI还原能力显著提升。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。