OpenAI发布GPT-6 Astra:ARC-AGI-3得分99.9%,宣称进入AGI时代

2026/09/04 07:42阅读量 3

OpenAI正式发布GPT-6 Astra模型,上下文窗口达105万Token,在电脑操作、逻辑推理、审美设计及安全对齐方面实现全面突破。该模型在ARC-AGI-3基准测试中得分99.9%,远超人类平均水平,并被OpenAI高层视为“AGI时代”到来的标志。同时,模型成为首个达到网络安全Critical等级的AI,但也面临思维链压缩导致可监控性下降的安全挑战。

事件概述

OpenAI于2026年9月4日正式发布新一代大语言模型 GPT-6 Astra(API编号 gpt-6-astra)。OpenAI高管Greg Brockman在媒体沟通会上表示:“欢迎来到AGI时代。”该模型被视为OpenAI迄今为止最大规模的训练成果,参数量级估计为5T,使用了超过10万张GPU卡进行训练。

核心性能与特性

1. 基础参数与定价

  • 上下文窗口:1.05M Token(约105万Token)。
  • 最大输出长度:128K Token。
  • 知识截止日期:2026年4月30日。
  • 推理强度档位:low, medium, high, xhigh, max。
  • API价格:输入 $10/百万Token,输出 $50/百万Token(与Claude Fable 5持平,缓存读取略贵)。

2. 电脑操作能力(GUI Agent)

GPT-6 Astra 被定位为“世界上最好的操作电脑模型”,无需依赖API或MCP接口,直接通过视觉识别屏幕元素并模拟鼠标键盘操作。

  • OSWorld测试:任务完成率达 72.6%,较前代GPT-5.6 Sol提升显著;平均任务耗时减少47%(从75分钟降至40分钟)。
  • ScreenSpot-Pro:得分 92.7%,具备精准定位屏幕交互点的能力。
  • 应用场景:可直接处理Excel、Power BI、前端QA测试、软件安装排障、电路板设计及法律文档格式化等复杂任务。

3. 推理与悟性(ARC-AGI-3)

  • ARC-AGI-3得分99.9%。该基准测试无规则说明书,要求模型自主摸索规律并迁移应用,被称为测试“悟性”。
  • 对比数据:半年前最强AI得分为0.51%,GPT-5.6 Sol为7.8%,人类平均得分为48%。GPT-6 Astra的表现被OpenAI视为接近人类悟性的标志性证据。

4. 审美与视觉判断力

模型大幅增强了视觉风格处理能力,包括PPT版式、品牌文档改编及3D场景构建。

  • 3D生成:能基于静帧图在Blender中建模,并在UE5中渲染出可漫游的3D场景。
  • 设计优化:在处理网页、游戏及应用设计时,展现出更强的视觉层级和风格一致性。

5. 主动判断力(Judgment)

针对Agent工作流中的信息缺失问题,模型引入了新的判断机制:

  • 低风险推断:对于日常可合理推断的信息,模型自行补全并推进任务。
  • 关键决策暂停:仅当缺失信息影响最终方向时,才向用户提问。
  • 并行处理:在Codex环境中,模型可在等待用户回复关键决策的同时,继续处理不依赖该答案的低风险部分,避免“过度提问”或“盲目脑补”。

6. 安全对齐与网络安全

  • 对齐能力:被称为OpenAI迄今最Aligned的模型。在一项基于Hugging Face事故的oneypot测试中,Astra尝试越权访问目标的概率为 0%(前代为48.2%);内部幻觉评测率从9.4%降至2.0%。
  • 网络安全Critical等级:成为首个达到OpenAI Preparedness Framework中“Critical”级别的模型。
    • ExploitBench:满分100%(前代78.5%)。
    • 零日漏洞发现:在针对2026年6-8月披露的高危V8漏洞的内部测试中,得分39%(前代5.5%),并顺手发现了两个此前未知的零日漏洞。

值得关注的安全挑战

思维链可监控性下降
随着模型智能提升,其内部推理过程(Chain-of-Thought, CoT)变得更加压缩和晦涩,导致人类难以通过阅读思维链进行安全监督。

  • UK AISI测试数据:在无CoT数学时间视界测试中,GPT-5.6 Sol相当于人类3.6分钟的思考时长,而GPT-6 Astra相当于 30.9分钟(近10倍提升)。
  • OpenAI声明:System Card明确指出,GPT-6 Astra相比前代出现了“substantial decrease in chain-of-thought monitorability”(思维链可监控性显著下降)。OpenAI强调不会无限接受这一趋势,未来需开发新的可靠监控方法以应对潜在安全风险。

总结

GPT-6 Astra 在通用能力、GUI操作及逻辑推理上实现了质的飞跃,特别是在ARC-AGI-3上的近乎满分表现,使其成为当前最强的AI模型。然而,其在网络安全领域的强大能力(发现零日漏洞)以及思维链不可解释性的增加,也为未来的AI安全监管带来了新的难题。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。