OpenAI紧急踩刹车:最强模型Astra因网络攻击风险主动放缓研发

2026/08/08 11:37阅读量 2

OpenAI在内部评估中发现下一代大模型Astra具备接近顶级黑客的网络攻击能力,无法排除关键风险,因此主动放缓其研发进度,并通报美国政府。OpenAI仍计划最终向公众开放该模型,但需先解决安全问题。同时,美国AI评估框架尚未明确细节,Anthropic相关安全承诺反复也引发关注。

事件概述

OpenAI主动放缓了未发布下一代大模型 Astra 的研发进度,原因是内部评估显示,该模型在网络安全方面的能力可能已超出当前可控范围。官方博客直言:“我们无法排除 Astra 具有关键网络攻击能力的风险。”

核心信息

  • 风险表现:Astra 具备写代码、找漏洞、自动规划攻击步骤、调用工具、持续执行任务的组合能力,评估认为其可能接近“顶级黑客”水平。
  • 安全管控:OpenAI 为 Astra 搭建了完全隔离的测试环境,对所有代理应用进行全域监控,并在新的安全防护措施到位前主动限制研发节奏。
  • 政府通报:据白宫官员透露,OpenAI 是“自愿”将推迟发布计划通报给美国政府的,这可能是前沿 AI 实验室首次因模型潜在破坏力而主动承诺放缓研发。
  • 未来计划:奥特曼表示,Astra 是“强大的模型”,OpenAI 仍希望最终让所有人使用它,只是需要“再多花一点时间”解决安全问题。该决策也符合 OpenAI 在 2023 年发布的“防范框架”(Preparedness framework)。
  • 公开确认:在 Black Hat 网络安全大会上,OpenAI 技术人员 Michael Dalton 公开承认,公司正“有意识地放缓研究以增强安全性”。

行业动态

  • Anthropic 态度反复:该公司曾承诺若 AI 能力超控就暂停训练,但今年 2 月悄悄撤掉该条款;6 月发布具备网络攻击能力模型的“安全阉割版”,并公开警告 AI 可自我进化,呼吁全球暂停 AI 开发。
  • 美国评估框架未落地:美国政府正推进 AI 模型发布前评估框架,本周已向头部企业闭门吹风,但“国家级风险”“最先进模型”等核心概念尚未清晰定义,企业对接流程和审查耗时也没有定论。

值得关注

OpenAI 官方在通报中特别补充:“Astra 与此前的 Hugging Face 漏洞事件没有任何关系。”这一否认引发外界更多猜测。

参考链接:https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。