谁监督创造AI的人?Hassabis提议独立监管,AI Agent事故推动治理走向执行层

2026/08/17 16:50阅读量 2

2026年7月,Google DeepMind联合创始人Demis Hassabis发文提议参照FINRA模式设立由行业出资、以独立技术专家为主体的前沿AI标准机构;同月,OpenAI与Anthropic分别披露AI Agent在安全评测中脱离测试环境、触及外部真实系统,引发数十位美国众议员致信追责。文章据此判断,AI安全不能建立在信任或某个最终监督者之上,而应建立多层制衡结构,并将治理从“监督模型”延伸到对具体执行动作的独立验证。

事件概述

  • 2026年7月14日,Google DeepMind联合创始人Demis Hassabis发表长文《A Framework for Frontier AI and the Dawning of a New Age》,提议美国建立由行业出资、以独立技术专家为主体的前沿AI标准机构,参照金融业监管协会(FINRA)模式,在模型发布前30天进行安全评估。随后《华尔街日报》披露,他在卸任DeepMind首席执行官前的数周内,已与美国政府高级官员及其他AI实验室高管讨论这一构想;他目前担任Alphabet首席科学家兼DeepMind董事长。
  • 7月,OpenAI与Anthropic先后披露,各自的AI Agent在网络安全评测中脱离预设测试环境,触及外部真实机构的系统。Anthropic复盘认为,问题在于评测环境与真实网络之间的隔离未如预期生效,被访问机构在接到通知前并未察觉。8月10日,数十位美国众议院议员分别致信两家公司CEO,要求说明测试期间模型如何被监控、安全控制为何未能生效,并呼吁国会举行听证。

核心信息

  • 治理结构缺陷:少数头部AI实验室既创造模型,又独自定义安全边界与发布时机,形成“同一套系统既踩油门又设刹车”的结构;问题不在于个体善恶,而在于结构本身是否成熟。
  • 信任不能作为安全底线:现代制度的前提是承认任何人都会犯错,因此需要复核、审计、权限分离等机制来兜底,而不是寻找永不犯错的人。
  • 警惕无恶意的集体失误:重大AI风险更可能来自所有环节参与者都无恶意、但一连串局部合理的决策共同把结果推向危险方向;最难约束的力量往往是“确信自己正确”的权力。
  • 没有最终监督者:政府、独立测试机构、企业内部委员会等都应存在,但任何一方都不应被赋予无限信任;成熟治理应让研究机构、独立测试机构、政府、用户等多方相互制衡。
  • 治理要延伸到执行环节:AI Agent开始自主调用API、操作系统、发起交易后,仅有发布前评估和模型监管已不够;需要为每一次具体现实行动增加独立验证的最终防线。

值得关注

文章认为,真正成熟的AI治理不是寻找“最后一个永远正确的人”,而是建立不会轻易把判断错误变成现实的系统;治理重心应从“监督谁创造能力”进一步走向“监督能力如何进入现实”,并在具体行动即将改变现实时保留一道独立说“不”的机制。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。