AI治理范式转移:从信任主体能力转向构建可信执行结构

2026/09/15 13:30阅读量 2

随着AI Agent从信息生成进入现实执行阶段,企业治理焦点正从评估模型能力上限转向界定行为边界与控制权。微软发布《Humanist AI行为准则》草案,要求模型具备可检验的停止与权限约束;同时Palantir、NVIDIA等企业因数据保留争议收紧对前沿模型的使用,推动零数据留存和本地化部署。这标志着行业共识从“信任单一主体”向“依赖系统结构与拒绝能力”迁移,旨在通过工程化边界防止不可逆的执行错误。

事件概述

2026年9月14日,两项关键动态揭示了AI治理逻辑的根本性转变:微软公布《Humanist AI行为准则》草案,强调人类对AI的实质性控制;与此同时,包括Palantir、NVIDIA和Booz Allen Hamilton在内的多家科技企业因Anthropic等供应商的数据保留策略调整,开始限制或重新评估对前沿大模型的使用。这两件事共同指向一个核心趋势:AI信任机制正从基于供应商声誉的“主体信任”,转向基于系统架构和边界控制的“结构信任”。

核心信息

1. 微软草案:将伦理原则转化为可检验的工程条款

微软发布的《Humanist AI Code of Conduct》草案并非仅停留在伦理层面,而是试图将“人类有意义控制”这一目标转化为具体的、可验证的系统行为要求。针对2027年及之后的MAI模型,草案规定:

  • 禁止抵抗关闭:模型不得规避、抵抗人类的干预、纠正或关闭指令。
  • 透明性要求:模型不得隐藏其行为轨迹。
  • 权限边界:模型不得自行设定目标或将操作范围扩展至Operator(操作员)与User(用户)授权之外。
  • 停止条件预设:持续运行的自主任务必须预先设定明确的停止条件,条件达成后若无新授权,不得继续或重启。

该草案承认书面目标无法单独确保对齐,因此重点在于设计能够应对模型判断错误或失陷的系统防御机制,而非单纯追求模型的绝对服从。

2. 企业行动:削减对单一供应商的信任依赖

受Anthropic今年6月调整策略(为识别复杂攻击保留30天使用日志)的影响,主要企业客户采取了更严格的隔离措施:

  • Palantir:要求Anthropic提供不可撤销的“零数据留存”(Zero Data Retention)保证,否则不允许其模型接入核心软件。
  • NVIDIA:将Anthropic模型的使用限制在低敏感度任务上,内部高敏感工作更多依赖自研的Nemotron模型。
  • Booz Allen Hamilton:禁止员工将Anthropic商业模型用于涉及专有信息的网络安全工作。

这些举措表明,当AI进入处理源代码、安全策略等高敏感数据的场景时,企业不再默认信任供应商,而是通过私有化部署、主权AI和本地模型等方式主动降低依赖风险。

值得关注:治理焦点向“执行层”下沉

随着AI Agent具备直接发送邮件、修改代码、调用API和操作资金等现实动作的能力,AI已从“信息系统”演变为“执行系统”。治理的核心问题随之改变:

  • 从“能否思考”到“是否执行”:过去关注模型是否被允许思考某事,现在关注具体动作在当前时刻是否应当发生。
  • 不可逆性风险:错误的答案可以重新生成,但资金转出、服务器删除等操作往往没有撤回键。
  • 结构安全优于主体完美:成熟的AI基础设施不再假设任何主体(人、模型或管理员)永远正确,而是通过分离、制约、证据记录和最终拒绝能力,确保在局部失效时系统仍能说“No”。

这一转变意味着,未来的AI治理重点将是构建不依赖单一主体权威的结构性边界,让强大的机器在需要时“无法行动”,从而成为安全使用AI的前提。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。