攻击性蒸馏只是表象,思维链加密漏洞暴露安全治理滞后

2026/08/12 22:15阅读量 2

前沿模型厂商加密隐藏的思维链,被发现可被同体系弱模型低成本解码,解码1万条推理轨迹仅需约720美元,且第三方攻击可绕过反蒸馏监控。密码学家数月前上报漏洞被漠视,直至实验跑通才修复。该漏洞不仅可能引发专有模型被低成本蒸馏,更可能导致隐私泄露、有害信息提取和隐形提示注入,威胁AI生态安全。

事件概述

前沿模型厂商将思维链视为核心商业机密,以加密方式隐藏推理过程。新研究显示,这类加密思维链可被同一产品体系内的弱模型低成本解码,进而可能被用于“攻击性蒸馏”——但比蒸馏更值得警惕的,是漏洞暴露出的厂商安全治理惯性:安全机制与产品便利性、成本冲突时,安全往往被后置。

攻击链路:加密块的“同体系重放”漏洞

  • 供应商为降低存储成本,普遍将加密推理块交由客户端持有,并在下一轮调用时回传。这种无状态架构支持模型切换和自动重路由,但也使加密块可在同厂商产品体系内跨会话、跨用户、跨模型移植。
  • 研究推断,供应商使用同一全局密钥对推理块进行加密和认证。兼容性需求(如高端配额耗尽后自动降级到低规格模型)是这一设计的主要业务逻辑。
  • 实验显示:OpenAI GPT-5.6可重放早期版本模型的推理轨迹;Anthropic Claude除Fable 5外,同系模型均可互放;Google Gemini全系列互通。
  • 攻击者用强模型生成加密思维链,注入同系弱模型(如Haiku)并越狱,弱模型就能以明文重构强模型的原始推理过程。这类弱模型被称为“模糊解码器”,解码token数与API报告的推理token数高度吻合,可作保真度指标。
  • 成本极低:以Claude Haiku 4.5为解码器,解码1万条推理轨迹的名义API成本仅约720美元。

两种攻击途径

  • 第一方攻击者:使用自有API账户查询强模型,捕获加密块,重放入弱模型解码。代价是承担强模型的生成成本。
  • 第三方攻击者:直接从GitHub、HuggingFace等公开平台采集用户共享的Agent会话日志——日志中加密块原封不动,共享者无密钥无法清除。第三方无需自行生成推理轨迹,也从不触碰前沿模型端点,因此供应商的反蒸馏监控很可能完全无法察觉。

漏洞披露时间线:安全被“流程性”忽视

  • 密码学家Matthew Green数月前通过官方漏洞赏金计划向OpenAI与Anthropic上报攻击方法。OpenAI回复“无法复现”,Anthropic称“未发现任何安全影响”,仅修改开发者文档提醒。
  • 直到研究团队用实验完整跑通攻击,漏洞才被修复。这种“实验跑通才修复”的响应方式,暴露出安全治理的惯性问题。

风险不止蒸馏:隐私、有害信息与提示注入

  • 被绕过防蒸馏机制只是厂商自身的商业风险。更严重的是:
    • 大规模隐私泄露:加密块内可能包含用户隐私信息,共享日志可被第三方获取;
    • 隐藏有害信息提取:模型被训练不在输出中带出有害内容,但没被训练不思考有害话题;攻击者可诱导模型深入推理有害问题,再通过弱模型解码提取;
    • 隐形提示注入:长程智能体工作流中重放轨迹是现实需求,加密推理块使恶意指令可被埋入用户看不到的推理块中,在重放时被模型当作自己的推理执行,动摇整个AI智能体生态的信任基础。

关于“蒸馏”的争议与更根本的解决办法

  • 论文有30页专门分析开源模型是否借鉴了三大系列专有模型的推理能力,章节名为“房间里的大象”。但论文无法因果证明蒸馏存在,只能报告特定干预下观察到的行为转变;其中有2款开源模型存在较强的间接行为证据,但未在更多模型上复现。
  • 有研究者认为“蒸馏”本身是中立技术,不应上升到政策行动,关键是产品方及时修复漏洞。
  • 加密协议修得再完美,只要模型用秘密进行推理,就会留下可观察痕迹。论文作者之一Jonas Geiping建议引入“门控”,在推理前判断问题是否允许思考,但判断是否危险本身又需要思考,形成新悖论。
  • 他更倾向于另一种制度安排:让所有用户都可以访问思维轨迹。这能形成更广泛、多元的监督机制,避免监督权过度集中在模型厂商手中。如果只有制造者能看见模型在想什么,对越来越自主的AI而言,那才是真正的风险。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。