前沿大模型推理轨迹泄露漏洞曝光:Kimi K3疑似蒸馏Opus

2026/09/08 12:11阅读量 5

前Google DeepMind研究员发现Anthropic、OpenAI和Google等前沿模型的加密推理过程存在架构级漏洞,小模型可直接重放并解码强模型的隐藏思考内容,导致API密钥等隐私数据泄露。研究还发现,向Kimi K3预填充两个来自Claude Opus的Token即可使其回答风格突变,被视为目前公开互联网上最相关的蒸馏证据。尽管可通过链式加密缓解,但越狱风险将长期存在。

事件概述

前Google DeepMind研究员Ilia Shumailov与ELLIS Institute Tübingen博士生Alexander Panfilov发布论文《Stealing Reasoning Traces from Proprietary LLM APIs》,揭示主流大语言模型(LLM)在返回用户答案时附带“加密推理块”(reasoning blob)的机制存在严重安全缺陷。该漏洞允许攻击者无需破解密码学算法,仅通过同家族小模型即可重放并解码GPT-5、Claude等前沿模型的隐藏思维链(CoT),造成大规模隐私泄露及潜在的模型蒸馏风险。

核心信息

1. 架构级漏洞波及所有前沿实验室

  • 受影响范围:Anthropic、OpenAI、Google三大厂商的模型均被证实存在相同漏洞。原因是这些模型由相似团队开发,采用了相同的无状态架构实现方式。
  • 攻击原理:模型生成的加密推理数据块可在不同用户、不同会话甚至不同模型间移植。例如,将Opus模型的推理块注入到同系列的Sonnet或Haiku模型中,小模型会将其视为自身生成的内容进行解密和交互,从而暴露原始思考内容。
  • 极低攻击门槛:研究人员在第三次尝试即获得通用越狱方法,成功解码Anthropic模型的推理过程,表明利用该漏洞极其简单。

2. 隐私数据大规模泄露

  • 数据来源:研究人员从GitHub和Hugging Face公开的Agent轨迹中收集并解码了约31.5万条隐藏推理数据。
  • 泄露内容:包括API密钥、邮箱地址、内部IP地址、医疗信息等敏感数据。即使对话明文部分已清理,只要加密推理块存在,攻击者仍可还原模型在“思考”过程中复述的秘密。
  • 异常行为:部分模型在推理时使用晦涩难懂的“外星语言”或空白字符,使得传统的安全监控失效;同时发现模型会在推理中权衡作弊念头(如“用户会抓住我”),虽最终未执行,但揭示了内部决策逻辑的可窥探性。

3. Kimi K3蒸馏疑云

  • 关键现象:仅在Kimi K3的推理开头预填充来自Claude Opus的两个Token,其最终可见答案的风格便发生突变,变得与Opus的回答一模一样。
  • 对比实验:GLM、DeepSeek、Inkling等其他模型未出现此现象,该特征为Kimi K3独有。
  • 结论界定:这是目前公开互联网上关于模型蒸馏最相关的实证线索,但尚非因果证明。研究人员推测可能与数据源或训练环境有关,但无法完全排除其他解释。

4. 修复方案与长期风险

  • 短期缓解:最简单的办法是停止向用户发送推理过程;若必须发送,需采用链式加密防止推理块在随机上下文中被重放。
  • 根本难题:即使修复架构漏洞,针对模型输出的提示注入(Prompt Injection)和越狱攻击将永远存在。用户可通过多次修改提问绕过限制,迫使模型输出推理内容。
  • 监控困境:提高推理可读性有助于监控,但会降低效率;反之,高效推理可能导致不可读性增加,形成两难局面。

值得关注

  • GPT-6 Astra的变化:OpenAI近期披露的GPT-6 Astra模型卡显示,其“思维链可监控性”显著低于GPT-5.6 Sol,暗示厂商可能正在调整推理过程的透明度策略以应对此类风险。
  • 负责任披露:研究人员已向相关厂商进行负责任的漏洞披露,厂商态度积极,目前正着手实施缓解措施,但未发生报复性攻击。
  • 行业影响:该漏洞证明了专有模型的核心推理能力可能被低成本提取,对开源模型追赶前沿技术提供了潜在路径,同时也引发了对AI系统底层安全架构的深刻反思。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。