字节Seed团队揭示DeepSeek性能波动根源:KV Cache压缩导致的相位敏感性

2026/10/09 15:11阅读量 2

字节Seed团队研究发现,DeepSeek-V4系列模型在长上下文任务中表现不稳定,其准确率会随输入信息位置呈现周期性波动。这一现象被归因于模型采用的分块KV Cache压缩技术引发的“相位敏感性”,即信息在压缩窗口内的相对位置影响了检索效果。尽管后训练和架构迭代能缓解该问题,但根本性的周期差异依然存在,提示评估此类模型时需关注局部位置偏差。

事件概述

字节跳动Seed团队通过实验发现,DeepSeek-V4系列大模型在处理长上下文任务时存在显著的“神鬼二象性”:同一道题,仅在输入前增加无关字符改变Token站位,模型的输出结果便会在正确与错误间反复切换。研究指出,这种不稳定性并非随机噪声,而是由模型底层采用的分块KV Cache压缩机制引起的系统性缺陷, termed as Phase Sensitivity(相位敏感性)。

核心发现与数据

  1. 周期性波动特征:

    • 在代码补全测试中,DeepSeek-V4-Flash-Base对正确答案的概率分配随填充长度呈现以4个Token为周期的波动。当填充长度模4余数为0或1时,模型倾向于给出错误答案(概率71.3%);余数为2或3时,倾向于正确答案(概率91.5%)。
    • 在128K长上下文“大海捞针”检索测试中,仅因目标信息相对于压缩窗口边界的位置不同,DeepSeek-V4-Flash-Base的检索准确率最大差距达40.2个百分点,DeepSeek-V4-Pro-Base差距达34.8个百分点。
  2. 根因分析:分块KV Cache压缩:

    • DeepSeek-V4采用分块策略将连续Token分组压缩以节省内存。研究人员定义信息在压缩窗口内的相对位置为Phase(相位)。
    • 实验证实,模型对不同相位的信息检索能力存在系统性差异。即使Key和Value位于同一压缩窗口内,不同位置的检索准确率也显著不同。
    • 通过基于Qwen3-0.6B架构的重训实验验证,所有采用分块压缩的模型均出现与压缩步长对应的周期性波动,而全注意力基线模型未出现此现象。波动周期严格跟随压缩步长变化(如步长为4则周期为4,步长为6则周期为6)。
  3. 内部机制:相位专门化:

    • 注意力头分析显示,模型内部形成了Phase Specialization(相位专门化),即不同的注意力组件对压缩窗口内不同位置的信息产生偏好和分工。梯度流分析表明,这可能是模型在学习压缩信息过程中自然形成的稳定位置偏好。

进展与建议

  • 缓解措施:经过后训练(Post-training)和架构迭代,该问题有所改善但未根除。例如,DeepSeek-V4.1-Flash-0910版本的准确率差距缩小至6.1个百分点,且波动周期从4个Token变为2个Token,对应其新的压缩配置。
  • 评估建议:鉴于常规Benchmark通常汇总平均分,可能掩盖此类位置偏差。Seed团队建议,在评估采用分块KV Cache压缩的模型时,应将同一条信息置于不同压缩相位进行单独测试,以全面衡量其长上下文检索能力的鲁棒性。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。