字节论文揭示 DeepSeek V4 分块压缩缺陷:位置敏感导致“神鬼二象性”

2026/10/10 19:40阅读量 5

字节跳动团队最新研究发现,DeepSeek V4 系列模型因采用分块 KV Cache 压缩技术,存在严重的“相位敏感性”Bug。该缺陷导致模型对 Token 在压缩块内的相对位置极度敏感,关键信息若落在特定槽位易被忽略,造成准确率大幅波动。这一现象并非 DeepSeek 独有,而是固定长度分块压缩方案的结构性通病,业界正探索动态分块等新技术以解决长文本处理中的信息丢失问题。

事件概述

9月底,字节跳动团队发表题为《Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression》的论文,指出 DeepSeek V4 系列大模型存在被称为“神鬼二象性”的性能缺陷。该缺陷源于底层采用的分块 KV Cache 压缩技术,导致模型在处理长上下文时出现周期性失忆,即使输入仅增加少量空格或装饰字符,也可能引发答案从准确到错误的剧烈波动。

核心发现与机制分析

1. “神鬼二象性”现象实证
研究人员通过代码补全测试发现,当在输入代码前添加不同数量的等号(纯装饰字符)时,DeepSeek-V4-Flash-Base 的输出结果呈现规律性错误:

  • 高错误率区间:当等号数量除以 4 余数为 0 或 1 时,模型答错概率高达 71.3%。
  • 高正确率区间:当余数为 2 或 3 时,模型正确率可达 91.5%。

这种错误并非随机噪声,而是与输入长度和压缩步长直接挂钩。

2. 根本原因:相位敏感性 (Phase Sensitivity)
DeepSeek 为缓解长上下文显存压力,将连续 Token 按固定长度切割并压缩。在此过程中:

  • 位置权重差异:每个 Token 在压缩段内的相对位置(即“相位”)决定了其被保留的概率。门控层会为不同位置的 Token 分配不同的“槽位增益因子”。
  • 注意力头专门化:模型内部的注意力头形成了分工,部分头专门处理段内靠前或靠后的位置,导致某些排位成为信息处理的薄弱环节。
  • 大海捞针测试验证:在 128K Token 的上下文中,同一键值对在不同位置的检索准确率最大差距达 40.2%(DeepSeek-V4-Pro-Base 为 34.8%)。即使经过后训练优化,差距依然显著。

3. 通用性验证
字节团队使用 Qwen3-0.6B 架构进行对照实验,证实只要采用固定长度分块压缩,无论是否调整 RoPE 位置编码或改变门控权重策略,都会出现周期性的准确率波动。波动周期严格等于压缩步长。这表明这是方案本身的结构缺陷,而非参数调优问题。

行业影响与技术演进

1. 普遍性问题
该缺陷不仅限于 DeepSeek,采用类似分块压缩或稀疏化技术的模型(如 Llama 3 系列)均存在类似问题。随着行业追求降低长文本处理成本,此类“牺牲精度换效率”的方案带来了新的可靠性风险。

2. 现有缓解措施的局限
DeepSeek 后续推出的 V4.1-Flash 版本将压缩步长减半,虽将准确率差距降至 6.1%,但未能根除问题。只要存在固定的压缩边界,关键信息落入“盲区”的风险就无法完全消除。

3. 未来方向:动态分块 (Dynamic Chunking)
业界正转向更灵活的“动态分块”技术,旨在根据语义密度而非固定 Token 数量来划分上下文:

  • ChunkKV (香港科技大学):以连续语义块为单位进行压缩,避免打断完整的主谓宾结构,在 NIAH 基准测试中显著优于传统方法。
  • Jina AI 延迟分块:先让模型完整理解全文逻辑,仅在输出前按语义边界切分,保留全局上下文。
  • MInference (微软亚洲研究院):针对超长文本推理,利用注意力矩阵的稀疏规律,在不降低准确率的前提下实现预填充阶段最高 10 倍加速。

这些技术试图重构注意力的数学基础、显存管理及硬件对齐方式,以解决长文本场景中“读不懂、找不准”的核心痛点。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。