DeepSeek 缓存价格最高涨 11 倍:长上下文需求激增,存储成本不再免费

2026/08/18 10:22阅读量 3

8 月 17 日,DeepSeek V4 Pro API 调整定价,缓存命中价格在高峰时段从 0.025 元/百万 Token 涨至 0.3 元/百万 Token,涨幅达 11 倍。背后是长上下文需求爆发导致缓存存储、调度和 IO 搬运成本急剧上升,DeepSeek 被迫开征“存储税”。

事件概述

DeepSeek 于 8 月 17 日调整了 V4 Pro API 的输入和输出价格,其中缓存命中价格涨幅最大:空闲时段上涨 5 倍,高峰时段从 0.025 元/百万 Token 涨至 0.3 元/百万 Token,涨幅达 11 倍

缓存命中是什么

缓存命中可类比为大模型的“草稿纸”:AI 处理长文本时,会将已计算过的内容以 KV Cache 形式暂存,后续请求可直接复用,避免重复计算。DeepSeek 依靠 KV 压缩技术和冷热记忆分层搬运架构,将缓存命中率做到极高,成为许多代码助手、知识库 Agent、长文档分析产品的性价比基石。

为什么涨价:存储、调度与搬运成本飙升

缓存命中虽然省去了重复计算的算力开销,但引入了三类新成本:

  • 存储成本:海量 KV 状态需分层存放在 GPU 显存、CPU 内存和 NVMe 磁盘;
  • 调度成本:每次请求需快速定位缓存块并分配资源;
  • IO 搬运成本:缓存需在磁盘、内存和显存之间搬运。

DeepSeek 的压缩技术(CSA 稀疏注意力 + HCA 重度压缩注意力)能显著缩小 KV 缓存体积——相比 V3 减少 90%,相比传统 GQA 架构仅剩约 2%。但即使压缩后,长上下文请求量指数级增长,GPU 显存、HBM 容量和总线带宽的物理上限依然被击穿。

高峰期大量百万 Token 级请求同时涌入,导致 GPU 显存被占满,调度系统频繁将缓存块“踢”到 NVMe 磁盘,引发“缓存颠簸”。数据在显存与磁盘间反复搬运,不仅没有加速,反而消耗大量 IO 资源和调度算力,严重时可使集群有效处理能力崩盘。DeepSeek 的涨价,正是为覆盖这部分“存储税”。

行业对比与开发者应对

Anthropic 和 OpenAI 同样面临缓存成本问题,但路径不同:

  • Anthropic:采用显式缓存断点机制,要求开发者手动标记缓存位置,并对首次写入缓存收取 1.25 倍或 2 倍溢价;
  • OpenAI:基础输入价格较高,有更充足的资金配置 HBM 显存以扩大缓存空间;
  • DeepSeek:因原有定价过低,直接转向涨价。

即便涨价,DeepSeek 仍是全球性价比最高的选择之一,且多数开发者已在 DeepSeek 的 KV Cache 层形成高命中缓存池,切换成本不低。开发者应优化缓存命中率,核心原则是:前缀必须完全匹配,差一个字符都会导致缓存失效。常见的踩坑点包括:

  • 将当前时间、用户 ID、随机参数放在 Prompt 开头,导致后续长文本缓存作废;
  • 前端拼接时多一个空格或换行符变更,被系统视为不同文本;
  • Agent 框架将工具结果插入上下文中间,打断后续内容的缓存边界。

开发者需要从“写 Prompt”转向“数据管理员”思维,将高频复用的热数据置于 Prompt 最前,管理冷热数据层级,以最大化缓存命中率,抵消涨价影响。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。