华为推出OceanStor M900专管KV Cache,专用SSD标准仍待确立

2026/10/08 11:55阅读量 2

随着大模型推理中KV Cache规模激增,华为发布OceanStor M900、英伟达推出CMX Context Memory Storage等独立存储方案,旨在通过“以存换算”降低算力开销。尽管行业共识已转向将历史KV缓存至SSD以缓解DRAM压力,但由于不同应用场景下数据生命周期差异巨大,面向AI推理的专用SSD在耐久度(DWPD)和容量上尚未形成统一标准,市场仍处于定制化探索阶段。

事件概述

在大模型推理过程中,键值缓存(KV Cache)的数据量日益庞大,已成为影响系统性能的关键因素。近期,华为在全联接大会上推出了OceanStor M900,英伟达也发布了CMX Context Memory Storage。这些产品标志着AI记忆存储从服务器内部的分层管理走向独立的共享存储层,核心逻辑是通过分层管理和复用历史KV Cache,减少重复计算,从而节省算力开销。

核心信息:以存换算的成本账

1. 命中率提升的价值
行业普遍认为,即使缓存命中率从90%提升至95%,其价值依然显著。因为重新计算的部分从10%降至5%,相当于相关算力开销减半。然而,在高命中率区间,为了覆盖长尾数据,所需的存储容量会明显增加。

2. DRAM与SSD的替代关系

  • 成本差异:DRAM昂贵且供应紧张,而企业级SSD成本相对较低。两者并非1:1替换,而是呈现“1:N”的关系(如1:5或1:10),按相同容量计算,DRAM与企业级SSD成本可相差数十倍。
  • 应用策略:消费端应用的KV Cache生命周期短(几分钟至几小时),而企业端应用更看重上下文持续性,KV Cache保留时间更长,复用价值更高。目前多数推理场景仍优先利用服务器内现有的DRAM和本地SSD,但随着成本压力增大,内存卸载正进入新系统的初始设计。

3. KV Cache对HBM的影响有限
外置KV存储主要缓解的是DRAM的压力,而非显存(HBM)。外部存储主要影响首Token延迟(即从外部调回历史KV的速度),一旦开始生成Token,后续速度仍依赖高速显存。

值得关注:专用SSD标准缺失

尽管独立KV存储设备已出现,但承接这些数据的专用SSD尚未形成成熟、统一的产品品类。

1. 负载指标反复波动
由于KV Cache的数据生命周期从分钟到周不等,导致SSD的耐写能力(DWPD, Drive Writes Per Day)需求难以确定:

  • 若缓存仅保存几分钟,数据频繁更新,对耐久度要求极高(如3 DWPD升至9 DWPD甚至更高)。
  • 若缓存保存数周,写入频率下降,容量需求则成为主要矛盾。

2. 标准化进程缓慢

  • 现状:目前客户采购的多为三星、闪迪、美光等传统企业级SSD,而非针对KV Cache优化的专用SSD。
  • 原因:不同业务场景下的负载特征差异大,若缺乏统一标准,产品将长期停留在定制化阶段,无法形成规模效应。
  • 时间表:业内估算,形成较统一的产品共识可能需要6至12个月;即便标准确定,后续产品开发、验证和优化还需约1年。

3. 搬运成本与存算一体
SSD解决了“存得下、存得有性价比”的问题,但未解决数据搬运开销。存算一体(CIM)技术试图通过在数据附近完成计算来减少权重和中间数据的搬运,尤其在Prefill阶段高并发场景下优势明显。然而,CIM并不能替代历史KV Cache的大容量存储需求,历史对话产生的大量KV仍需保存在SSD中,以便后续请求命中时调回计算路径。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。