AI推理爆发倒逼存储变革:从数据仓库转向计算节点

2026/09/09 14:42阅读量 3

随着AI市场从训练驱动转向推理驱动,存储系统已成为制约大模型落地的核心瓶颈。由于KV Cache等长上下文数据的激增,传统存储架构面临带宽不足、延迟抖动及写入放大等问题。行业正通过HBM4E硬件升级、CXL内存池化以及GPU直连软件栈(如AiSIO)进行软硬协同优化,推动存储向“近数据计算”和定制化服务转型。

事件概述

在AI算力市场中,重心正由“训练”向“推理”发生根本性转移。全球AI推理算力市场规模预计2026年占比将达到70.5%,远超训练算力。这一转变导致存储系统从幕后走向台前,成为决定AI系统性价比与性能的关键变量。当前,GPU常因等待数据而空转,存储层的能力直接决定了整个AI基础设施的效率。

核心挑战:推理时代的存储痛点

  1. 数据供给瓶颈:传统存储系统基于CPU设计,数据需经CPU和主机内存中转才能到达GPU,造成高达73%的软件开销浪费,无法喂饱高速GPU。
  2. KV Cache溢出与写入放大:Transformer架构中,长上下文生成的KV Cache体积巨大且线性增长。当KV Cache从昂贵的HBM溢出至SSD时,不同请求的数据交错存储导致严重的“写入放大”,不仅缩短SSD寿命,还降低系统吞吐。
  3. 显存容量限制:万亿参数MoE(混合专家)模型虽稀疏激活,但全部专家权重仍需常驻显存,超出单机HBM容量,迫使权重下沉至系统内存和SSD,对SSD随机读取性能提出极高要求。

产业应对:硬件提速与软件减负

为应对上述挑战,存储厂商与芯片巨头正从硬件和软件两个维度进行重构:

  • 硬件层面:HBM与新型介质突破

    • HBM4E竞争加剧:三星于2026年5月率先交付12层HBM4E样品,SK海力士紧随其后。新一代HBM单堆栈容量达48GB,带宽提升至3.6TB/s,能效提升超16%,以更高密度满足AI对内存带宽的需求。
    • CXL内存池化:三星展示基于CXL 3.2协议的CMM-D 320内存模块,实现接近本地DDR的极低延迟(约110纳秒),支持CPU直接寻址,适用于推理侧KV Cache卸载。
    • 端侧创新:三星推出zNAND-O技术,将NAND与NPU集成封装,以DRAM级带宽实现十倍于DRAM的位元密度,降低端侧AI内存成本。
    • SSD产品线分化:面向高性能场景推出PCIe Gen6 SSD(PM1763),面向大容量场景推出QLC SSD(BM1773),覆盖从热数据到冷归档的全谱系需求。
  • 软件层面:去CPU化与智能固件

    • GPU直连存储(GiDS):英伟达开源cuFile API并推出SCADA架构,AMD推进ROCm-XIO,旨在让GPU以微秒级速度直接读写存储,剥离CPU负担。三星发布开源框架AiSIO,在测试中实现6150万IOPS且仅占用1.5个CPU核心,兼容现有文件系统。
    • FDP(灵活数据放置)技术:针对KV Cache写入放大问题,三星引入FDP技术,将生命周期相同的数据物理隔离存放。实测显示峰值WAF降低49%,NAND写入量减少36%,显著延长SSD寿命并提升稳定性。

未来趋势:存储即计算

存储行业的角色正在从单纯的数据容器演变为具备计算能力的节点,“近数据计算”成为必然方向:

  1. 盘内计算增强:SSD内置压缩/解压引擎及向量索引能力,在存储侧完成相似度检索等预处理,减轻主机和网络负担。
  2. 管理权下沉:KV Cache的热冷分层、预取及过期回收等调度逻辑,正从推理框架下沉至存储固件,形成“存储即缓存层级”。
  3. 边界模糊化:CXL技术与高带宽闪存(HBF)的发展,使得内存与存储的物理界限逐渐消失,数据移动代价高昂背景下,计算向数据靠拢成为主流范式。
  4. 服务模式转型:存储厂商从提供标准化硬件转向提供软硬协同的定制化解决方案,深入客户业务场景,与云厂商联合设计以闭环解决性能问题。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。