AI推理算力瓶颈转向存储:中科曙光发布ParaCache打破“显存墙”
2026/09/01 11:58阅读量 2
随着大模型从训练转向大规模推理,KV Cache的内存开销导致GPU显存成为制约性能的关键瓶颈,“显存墙”问题日益凸显。为解决单机缓存资源孤岛及分布式存储延迟高的问题,中科曙光发布ParaCache系统,实现从HBM到分布式存储的四层全局池化与动态调度。实测数据显示,该方案在多轮对话场景下显著降低首包延迟并大幅提升吞吐量,标志着存储正从辅助角色转变为决定AI推理效率的核心要素。
事件概述
在大模型应用落地过程中,推理阶段已成为消耗算力的主要环节。由于多轮对话和RAG(检索增强生成)场景中大量重复请求的存在,传统的每次重新计算Prefill(预填充)的方式造成了巨大的算力浪费。业界共识是通过存储KV Cache(键值缓存)来换取计算时间,但受限于GPU高带宽内存(HBM)容量小、成本高的特点,引发了严重的“显存墙”问题。当前,AI基础设施支出中推理算力占比已超70%,存储正逐步取代纯算力堆叠,成为影响推理性能的关键变量。
核心信息
1. “显存墙”带来的挑战
- 内存开销巨大:KV Cache随上下文长度和并发请求线性增长,单次推理内存开销可达数十至数百GB,远超单张顶级GPU显存容量。
- 性能瓶颈:显存溢出导致新请求无法进入或处理卡顿,表现为吐字延时高、响应慢。
- 现有方案局限:
- 算法压缩:虽能减少数据量,但难以根本解决容量问题。
- 单机缓存(如LMCache):仅在GPU、CPU DRAM和本地SSD间调度,存在节点级资源孤岛,A节点的缓存B节点无法复用,且元数据管理混乱,缺乏全局视角。
- 分布式存储(L4层):虽具备大容量和低成本优势,但传统强一致性锁机制带来高延迟,长期被视为“冷数据仓库”,难以满足实时推理需求。
2. 中科曙光ParaCache解决方案
针对上述痛点,中科曙光发布ParaCache,旨在将KV Cache管理从单机扩展至集群,实现四层(L1 HBM、L2 CPU DRAM、L3 SSD、L4分布式存储)的全局池化和动态调度。
- L3层优化(FlashNexus Neo):
- 引入专为AI设计的硬件系列,通过存算解耦实现全局共享。
- 单阵列提供160GB/s带宽,相比本地NVMe SSD,在TTFT(首令牌生成时间)、QPS等指标上提升近2倍。
- L4层优化(ParaStor F9000 + 软件策略):
- 写入方式:采用追加写替代传统的offset覆盖写,降低延迟。
- 锁机制轻量化:基于目录去除分布式锁或排他锁,解决强一致性带来的延迟问题。
- 网络优化:在PD分离架构下,仅传输增量KV数据,节省集群网络带宽。
- 全局调度机制:
- 提出“Best-effort数据预取”机制,利用判断与获取之间的时间差,提前将冷KV数据预取至所需层级,变被动等待为主动加速。
3. 实测效果与行业影响
- 性能提升数据:
- 多轮对话场景:首次延迟降低89%;相较于仅使用HBM的方案,吞吐量提升近26倍。
- 在线业务合作:TTFT降低77%,P99 TTFT优化84%,吞吐量提升3倍,缓存命中率提升5.7倍。
- 行业趋势变化:
- 建设思路转变:智算中心规划从单纯关注GPU数量,转向算力、存储、网络及缓存的一体化TCO(总拥有成本)考量。
- 存储角色重塑:KV Cache从临时中间产物变为可复用的数据资产,GPU围绕数据进行计算,存储成为推理效率的放大器。
- 国产化机遇:国内大规模智算场景推动了存储技术的自主创新,国产分布式存储厂商迎来发展窗口期。
值得关注
- 适用场景边界:ParaCache并非适用于所有场景。对于短请求(问一次即止)或极高实时性要求的交易型场景,收益不明显或无法完全替代HBM速度。其核心价值主要体现在多轮对话、知识库问答、RAG及AI智能体工作流等高KV Cache复用率的场景中。
- 市场数据支撑:赛迪顾问报告显示,2025年中国分布式存储市场规模达289.4亿元,同比增长46%,四年累计增幅177.8%,显示存储市场正处于结构性变革期。
