AI推理算力瓶颈转向存储:中科曙光发布ParaCache打破“显存墙”

2026/09/01 11:58阅读量 2

随着大模型从训练转向大规模推理,KV Cache的内存开销导致GPU显存成为制约性能的关键瓶颈,“显存墙”问题日益凸显。为解决单机缓存资源孤岛及分布式存储延迟高的问题,中科曙光发布ParaCache系统,实现从HBM到分布式存储的四层全局池化与动态调度。实测数据显示,该方案在多轮对话场景下显著降低首包延迟并大幅提升吞吐量,标志着存储正从辅助角色转变为决定AI推理效率的核心要素。

事件概述

在大模型应用落地过程中,推理阶段已成为消耗算力的主要环节。由于多轮对话和RAG(检索增强生成)场景中大量重复请求的存在,传统的每次重新计算Prefill(预填充)的方式造成了巨大的算力浪费。业界共识是通过存储KV Cache(键值缓存)来换取计算时间,但受限于GPU高带宽内存(HBM)容量小、成本高的特点,引发了严重的“显存墙”问题。当前,AI基础设施支出中推理算力占比已超70%,存储正逐步取代纯算力堆叠,成为影响推理性能的关键变量。

核心信息

1. “显存墙”带来的挑战

  • 内存开销巨大:KV Cache随上下文长度和并发请求线性增长,单次推理内存开销可达数十至数百GB,远超单张顶级GPU显存容量。
  • 性能瓶颈:显存溢出导致新请求无法进入或处理卡顿,表现为吐字延时高、响应慢。
  • 现有方案局限
    • 算法压缩:虽能减少数据量,但难以根本解决容量问题。
    • 单机缓存(如LMCache):仅在GPU、CPU DRAM和本地SSD间调度,存在节点级资源孤岛,A节点的缓存B节点无法复用,且元数据管理混乱,缺乏全局视角。
    • 分布式存储(L4层):虽具备大容量和低成本优势,但传统强一致性锁机制带来高延迟,长期被视为“冷数据仓库”,难以满足实时推理需求。

2. 中科曙光ParaCache解决方案

针对上述痛点,中科曙光发布ParaCache,旨在将KV Cache管理从单机扩展至集群,实现四层(L1 HBM、L2 CPU DRAM、L3 SSD、L4分布式存储)的全局池化和动态调度。

  • L3层优化(FlashNexus Neo)
    • 引入专为AI设计的硬件系列,通过存算解耦实现全局共享。
    • 单阵列提供160GB/s带宽,相比本地NVMe SSD,在TTFT(首令牌生成时间)、QPS等指标上提升近2倍。
  • L4层优化(ParaStor F9000 + 软件策略)
    • 写入方式:采用追加写替代传统的offset覆盖写,降低延迟。
    • 锁机制轻量化:基于目录去除分布式锁或排他锁,解决强一致性带来的延迟问题。
    • 网络优化:在PD分离架构下,仅传输增量KV数据,节省集群网络带宽。
  • 全局调度机制
    • 提出“Best-effort数据预取”机制,利用判断与获取之间的时间差,提前将冷KV数据预取至所需层级,变被动等待为主动加速。

3. 实测效果与行业影响

  • 性能提升数据
    • 多轮对话场景:首次延迟降低89%;相较于仅使用HBM的方案,吞吐量提升近26倍。
    • 在线业务合作:TTFT降低77%,P99 TTFT优化84%,吞吐量提升3倍,缓存命中率提升5.7倍。
  • 行业趋势变化
    • 建设思路转变:智算中心规划从单纯关注GPU数量,转向算力、存储、网络及缓存的一体化TCO(总拥有成本)考量。
    • 存储角色重塑:KV Cache从临时中间产物变为可复用的数据资产,GPU围绕数据进行计算,存储成为推理效率的放大器。
    • 国产化机遇:国内大规模智算场景推动了存储技术的自主创新,国产分布式存储厂商迎来发展窗口期。

值得关注

  • 适用场景边界:ParaCache并非适用于所有场景。对于短请求(问一次即止)或极高实时性要求的交易型场景,收益不明显或无法完全替代HBM速度。其核心价值主要体现在多轮对话、知识库问答、RAG及AI智能体工作流等高KV Cache复用率的场景中。
  • 市场数据支撑:赛迪顾问报告显示,2025年中国分布式存储市场规模达289.4亿元,同比增长46%,四年累计增幅177.8%,显示存储市场正处于结构性变革期。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。