大模型推理新解法:利用CPU与QAT硬件加速优化KV Cache,降低重复计算成本
随着AI Agent长上下文推理需求的增加,GPU显存中的KV Cache(键值缓存)管理成为瓶颈,导致缓存溢出后需重新Prefill,显著增加首字延迟(TTFT)。英特尔提出基于CPU侧管理的分层存储方案,结合QuickAssist Technology (QAT) 专用硬件压缩技术,实现KV Cache的高效卸载与复用。实测数据显示,该方案在特定场景下可将TTFT最高加速约5倍,并有效释放GPU算力以处理新任务。
事件概述
在大模型推理,特别是AI Agent的长上下文场景中,系统需要保存历史Token的中间状态(即KV Cache)以避免重复计算。然而,随着会话长度和并发请求的增加,GPU显存容量迅速耗尽。当缓存被清理或溢出时,系统必须对历史输入重新进行Prefill(预填充)计算,这导致首字延迟(TTFT)激增,且浪费了宝贵的GPU算力。为解决这一“记忆”成本问题,业界开始探索将部分缓存管理从GPU卸载至CPU及更底层的存储介质。
核心挑战:KV Cache的成本账
- 存储规模巨大:以Qwen3-8B模型为例,每个Token对应的KV数据约为147KB。若服务百万级上下文的请求,单个请求的缓存需求可达数百GB级别。在高并发场景下,数据中心面临的缓存池压力呈指数级增长。
- GPU资源挤占:GPU显存需同时容纳模型权重、运行时数据及KV Cache。缓存占用过多会减少并发处理能力;而频繁的清退与重算则导致GPU效率低下,用户等待时间延长。
- 传统软件方案的局限:虽然可以通过CPU内存或SSD进行缓存卸载(Offloading),但通用CPU核心的软件压缩和解压速度慢,可能成为新的性能瓶颈,且占用大量CPU调度资源。
解决方案:英特尔的KV Cache优化架构
英特尔提出了一套面向数据中心的KV Cache优化思路,核心在于利用CPU的管理能力与专用硬件加速,实现“以存代算”。主要技术方向包括KV Shrink、KV Fuse、KV Cascade和KV Infinity,其中KV Shrink已具备具体落地案例。
1. KV Shrink:分层管理与硬件压缩
- 分层存储策略:系统根据缓存的热度(访问频率)动态管理数据位置。高频活跃数据保留在GPU HBM显存中;中频数据暂存于CPU DDR内存;低频历史数据下沉至SSD或远端存储。这种机制由CPU侧的管理逻辑统一调度。
- QAT硬件加速压缩:引入英特尔QuickAssist Technology (QAT) 专用加速单元,负责数据的压缩与解压。相比纯软件压缩,QAT大幅降低了CPU负载,并提升了吞吐速度。
- 存储格式优化:通过重新排列KV Cache的存储格式,提升无损压缩率。测试显示,压缩节省空间从10%提升至20%-30%,显著缩小了缓存池的物理体积。
2. 其他辅助技术
- KV Fuse:针对多文档组合场景,通过缓存融合和部分重计算,尝试复用不同文档间可共享的KV Cache,减少冗余处理。
- KV Cascade:引入辅助模型先筛选相关内容,缩小主模型的处理范围,从而降低主模型的KV Cache生成量。
- KV Infinity:面向超长任务,通过按需加载和预取机制,缓解显存压力,允许利用非HBM资源扩展上下文窗口。
实测效果与结论
在双路至强金牌6554S处理器、两张英伟达L20 GPU及Qwen3-32B模型的测试环境中:
- TTFT加速:相较于未开启分层卸载的原生vLLM基线,启用KV Shrink后,在80%缓存命中率下,首字延迟(TTFT)最高获得约5倍加速。
- 压缩效率:QAT硬件压缩方案的整体性能约为CPU软件压缩方案的两倍,且开启压缩带来的额外TTFT开销低于10%。
- Agent场景表现:在与道客联合实验室的Coding Agent测试中,相较LMCache方案,KV Shrink在单路负载下平均TTFT降低约12.1%,八路并发时降低约4.6%。
行业启示
该方案的核心价值在于将GPU从繁重的“记忆”管理中解放出来,使其专注于生成新Token的计算任务。通过CPU侧的智能调度和QAT硬件加速,数据中心能够在保证响应速度的前提下,以更低的存储成本和更高的并发能力服务长上下文AI应用。实际部署效果需结合具体的业务负载、上下文长度及缓存命中率进行综合评估。
