GMIF 2026:日均140万亿Token调用倒逼存储架构重构,SSD角色从“兜底”转向“主动调度”

2026/10/10 09:38阅读量 4

在AI推理需求激增背景下,中国日均Token调用量已突破140万亿,导致存储系统面临数据丰富度、推理复杂度和运营持久性三重压力。传统基于容量和成本的静态存储分层正在失效,SSD正向上承接靠近GPU的热数据(如KV Cache),向下替代HDD以节省空间功耗,并探索存内计算与高带宽闪存技术。行业共识认为,数据管理已从被动降级转为系统设计之初的主动分层与运行中的动态调度,数据供给效率直接决定算力产出。

事件概述

第五届GMIF 2026全球存储器行业创新峰会指出,随着AI从训练端走向规模化推理应用,存储行业正经历深刻变革。摩根士丹利数据显示,未计入HBM的情况下,2026年全球云数据中心资本支出中存储占比接近五成,2027年预计升至53%。截至今年3月,中国日均Token调用量突破140万亿,这一量级相当于中国国家图书馆藏书Token量的20倍以上,迫使存储介质在容量、带宽、时延和耐久性上补齐短板,存储层级分工被进一步细分。

核心信息

1. AI推理带来的三重存储压力

  • 数据丰富度:Agent类应用需同时处理语音、视觉、车辆信号等多模态数据,并结合对话历史、用户画像及实时状态进行判断,数据来源、形态和更新频率各异。
  • 推理复杂度:模型变大增加权重和运行时状态;上下文变长导致KV Cache增加;多用户并发服务要求为每个请求保留独立KV Cache;Decode阶段模型权重和KV Cache需反复访问。
  • 运营持久性:企业级Agent数量可能增至数百个,需24小时待命执行长程任务和高并发请求,对首Token时延、成功率和吞吐量提出持续保障要求。

2. SSD能力的边界拓展与角色重塑

面对不同任务对低时延、高吞吐和高带宽的差异化需求,SSD正在多个维度升级:

  • 内部资源调度:慧荣科技通过主机软件和存储软件栈识别任务类型,由SSD控制器按QoS等级调整资源配置,使同一块SSD响应不同AI负载。
  • 位置分级部署:闪迪将SSD分为三类:直接连接GPU的SSD承接热KV等高频数据;网络连接GPU的SSD服务更大规模计算;位于集群外的存储型SSD侧重容量,承载低频数据。
  • 向下替代HDD:北美大型互联网公司开始用大容量QLC SSD替代部分HDD,以减少机房空间和功耗开销。
  • 测试标准变化:欧康诺在AI SSD测试中加入深度学习I/O负载、KV Cache及断点恢复场景,以应对突发、高并发等复杂I/O行为。

3. NAND技术的激进突破

底层NAND介质也在突破原有边界:

  • 性能提升:三星推出Z-NAND,基于SLC Die并集成TSV技术,将读取密集的模型权重放入Z-NAND,操作系统和KV Cache保留在DRAM,以缓解端侧推理对DRAM的成本压力。
  • 高带宽闪存(HBF):北京大学蔡一茂介绍两条路径:一是缩小阵列尺寸降低读取时延;二是借鉴HBM思路增加接口数量提升带宽。但需解决密度牺牲、时延偏高及写入寿命短等问题。
  • 存内计算:北大与燕芯微等合作伙伴探索利用NAND阵列直接完成部分存内计算,减少数据往返。

4. 从“兜底”到“主动调度”的数据管理范式转移

传统存储层级依赖速度、容量与成本的权衡,数据跨层移动多为“HBM不够给DRAM、DRAM不够给SSD”的兜底式分层。如今,软硬件变化促使数据管理转向主动分层和动态调度:

  • 联芸与寅谱方案:针对MoE模型,暂不调用的专家权重放入SSD,并通过预测预取下一阶段的参数;高频KV Cache留内存,低频下沉至SSD。
  • 集群级调度:杰创智能常青云平台打通“数据-存储-计算”链路,根据任务类型、GPU代际和网络带宽,提前将数据准备到相应节点并匹配算力资源。

佰维存储董事长孙成思指出,“数据供给的效率决定算力的产出”。在AI推理规模化、高并发和持续运行的趋势下,存储的核心问题已从“数据放在哪里”转变为“如何让数据及时抵达算力”。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。