小米公开 MiMo-V3 核心架构 HySparse2:KV 共享升两级、Prefill 少跑一半

2026/09/24 16:50阅读量 3

小米开源了 MiMo-V3 的核心架构 HySparse2,旨在优化大语言模型的推理效率。该架构通过升级 KV Cache 共享机制至两级,并显著减少 Prefill(预填充)阶段的计算量,从而提升整体性能。这一技术突破展示了小米在降低大模型推理成本方面的最新进展。

事件概述

小米近日公开了其大语言模型 MiMo-V3 的核心架构 HySparse2。该技术重点针对大模型推理过程中的效率瓶颈进行了优化,特别是在键值缓存(KV Cache)管理和预填充(Prefill)阶段的表现上取得了显著改进。

核心信息

  • KV 共享机制升级:HySparse2 将 KV Cache 的共享层级从原有水平提升至两级。这种多级共享策略有助于更有效地利用内存资源,减少重复数据的存储和访问开销,从而提升推理速度。
  • Prefill 阶段优化:架构对 Prefill(预填充)阶段进行了大幅精简,使得该阶段的计算量减少了约一半。Prefill 是处理用户输入提示词的关键步骤,其计算量的降低直接缩短了首字生成时间(TTFT),提升了用户体验。
  • 技术目标:通过上述两项核心改进,HySparse2 旨在降低大语言模型的推理成本,提高吞吐量,为大规模部署提供更具性价比的技术方案。

值得关注

此次开源不仅展示了小米在底层架构优化上的技术实力,也为行业提供了参考大模型高效推理的新思路。随着大模型应用规模的扩大,如何在不牺牲精度的前提下降低推理延迟和资源消耗,成为各大厂商竞争的关键领域。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。