紫东太初提出GMC核心集剪枝方法:减少80%视觉Token仍保持多模态能力

2026/08/12 18:54阅读量 2

中国科学院自动化研究所紫东太初团队提出核心集剪枝方法GMC,通过互补证据自适应筛选与群体互补信息传输两阶段,在免训练条件下高效压缩视觉Token。在Qwen2.5-VL-7B上减少80.2% Token仍保留97.78%平均能力,在LLaVA-1.5-7B上减至64个Token仍达99.82%,并显著降低KV Cache占用。

紫东太初大模型团队提出一种名为 GMC(Grounded Message Coreset Pruning)的核心集剪枝方法,用于解决多模态大模型中视觉 Token 冗余带来的显存开销大、推理速度慢、部署成本高问题。该方法无需训练,也无需额外模型,可直接适配 Qwen、LLaVA 等主流视觉语言模型。

核心方法

GMC 采用双阶段架构:

  1. 互补证据自适应筛选:从问题语义、视觉外观、空间位置三个角度构建证据,优先选择对尚未覆盖证据有新增贡献的 Token,避免注意力集中在画面显著区域而遗漏文字、数字、坐标轴等分散关键信息。
  2. 群体互补信息传输:将未选中 Token 的隐藏状态传输到最合适的代表 Token 中,综合考虑视觉特征相似性和空间邻近关系,将大量视觉 Token 聚合为紧凑表示,保留细节信息。

GMC 不需要任务标签、参数更新、辅助检测器、OCR 模型或额外模型,开箱即用;实现的是真实序列压缩,而非掩码隐藏,因此可实际减少后续解码层计算和 KV Cache 占用。

关键实验结果

  • Qwen2.5-VL-7B:完整模型含 1296 个视觉 Token。减少 80.2%(保留 256 个)时,保留完整模型 97.78% 的平均能力;减少 90.1%(保留 128 个)时,仍保持 99.11% 的平均能力。
  • LLaVA-1.5-7B:保留 128 个和 64 个视觉 Token 时,平均性能分别达到完整模型的 99.76% 和 99.82%,验证了跨架构迁移能力。
  • 幻觉评测:在 POPE、AMBER、HallusionBench、CHAIR 等基准上,GMC 在相同 Token 预算下能更完整保留事实判断所需视觉证据,减少错误描述和信息遗漏。
  • 长文档问答场景:面对 15876 个原始视觉 Token 的输入,GMC 保持完整模型 98.87% 的问答质量,实现 1.258 倍端到端推理加速,并减少 73.94% 的提示 KV Cache。

实验表明,GMC 在压缩 Token 的同时性能与完整模型持平甚至略高,说明其不仅能降低计算量,还能通过移除无关信息起到去噪效果,轻微提升多模态理解能力。

论文地址:https://arxiv.org/abs/2608.02134v1

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。