挑战 1 比特量化:ETH Zürich 秦浩桐在 IJCAI 2026 谈大模型端侧落地

2026/08/19 18:38阅读量 2

在 IJCAI 2026 上,苏黎世联邦理工学院博士后秦浩桐介绍了无需重训的极限量化方案:BiLLM 将权重压至约 1.08 比特,LLaMA-2 70B 在 WikiText-2 上困惑度仍达 8.41;SqueezeLLM 以 128 个权重为组动态分配比特,修复了 2 比特模型的可用性。他还指出,复杂任务隐性折损、硬件缺少低比特原生支持、激活值与 KV Cache 量化是下一阶段三大挑战。

事件概述

在德国不来梅举行的 IJCAI 2026 首日 Workshop “Generalizing from Limited Resources in the Open World” 中,苏黎世联邦理工学院博士后、即将任职香港理工大学的秦浩桐,分享了面向高效大语言模型的极限量化工作,核心目标是让模型无需重新训练即可被压缩到 1 比特或 2 比特,从而适配手机、汽车、便携医疗设备等资源受限场景。

当前大模型参数规模增速已约为硬件内存容量增速的 20 倍,靠下一代芯片填平差距并不现实,因此改变权重与激活值的数据表示精度,成为降低内存、带宽和功耗的关键路径。

核心信息

BiLLM:1 比特后训练量化

  • 传统后训练量化在 3 比特以下出现明显损耗,2 比特时困惑度可能飙升至数百,1 比特几乎不可用。
  • BiLLM 发现权重敏感性呈长尾分布:少数关键权重集中了大部分敏感度,且敏感权重在通道层面具有跨层一致性。
  • 关键权重被单独保留,其余呈钟形分布的普通权重按阈值分组,各自使用独立量化标准。
  • 最终平均约 1.08 比特/权重;LLaMA-2 70B 在 WikiText-2 上困惑度为 8.41,仍能生成连贯文本。对比之下,早期 GPTQ 等后训练方法在 2 比特时困惑度已超过 100。

SqueezeLLM:2 比特分组动态分配

  • 以 128 个权重为一组进行比特分配:按敏感度排序后,给重要组增加 1 比特,同时从不重要组扣除 1 比特,维持平均 2 比特。
  • 组内采用敏感度加权校准,避免少量关键权重被多数普通权重“平均”掉。
  • 在 LLaMA 7B 的 2 比特 WikiText 测试中,GPTQ 等基线困惑度达数百,SqueezeLLM 将困惑度拉回正常可用区间。
  • 在视觉语言模型测试中,2 比特 GPTQ、AWQ 已退化为乱码输出,SqueezeLLM 仍保持较高精度。

值得关注

秦浩桐认为,4 比特量化已接近开箱即用,2 比特分组量化与 1 比特敏感权重处理分别得到解决,但仍有三大挑战:

  1. 低于 2 比特的隐性质量折损:困惑度指标改善,但指令遵循、长文本对齐等复杂任务仍有明显能力损失。
  2. 硬件缺少原生低比特支持:现有 GPU 没有 INT2/1 比特原生运算通路,算法压缩比无法完全转化为实际运行加速。
  3. 激活值与 KV Cache 量化:当前工作主要集中在权重压缩,运行时高精度激活值与大规模 KV Cache 仍是进一步轻量化的硬骨头。

两项工作的代码均已开源。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。