挑战 1 比特量化:ETH Zürich 秦浩桐在 IJCAI 2026 谈大模型端侧落地
2026/08/19 18:38阅读量 2
在 IJCAI 2026 上,苏黎世联邦理工学院博士后秦浩桐介绍了无需重训的极限量化方案:BiLLM 将权重压至约 1.08 比特,LLaMA-2 70B 在 WikiText-2 上困惑度仍达 8.41;SqueezeLLM 以 128 个权重为组动态分配比特,修复了 2 比特模型的可用性。他还指出,复杂任务隐性折损、硬件缺少低比特原生支持、激活值与 KV Cache 量化是下一阶段三大挑战。
事件概述
在德国不来梅举行的 IJCAI 2026 首日 Workshop “Generalizing from Limited Resources in the Open World” 中,苏黎世联邦理工学院博士后、即将任职香港理工大学的秦浩桐,分享了面向高效大语言模型的极限量化工作,核心目标是让模型无需重新训练即可被压缩到 1 比特或 2 比特,从而适配手机、汽车、便携医疗设备等资源受限场景。
当前大模型参数规模增速已约为硬件内存容量增速的 20 倍,靠下一代芯片填平差距并不现实,因此改变权重与激活值的数据表示精度,成为降低内存、带宽和功耗的关键路径。
核心信息
BiLLM:1 比特后训练量化
- 传统后训练量化在 3 比特以下出现明显损耗,2 比特时困惑度可能飙升至数百,1 比特几乎不可用。
- BiLLM 发现权重敏感性呈长尾分布:少数关键权重集中了大部分敏感度,且敏感权重在通道层面具有跨层一致性。
- 关键权重被单独保留,其余呈钟形分布的普通权重按阈值分组,各自使用独立量化标准。
- 最终平均约 1.08 比特/权重;LLaMA-2 70B 在 WikiText-2 上困惑度为 8.41,仍能生成连贯文本。对比之下,早期 GPTQ 等后训练方法在 2 比特时困惑度已超过 100。
SqueezeLLM:2 比特分组动态分配
- 以 128 个权重为一组进行比特分配:按敏感度排序后,给重要组增加 1 比特,同时从不重要组扣除 1 比特,维持平均 2 比特。
- 组内采用敏感度加权校准,避免少量关键权重被多数普通权重“平均”掉。
- 在 LLaMA 7B 的 2 比特 WikiText 测试中,GPTQ 等基线困惑度达数百,SqueezeLLM 将困惑度拉回正常可用区间。
- 在视觉语言模型测试中,2 比特 GPTQ、AWQ 已退化为乱码输出,SqueezeLLM 仍保持较高精度。
值得关注
秦浩桐认为,4 比特量化已接近开箱即用,2 比特分组量化与 1 比特敏感权重处理分别得到解决,但仍有三大挑战:
- 低于 2 比特的隐性质量折损:困惑度指标改善,但指令遵循、长文本对齐等复杂任务仍有明显能力损失。
- 硬件缺少原生低比特支持:现有 GPU 没有 INT2/1 比特原生运算通路,算法压缩比无法完全转化为实际运行加速。
- 激活值与 KV Cache 量化:当前工作主要集中在权重压缩,运行时高精度激活值与大规模 KV Cache 仍是进一步轻量化的硬骨头。
两项工作的代码均已开源。
