不用再训练替代网络:至知研究院提出SWD,直接拆权重做可解释性
至知创新研究院联合牛津、斯坦福、清华等机构提出稀疏权重分解(SWD),从预训练权重中直接拆出可干预的稀疏瓶颈单元,用于任务回路分析。在单矩阵替换保真度实验中,SWD的数据成本不到Transcoder等训练型基线的1%,并已在GPT-2、Qwen2.5和Qwen3.5-27B上验证,还提供无需校准数据的zero-data版本。
事件概述
至知创新研究院联合Safe AI Forum、牛津大学、斯坦福大学和清华大学,提出稀疏权重分解(Sparse Weight Decomposition, SWD)。已有机制可解释性方法常需重新训练一套稀疏替代网络(如Transcoder、稀疏特征模块)来理解已训练好的模型;SWD则直接从预训练权重中分解出可独立干预的稀疏单元,无需训练替代网络。论文已发布于arXiv: https://arxiv.org/abs/2608.03913。
方法核心
SWD将稠密权重矩阵 W 分解为两个稀疏矩阵 A 和 B,满足 W ≈ AB。A、B共享m个中间维度,每个维度对应一个“瓶颈单元”(rank-one读写路径)。这些单元可以被单独评分、筛选、消融,也可用于编辑模型行为。
与SVD相比,SVD成分的读/写方向通常是稠密的,即使只保留少数成分也会连接几乎所有输入输出维度;SWD对每个单元施加稀疏性,使少量单元对应少量活跃连接。即使full-rank SVD和随机正交基的Random-B能精确还原原权重,在相同因果归因/消融流程下,也需要更多活跃连接才能达到与SWD相同的任务表现。
关键结果
- 数据效率:在GPT-2 Small第8层mlp.c_proj单矩阵实验中,SWD仅用数千个校准token即可进入低CE误差区间;Transcoder和VPD-Recon-CI等训练型基线需要约10^6量级token。综合单矩阵比较,SWD达到匹配保真度所需数据不到训练型替代表示的1%。该趋势在Qwen2.5-0.5B/1.5B/3B和Qwen3.5-27B上同样成立。
- 任务回路:在GPT-2 Small的GreaterThan、IOI、Docstring、Gendered Pronoun四项任务中,SWD达到相同充分性/必要性要求时,通常比Transcoder和VPD-Recon-CI需要更少的瓶颈单元和活跃连接;将平均激活消融换成零消融后优势仍保持。在Qwen3.5-27B第31层mlp.down_proj上,SWD也以更少数据和活跃连接达到目标。
- 全模型替换:将GPT-2 Small全部12个Transformer block中的48个注意力和MLP权重矩阵替换为SWD,并固定稀疏结构只微调非零值(SWD-FT),模型CE从3.90降至3.44,接近稀疏预训练基线(CE 3.45);SWD-FT使用约2060万token,基线使用28.84亿token,前者不到后者的1%。
- Zero-data版本:完全不使用校准文本、直接最小化Frobenius误差的SWD,在权重空间中更接近原矩阵;使用激活校准的SWD在高稀疏度下保留模型行为更好。即使zero-data版本,也能抽取有效任务回路。
可解释性与编辑
在GreaterThan任务中,团队对GPT-2 Small全部9208个候选mlp.c_proj瓶颈单元进行归因排序。展示的6个高排名单元中,4个集中响应数字、年份、数量或度量信息,另外2个对应标点、句法和命名实体;这些语义模式独立于单元选择过程。
定向编辑实验中,对瓶颈单元c205施加读方向诱导的rank-one更新后,在提示“The opposite of up is”上,正确答案“down”相对干扰答案“left”的logit margin提升0.216;在7条无关事实提示上的平均末token KL为4.02×10⁻⁵。在相近正向目标变化下,该单单元方向的副作用低于随机单元和rank-4 LoRA对照。
结论
SWD表明,预训练权重本身可以被重构成稀疏、可寻址、可因果检验的计算路径。从数据成本、单元数量、模型规模到无校准版本,该方法为机制可解释性提供了一条更轻量的技术路线。
