Apple研究:通过潜在空间蒸馏压缩流式神经音频编码器

2026/09/24 08:00阅读量 2

Apple研究人员提出了一种基于潜在空间蒸馏的方法来压缩用于设备端语音识别的流式神经音频编码器(Tokenizer)。该方法以预量化器的潜在表示为监督目标,而非离散token或输出分布,从而在保持精度的同时显著降低参数量。实验表明,在2.8倍压缩率下,蒸馏后的学生模型在六个教师-学生配对中的五个上仅产生1.9%的相对WER误差,且无需微调即可超越同等容量的独立训练模型。

事件概述

Apple Machine Learning Research团队发表了一篇关于压缩流式神经音频编码器的论文。该研究旨在优化Apple设备上系统级听写功能中使用的Tokenizer,通过潜在空间蒸馏技术减少其参数规模,从而降低内存占用、功耗和延迟。

核心信息

  • 背景与挑战:Apple设备的系统级听写完全在设备端运行。Tokenizer将波形短窗口映射为语言模型可读的表示。由于采用指令跟随剪枝(Instruction-Following Pruning),基础模型稀疏激活,Tokenizer需与少量活跃的专家共享DRAM资源。因此,Tokenizer的参数数量直接影响设备的功耗和延迟。

  • 方法创新

    • 监督目标:不同于传统的离散token或输出分布,本研究使用预量化器前的**潜在表示(latent)**作为蒸馏的监督目标。这是两个Token接口共享的最后一种表示形式。
    • 训练策略:仅训练学生编码器,使其在平方误差目标下回归教师的逐帧潜在表示。使用单个仿射层吸收教师与学生之间的宽度不匹配问题。
    • 通用性:由于目标位于量化器和语言模型桥接之前,该方法适用于所支持的两种Token接口,并既适用于单独预训练的Tokenizer,也适用于与语言模型联合训练的Tokenizer。
  • 实验结果

    • 2.8倍压缩率下,蒸馏后的学生模型在六个教师-学生配对中的五个上,相对于教师的相对字错误率(WER)保持在1.9%以内,且无需任何微调。
    • 相比同等容量的独立训练Tokenizer,该方法实现了3.9%的相对WER提升
  • 主要作者:Prasanth Yadla, Mohammad Samragh Razlighi, Dongseong Hwang, Mingbin Xu, Yuanyuan Zhang, Chung-Cheng Chiu, Yongqiang Wang, Yuan Liu, Zhen Huang, Xiaodan Zhuang。

  • 关联机构:部分作者在Apple工作期间完成此研究;另有作者来自NVIDIA和Anthropic。

  • 发布时间:2026年9月(注:原文标注时间为2026年,可能为未来发布计划或笔误,此处忠实记录原文信息)。

来源:Apple Machine Learning Research
返回列表

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。