减少六层:Whisper编码器剪枝与无标签恢复
摘要
本文介绍了一种剪枝Whisper ASR模型编码器层的方法,将编码器大小减少18.5%,并通过无标签数据蒸馏恢复性能,同时发布了代码和预训练模型供采用。
查看缓存全文
缓存时间: 2026/09/24 11:40
论文页面 - 减少六层:基于无标签恢复的Whisper编码器剪枝
来源:https://huggingface.co/papers/2609.27980
摘要
对OpenAI Whisper等大型预训练Transformer语音识别模型进行剪枝已成为广泛采用的方案,其中解码器剪枝带来了显著的端到端转录加速。例如,{\ttwhisper-large-v3-turbo}变体将解码器从32层精简至4层,而Distill-Whisper同样将解码器大幅缩减至仅2层。尽管已有研究关注缩减编码器规模,但尚无方案获得广泛采用。这可能是由于需要定制推理实现才能充分利用压缩模型。我们提出一种通过“逐层去除词错率变化”对编码器层级进行排序的方法。去除变化最小的六层(对应编码器堆栈18.5%的参数),剪枝模型无需定制推理代码,本质上仅是一个更浅层的编码器。我们进一步利用无标签单语语音数据进行蒸馏,以恢复零样本层剪枝导致的性能下降。经蒸馏后,四种语言的平均词错率从基线18.2%经零样本剪枝的21.9%改善至20.1%。我们已开源全部代码(https://github.com/rasgaard/whisper-encoder-layer-prune)及剪枝模型(https://huggingface.co/rasgaard/whisper-large-v3-turbo-encoder-pruned)。
查看arXiv页面 (https://arxiv.org/abs/2609.27980) 查看PDF (https://arxiv.org/pdf/2609.27980) GitHub0 (https://github.com/rasgaard/whisper-encoder-layer-prune) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.27980)
在您的智能助手中获取此论文:
hf papers read 2609.27980
未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型1
rasgaard/whisper-large-v3-turbo-encoder-pruned 0.7B• 约2小时前更新 • 36 • 1 (https://huggingface.co/rasgaard/whisper-large-v3-turbo-encoder-pruned)
引用本文的数据集0
无关联数据集
在数据集README.md中引用arxiv.org/abs/2609.27980以从此页面关联。
引用本文的Space0
无关联Space
在Space README.md中引用arxiv.org/abs/2609.27980以从此页面关联。
包含本文的收藏0
无包含此论文的收藏
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面关联。
相似文章
Whisper 介绍
OpenAI 推出 Whisper,这是一个端到端的编码器-解码器 Transformer 模型,在大规模多样化音频数据上进行训练,可提供强大的多语言语音识别、语言识别和语音到英文翻译功能。Whisper 在多样化数据集上的错误率比专业模型低 50%,并且在语音翻译方面优于有监督基准,尽管未针对特定数据集进行微调。
稀疏性低语者
本文介绍了几种差异感知剪枝方法(Wisp、Wisp+、Whisper),用于大型语言模型,表明在Llama 2和3.1系列模型(最高405B参数)中,保留输出差异能够提升稀疏化效果。
基于隐层表示引导和稀疏自编码器的Whisper幻觉检测与缓解
本文展示了Whisper在面对静音、噪声或音乐时产生的幻觉故障,可以完全通过内部激活和稀疏自编码器来检测和缓解,无需微调即可大幅降低幻觉率。
将E4B音频编码器添加到更大的模型
作者提出一种方法,将E4B音频编码器添加到更大的模型中,通过提取编码器、创建线性投影层,并仅使用文本-音频对微调该层,类似于参考论文中的方法,但使用Gemma而非Whisper。
Whisper模型后训练压缩导致的时序税累积
本文研究Whisper ASR模型后训练权重压缩如何加剧转录错误的人口统计学差异,导致边缘化说话者更正时间增加。