减少六层:Whisper编码器剪枝与无标签恢复

Hugging Face Daily Papers 论文

摘要

本文介绍了一种剪枝Whisper ASR模型编码器层的方法,将编码器大小减少18.5%,并通过无标签数据蒸馏恢复性能,同时发布了代码和预训练模型供采用。

剪枝大型预训练基于transformer的ASR模型,如OpenAI的Whisper,已得到广泛采用,因为剪枝解码器带来了显著的端到端转录加速。例如,{\tt whisper-large-v3-turbo}变体将解码器从32层减少到4层,而Distill-Whisper同样将解码器减少到仅2层。尽管一些注意力被放在减少编码器的大小上,但没有方法得到广泛采用。这可能是由于需要自定义推理实现来利用压缩模型。我们提出了一种方法,通过留一法层去除对词错误率(WER)的影响来对编码器层进行排名。移除了引起最小变化的六层,对应于编码器堆栈的18.5%。剪枝后的模型不需要自定义推理代码,因为它只是一个更浅的编码器,层数更少。我们进一步使用无标签单语语音数据进行蒸馏,以恢复零样本层剪枝引起的性能下降。蒸馏后,四种语言的平均词错误率(WER)增加到20.1%,相比之下零样本为21.9%,而基线为18.2%。我们发布了所有代码(https://github.com/rasgaard/whisper-encoder-layer-prune)和剪枝模型(https://huggingface.co/rasgaard/whisper-large-v3-turbo-encoder-pruned)。
查看原文
查看缓存全文

缓存时间: 2026/09/24 11:40

论文页面 - 减少六层:基于无标签恢复的Whisper编码器剪枝

来源:https://huggingface.co/papers/2609.27980

摘要

对OpenAI Whisper等大型预训练Transformer语音识别模型进行剪枝已成为广泛采用的方案,其中解码器剪枝带来了显著的端到端转录加速。例如,{\ttwhisper-large-v3-turbo}变体将解码器从32层精简至4层,而Distill-Whisper同样将解码器大幅缩减至仅2层。尽管已有研究关注缩减编码器规模,但尚无方案获得广泛采用。这可能是由于需要定制推理实现才能充分利用压缩模型。我们提出一种通过“逐层去除词错率变化”对编码器层级进行排序的方法。去除变化最小的六层(对应编码器堆栈18.5%的参数),剪枝模型无需定制推理代码,本质上仅是一个更浅层的编码器。我们进一步利用无标签单语语音数据进行蒸馏,以恢复零样本层剪枝导致的性能下降。经蒸馏后,四种语言的平均词错率从基线18.2%经零样本剪枝的21.9%改善至20.1%。我们已开源全部代码(https://github.com/rasgaard/whisper-encoder-layer-prune)及剪枝模型(https://huggingface.co/rasgaard/whisper-large-v3-turbo-encoder-pruned)。

查看arXiv页面 (https://arxiv.org/abs/2609.27980) 查看PDF (https://arxiv.org/pdf/2609.27980) GitHub0 (https://github.com/rasgaard/whisper-encoder-layer-prune) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.27980)

在您的智能助手中获取此论文:

hf papers read 2609.27980

未安装最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型1

rasgaard/whisper-large-v3-turbo-encoder-pruned 0.7B• 约2小时前更新 • 36 • 1 (https://huggingface.co/rasgaard/whisper-large-v3-turbo-encoder-pruned)

引用本文的数据集0

无关联数据集

在数据集README.md中引用arxiv.org/abs/2609.27980以从此页面关联。

引用本文的Space0

无关联Space

在Space README.md中引用arxiv.org/abs/2609.27980以从此页面关联。

包含本文的收藏0

无包含此论文的收藏

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面关联。

相似文章

Whisper 介绍

OpenAI Blog

OpenAI 推出 Whisper,这是一个端到端的编码器-解码器 Transformer 模型,在大规模多样化音频数据上进行训练,可提供强大的多语言语音识别、语言识别和语音到英文翻译功能。Whisper 在多样化数据集上的错误率比专业模型低 50%,并且在语音翻译方面优于有监督基准,尽管未针对特定数据集进行微调。

稀疏性低语者

arXiv cs.LG

本文介绍了几种差异感知剪枝方法(Wisp、Wisp+、Whisper),用于大型语言模型,表明在Llama 2和3.1系列模型(最高405B参数)中,保留输出差异能够提升稀疏化效果。

将E4B音频编码器添加到更大的模型

Reddit r/LocalLLaMA

作者提出一种方法,将E4B音频编码器添加到更大的模型中,通过提取编码器、创建线性投影层,并仅使用文本-音频对微调该层,类似于参考论文中的方法,但使用Gemma而非Whisper。