X-AuT:针对语音大语言模型的渐进式音频编码器压缩与跨尺度蒸馏

Hugging Face Daily Papers 论文

摘要

X-AuT是一个渐进式框架,用于压缩语音大语言模型中的音频编码器层,通过跨尺度蒸馏和LoRA适配等技术,在降低推理成本的同时恢复准确性。

减少音频编码器深度可以降低语音大语言模型的推理成本,但移除完整块会干扰解码器消耗的嵌入,并可能导致删除和提前序列结束错误。我们引入了X-AuT,一个渐进式框架,通过短期行为探测选择层组合,并通过表示对齐、跨尺度蒸馏、计划性学生策略监督和LoRA微调来恢复剪枝后的模型。语言模型主干保持冻结,而注意力LoRA适配器和绑定的输出嵌入在蒸馏过程中进行适配。训练使用从转录一致性管道中选出的最高一致性层,随后在微调期间进行源重加权。在十个公开的中英基准测试中,将Qwen3-ASR-0.6B从18层音频编码器压缩到16层,使宏平均错误率从5.61%降低到5.27%。14层模型的错误率达到5.75%,同时音频塔参数减少了20.7%。在匹配的配方下,1.7B教师模型的平均错误率为5.55%,而自蒸馏为8.45%,渐进式从18层到14层的剪枝优于直接剪枝(5.75% 对比 6.73%)。这些单次运行的结果建立了两个实际操作点,并显示准确性影响在不同基准测试中有所变化。项目网站:https://xpeng-ai.github.io/x-aut
查看原文
查看缓存全文

缓存时间: 2026/09/11 10:17

论文页面 - X-AuT:面向语音大模型的渐进式音频编码器压缩与跨尺度蒸馏

来源:https://huggingface.co/papers/2609.11412

摘要

X-AuT 通过行为探针、表示对齐、跨尺度蒸馏及 LoRA 适应等方法,在语音大语言模型中渐进式裁剪音频编码器层并恢复精度。

降低音频编码器深度可减少语音大语言模型的推理开销,但移除完整模块会扰动解码器接收的嵌入表示,可能导致删除错误和过早的序列终止错误。我们提出 X-AuT,这是一个渐进式框架,通过短时行为探针选择层组合,并通过表示对齐、跨尺度蒸馏、定时学生策略监督及 LoRA 微调恢复被裁剪的模型。语言模型主干保持冻结,而注意力 LoRA 适配器和绑定的输出嵌入在蒸馏过程中进行适应。训练使用转录一致性管道中一致性最高的数据层,随后在微调阶段进行源重加权。在十个中英公开基准测试中,将 Qwen3-ASR-0.6B 从 18 层音频编码器压缩至 16 层,宏平均错误率从 5.61% 降至 5.27%。14 层模型错误率为 5.75%,音频塔参数减少 20.7%。在相同配置下,1.7B 教师模型平均错误率为 5.55%,而自蒸馏为 8.45%;渐进式 18→14 裁剪优于直接裁剪(5.75% vs. 6.73%)。这些单次运行结果确定了两个实用工作点,并显示精度影响在不同基准测试中存在差异。项目网站:https://xpeng-ai.github.io/x-aut

查看 arXiv 页面 (https://arxiv.org/abs/2609.11412) | 查看 PDF (https://arxiv.org/pdf/2609.11412) | 项目页面 (https://xpeng-ai.github.io/x-aut) | GitHub0 (https://github.com/XPENG-AI/X-AuT) | 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.11412)

引用本文的模型 1

XPENG-AI/X-AuT 自动语音识别

• 0.9B 参数 • 约 3 小时前更新 • 3 个引用 (https://huggingface.co/XPENG-AI/X-AuT)

引用本文的数据集 0

无关联数据集

在数据集 README.md 中引用 arxiv.org/abs/2609.11412 可将其链接至此页面。

引用本文的 Space 1

包含本文的合集 0

无包含本文的合集

将本文添加至合集 (https://huggingface.co/new-collection) 可将其链接至此页面。

相似文章

统一音频智能,且不牺牲文本智能

Hugging Face Daily Papers

这篇论文介绍了Audex,这是NVIDIA推出的统一音频-文本大语言模型,在多种音频和语音任务上实现了最先进的性能,同时保持了强大的文本推理能力,且没有出现退化。

EchoDistill: 对齐噪声到干净的自蒸馏用于鲁棒音频大语言模型

arXiv cs.CL

EchoDistill 是一种基于对齐的噪声到干净的自蒸馏框架,通过使用冻结的干净音频教师模型,利用组相对策略优化 (GRPO) 指导学生模型,从而提高音频大语言模型 (ALLMs) 在现实噪声下的鲁棒性。实验表明,在强噪声下,该方法显著提升了语义可靠性和任务性能,且无需额外推理成本。

对齐就是一切:面向通用音频-语言模型的无指令训练

arXiv cs.CL

本文介绍了一种无指令的纯对齐方法,用于构建大型音频-语言模型,该方法通过冻结LLM和音频编码器,仅在自生成数据上训练一个轻量级投影器,实现了与传统多阶段流程相比更少数据下的竞争性性能。

基于SpeechLLM的流式语音转文本翻译

arXiv cs.CL

提出了一种用于流式语音转文本翻译的SpeechLLM架构,该架构根据音频自适应决定何时输出令牌,实现了1-2秒的延迟,且质量接近非流式基线。