FlexiSLM:动态可控制帧率的语音语言模型

Hugging Face Daily Papers 论文

摘要

FlexiSLM 为语音语言模型引入动态帧率能力,适用于语音输入与输出,性能优于固定帧率模型,并实现可控推理速度。

语音语言模型(SLM)将大语言模型(LLM)扩展到语音输入和输出。现有 SLM 以固定帧率(例如 25 Hz 或 12.5 Hz)表示语音,忽略了语音随时间变化的信息密度,且在推理时无法灵活地在质量与速度之间进行权衡。近期音频分词器研究提出了动态帧率语音编码,利用这种非均匀性,并实现了两个新能力:极低的平均帧率和帧率可控性。然而,该技术尚未应用于 SLM。我们提出了 Flexible Spoken Language Model(FlexiSLM),这是首个在语音输入和输出上均支持动态可控帧率的 SLM。通过使用动态帧率表示,FlexiSLM 在高品质工作点上优于包括 Qwen2.5-Omni 和 Kimi-Audio 在内的固定帧率 7B 模型。我们进一步验证了 FlexiSLM 可精确降至 4.0 Hz;在 6.25 Hz 下,其推理时间相比 12.5 Hz 大约减半,同时保持强大的语音到语音质量。音频样本可在 https://flexislm.github.io 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/01 15:43

论文页面 - FlexiSLM:一种动态可控帧率的语音语言模型

来源:https://huggingface.co/papers/2606.31247 作者:

摘要

Flexible Spoken Language Model(FlexiSLM)引入了语音输入和输出的动态帧率能力,在实现可控推理速度的同时,其性能优于固定帧率模型。

语音语言模型(https://huggingface.co/papers?q=Spoken%20language%20models)(SLM)将大语言模型扩展至语音输入和输出。现有SLM以固定帧率(如25或12.5 Hz)表示语音,忽略了语音信息密度随时间变化的特性,且在推理时无法灵活权衡质量与速度。最近的音频分词器(https://huggingface.co/papers?q=audio%20tokenizer)研究提出了动态帧率(https://huggingface.co/papers?q=dynamic%20frame%20rate)语音编码(https://huggingface.co/papers?q=speech%20coding),该技术利用了这种非均匀性,并实现了两个新能力:极低的平均帧率和帧率可控性。然而,该技术尚未应用于SLM。我们提出了Flexible Spoken Language Model(FlexiSLM),这是首个在语音输入和输出上都支持动态和可控帧率的SLM。通过使用动态帧率(https://huggingface.co/papers?q=dynamic%20frame%20rate)表示,FlexiSLM在其高质量运行点上超越了包括Qwen2.5-Omni和Kimi-Audio在内的固定帧率7B模型。我们进一步验证了FlexiSLM可以精确地降至4.0 Hz;在6.25 Hz时,其推理时间相比12.5 Hz大致减半,同时保持了强大的语音转语音质量(https://huggingface.co/papers?q=speech-to-speech%20quality)。音频样本详见 https://flexislm.github.io 。

查看 arXiv 页面(https://arxiv.org/abs/2606.31247)查看 PDF(https://arxiv.org/pdf/2606.31247)项目页面(https://flexislm.github.io/)GitHub2(https://github.com/AmphionTeam/FlexiSLM)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.31247)

在你的Agent中获取此论文:

hf papers read 2606.31247

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.31247 以从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.31247 以从此页面链接。

引用此论文的Spaces0

没有Space关联此论文

请在Space README.md 中引用 arxiv.org/abs/2606.31247 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。

相似文章

基于SpeechLLM的流式语音转文本翻译

arXiv cs.CL

提出了一种用于流式语音转文本翻译的SpeechLLM架构,该架构根据音频自适应决定何时输出令牌,实现了1-2秒的延迟,且质量接近非流式基线。