FlexiSLM:动态可控制帧率的语音语言模型
摘要
FlexiSLM 为语音语言模型引入动态帧率能力,适用于语音输入与输出,性能优于固定帧率模型,并实现可控推理速度。
查看缓存全文
缓存时间: 2026/07/01 15:43
论文页面 - FlexiSLM:一种动态可控帧率的语音语言模型
来源:https://huggingface.co/papers/2606.31247 作者:
,
,
,
,
,
,
,
,
,
,
摘要
Flexible Spoken Language Model(FlexiSLM)引入了语音输入和输出的动态帧率能力,在实现可控推理速度的同时,其性能优于固定帧率模型。
语音语言模型(https://huggingface.co/papers?q=Spoken%20language%20models)(SLM)将大语言模型扩展至语音输入和输出。现有SLM以固定帧率(如25或12.5 Hz)表示语音,忽略了语音信息密度随时间变化的特性,且在推理时无法灵活权衡质量与速度。最近的音频分词器(https://huggingface.co/papers?q=audio%20tokenizer)研究提出了动态帧率(https://huggingface.co/papers?q=dynamic%20frame%20rate)语音编码(https://huggingface.co/papers?q=speech%20coding),该技术利用了这种非均匀性,并实现了两个新能力:极低的平均帧率和帧率可控性。然而,该技术尚未应用于SLM。我们提出了Flexible Spoken Language Model(FlexiSLM),这是首个在语音输入和输出上都支持动态和可控帧率的SLM。通过使用动态帧率(https://huggingface.co/papers?q=dynamic%20frame%20rate)表示,FlexiSLM在其高质量运行点上超越了包括Qwen2.5-Omni和Kimi-Audio在内的固定帧率7B模型。我们进一步验证了FlexiSLM可以精确地降至4.0 Hz;在6.25 Hz时,其推理时间相比12.5 Hz大致减半,同时保持了强大的语音转语音质量(https://huggingface.co/papers?q=speech-to-speech%20quality)。音频样本详见 https://flexislm.github.io 。
查看 arXiv 页面(https://arxiv.org/abs/2606.31247)查看 PDF(https://arxiv.org/pdf/2606.31247)项目页面(https://flexislm.github.io/)GitHub2(https://github.com/AmphionTeam/FlexiSLM)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.31247)
在你的Agent中获取此论文:
hf papers read 2606.31247
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.31247 以从此页面链接。
引用此论文的数据集0
没有数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.31247 以从此页面链接。
引用此论文的Spaces0
没有Space关联此论文
请在Space README.md 中引用 arxiv.org/abs/2606.31247 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接。
相似文章
DataFlex:面向大语言模型数据驱动动态训练的统一框架
DataFlex是一个面向大语言模型数据驱动动态训练的统一框架,集成了样本选择、领域混合调整和样本重加权,兼容标准工作流程并支持高效大规模部署,相比静态训练实现了一致的性能提升。
介绍 Flex:让模型编写代码(16 分钟阅读)
介绍 Flex,这是一个新的 DSPy 模块,让语言模型重写程序代码本身,而不仅仅是提示词,从而实现更好的优化、更少的模型调用以及通过沙箱实现更安全的执行。
基于SpeechLLM的流式语音转文本翻译
提出了一种用于流式语音转文本翻译的SpeechLLM架构,该架构根据音频自适应决定何时输出令牌,实现了1-2秒的延迟,且质量接近非流式基线。
SFL-MTSC:利用语义框架级多任务自一致性实现鲁棒的多意图口语理解
介绍了一种结构化聚合框架SFL-MTSC,该框架利用LLM在语义框架级别的自一致性实现鲁棒的多意图口语理解,在MAC-SLU基准测试上显示出改进的槽位F1得分和整体准确性。
层次化声学-语义建模:全双工SLM的模态分离与语义一致性
本文介绍了Lychee-FD,一种原生端到端全双工口语语言模型,通过层次化参数分离策略缓解模态干扰,在语音智能和交互流畅性方面取得了显著提升。