连续音频语言模型

Papers with Code Trending 论文

摘要

本文介绍了连续音频语言模型(CALM),该模型使用连续帧而非离散token生成音频,以提升语音和音乐生成的保真度并降低计算成本。

音频语言模型(ALM)已成为语音和音乐生成的主流范式,它将音频表示为离散token序列。然而,与文本token不同,文本token是可逆的,而音频token则是从有限比特率的有损编解码器中提取的。因此,提升音频质量需要生成更多的token,这就造成了保真度与计算成本之间的权衡。我们通过研究连续音频语言模型(CALM)来解决这一问题。这类模型实例化了一个大型Transformer骨干网络,在每个时间步产生上下文嵌入。随后,该序列信息用于约束一个MLP,该MLP通过一致性建模生成音频VAE的下一连续帧。通过避免有损压缩,CALM在更低的计算成本下实现了比其离散对应模型更高的质量。在语音和音乐上的实验表明,相比最先进的离散音频语言模型,CALM在效率和保真度方面均有提升,实现了轻量级、高质量的音频生成。样本可在 https://continuous-audio-language-models.github.io 获取。
查看原文
查看缓存全文

缓存时间: 2026/05/08 09:03

论文页面 - 连续音频语言模型

来源:https://huggingface.co/papers/2509.06926

摘要

Audio Language Models(ALM)已成为语音和音乐生成的主流范式,通过将音频表示为离散 token 序列来实现。然而,与文本 token 不同,文本 token 是可逆的,而音频 token 是从有损编解码器中提取的,且比特率有限。因此,提高音频质量需要生成更多的 token,这就需要在保真度和计算成本之间进行权衡。我们通过研究连续音频语言模型(CALM)来解决这一问题。这些模型实例化了一个大型 Transformer 骨干网络,在每个时间步产生上下文嵌入。然后,这种序列信息通过一个 MLP 进行条件化,该 MLP 通过一致性建模生成音频 VAE 的下一帧连续数据。通过避免有损压缩,CALM 以比其离散对应物更低的计算成本实现了更高的质量。在语音和音乐上的实验表明,其效率和保真度均优于最先进的离散音频语言模型,实现了轻量级、高质量的音频生成。样本可在 https://continuous-audio-language-models.github.io 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2509.06926) 查看 PDF (https://arxiv.org/pdf/2509.06926) 项目页面 (https://huggingface.co/spaces/kyutai/calm-samples) GitHub 4.25k auto (https://github.com/kyutai-labs/pocket-tts) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2509.06926)

相似文章

面向大型音频语言模型的连续音频思考

arXiv cs.AI

该论文引入了连续音频思考(CoAT)框架,为大型音频语言模型配备了一个连续的潜在工作空间,用于在生成文本响应之前组织声学信息,从而在音频推理、理解和转录任务中提升性能,且不增加额外的解码成本。

为LLM智能体设计的音频感知层,拥有随使用而增长的记忆

Reddit r/LocalLLaMA

一个实验性开源框架,使LLM智能体能够使用本地模型(CLAP、Whisper、Silero VAD)和不断增长的概念记忆来感知并识别非语音音频事件。该系统采用事件门控识别、指纹识别和基于符号的推理,目前尚无正式基准测试。