连续音频语言模型
摘要
本文介绍了连续音频语言模型(CALM),该模型使用连续帧而非离散token生成音频,以提升语音和音乐生成的保真度并降低计算成本。
查看缓存全文
缓存时间: 2026/05/08 09:03
论文页面 - 连续音频语言模型
来源:https://huggingface.co/papers/2509.06926
摘要
Audio Language Models(ALM)已成为语音和音乐生成的主流范式,通过将音频表示为离散 token 序列来实现。然而,与文本 token 不同,文本 token 是可逆的,而音频 token 是从有损编解码器中提取的,且比特率有限。因此,提高音频质量需要生成更多的 token,这就需要在保真度和计算成本之间进行权衡。我们通过研究连续音频语言模型(CALM)来解决这一问题。这些模型实例化了一个大型 Transformer 骨干网络,在每个时间步产生上下文嵌入。然后,这种序列信息通过一个 MLP 进行条件化,该 MLP 通过一致性建模生成音频 VAE 的下一帧连续数据。通过避免有损压缩,CALM 以比其离散对应物更低的计算成本实现了更高的质量。在语音和音乐上的实验表明,其效率和保真度均优于最先进的离散音频语言模型,实现了轻量级、高质量的音频生成。样本可在 https://continuous-audio-language-models.github.io 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2509.06926) 查看 PDF (https://arxiv.org/pdf/2509.06926) 项目页面 (https://huggingface.co/spaces/kyutai/calm-samples) GitHub 4.25k auto (https://github.com/kyutai-labs/pocket-tts) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2509.06926)
相似文章
面向大型音频语言模型的连续音频思考
该论文引入了连续音频思考(CoAT)框架,为大型音频语言模型配备了一个连续的潜在工作空间,用于在生成文本响应之前组织声学信息,从而在音频推理、理解和转录任务中提升性能,且不增加额外的解码成本。
HybridCodec: 面向高效语音语言模型的离散与连续表示建模
提出HybridCodec,一种结合时间压缩离散令牌与连续残差的新颖框架,旨在改进语音语言模型中说话人特征的保留,在保持质量的同时减少自回归步骤。
为LLM智能体设计的音频感知层,拥有随使用而增长的记忆
一个实验性开源框架,使LLM智能体能够使用本地模型(CLAP、Whisper、Silero VAD)和不断增长的概念记忆来感知并识别非语音音频事件。该系统采用事件门控识别、指纹识别和基于符号的推理,目前尚无正式基准测试。
FunAudioLLM:面向人类与LLM自然交互的语音理解与生成基础模型
介绍FunAudioLLM,这是一个模型系列,结合了用于多语言ASR、情感检测和音频事件检测的SenseVoice,以及用于自然语音生成的CosyVoice,通过开源模型和代码实现与LLM增强的语音交互。
基于LLM并行文本生成的低延迟实时音频游戏解说系统
本文介绍了一种低延迟实时音频游戏解说系统,该系统利用基于LLM的并行文本生成技术,将语句间的静默时间从9.6秒减少到0.3秒,与顺序基线相比显著改善了感知到的说话节奏。