SwanTale:面向指令和零样本任务的统一多说话人语音与音频生成
摘要
本文介绍了SwanTale,一个支持零样本和指令任务的统一多说话人语音与音频生成模型,以及用于数据标注的SwanData-Caption和用于高质量多音频模态生成的SwanVAE。
查看缓存全文
缓存时间: 2026/08/04 05:37
论文页面 - SwanTale:面向指令与零样本任务的统一多说话人语音和音频生成
来源:https://huggingface.co/papers/2608.02023
摘要
语音和音频生成常被用于动画配音、广播剧、电影、广告、游戏、播客和短视频制作。在这些场景中,创作者可能需要在没有参考录音的情况下设计声音,用自然语言控制说话人风格,支持带环境和音效的声学场景,并在之后复用所设计的声音。因此,为指令任务和零样本任务同时支持多说话人语音和音频生成非常重要。指令任务需要环境、说话人风格和细粒度内容的描述,而零样本任务则使用参考音频以及相同的细粒度内容。我们从数据和模型两个层面来解决这些任务。首先,我们提出了 SwanData-Caption,它清洗原始语音和音频数据,补充有针对性的合成数据覆盖,并标注多样化且准确的多层级描述。然后,我们提出了 SwanTale,一个支持零样本和指令任务的多说话人表现力语音和音频生成模型。我们引入 SwanVAE 来支持高质量的多音频模态生成。此外,我们采用基于奖励的质量控制和 Engram 条件机制,同时结合 UnifiedMoE 进行多任务和多音频模态建模。另外,我们使用课程学习和 GRPO 后训练,让模型逐步学习并增强其能力。实验结果表明,SwanTale 在多个关键的零样本和指令指标上领先,在两个任务中均取得最佳表现力得分,并支持涉及多说话人语音和音频的复杂指令生成。演示可在 https://swanaigc.github.io/#swantale 找到。
查看 arXiv 页面 (https://arxiv.org/abs/2608.02023) 查看 PDF (https://arxiv.org/pdf/2608.02023) 项目页面 (https://swanaigc.github.io/#swantale) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.02023)
在您的 agent 中获取此论文:
hf papers read 2608\.02023
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型关联此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.02023,即可从此页面链接到该模型。
引用此论文的数据集 0
没有数据集关联此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.02023,即可从此页面链接到该数据集。
引用此论文的 Space 0
没有 Space 关联此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2608.02023,即可从此页面链接到该 Space。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从此页面链接到它。
相似文章
SwanVoice: 面向独白和对话的表现力长文本零样本语音合成
SwanVoice 是一种零样本文本转语音模型,专为富有表现力的长文本独白和对话合成而设计,结合了 VAE、流匹配 DiT 和扩散后训练,在丰富度和层次感得分上均优于现有基线模型。
多场景长篇语音生成的综合基准评测
Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。
基于自回归扩散变换器的流式同步空间音频生成
SwanSphere 提出了一种统一的流式框架,通过因果自回归扩散变换器和多模态学习策略,从全景视频和文本提示中生成高保真空间音频,在视频到空间音频和文本到空间音频任务中均实现了卓越性能。
@multimodalart: UniSE:统一语音增强的高质量开源模型,用于使音频清晰并分离多人对话中的说话者……
UniSE 是一个统一的、无需提示的、自回归语音增强模型,基于纯解码器语言模型,支持单一模型内完成语音恢复、目标说话人提取和语音分离等多种任务。
Scenema Audio:零样本富有表现力的语音克隆与语音生成 [N]
Scenema AI 发布了 Scenema Audio,一个开源的基于扩散模型的零样本富有表现力的语音克隆与语音生成模型,将情感表现与声音身份分离,使任何声音都能演绎任何情感。