SwanTale:面向指令和零样本任务的统一多说话人语音与音频生成

Hugging Face Daily Papers 论文

摘要

本文介绍了SwanTale,一个支持零样本和指令任务的统一多说话人语音与音频生成模型,以及用于数据标注的SwanData-Caption和用于高质量多音频模态生成的SwanVAE。

语音和音频生成常用于动画配音、有声剧、电影、广告、游戏、播客和短视频制作等场景。在这些场景中,创作者可能需要在没有参考录音的情况下设计声音,用自然语言控制说话人风格,通过环境和音效支持声学场景,并在之后复用所设计的声音。因此,同时支持指令任务和零样本任务的多说话人语音与音频生成非常重要。指令任务需要环境、说话人风格和细粒度内容的描述,而零样本任务则使用参考音频以及相同的细粒度内容。我们从数据和模型两个方面解决这些任务。首先,我们提出了SwanData-Caption,用于清洗原始语音和音频数据、增加有针对性的合成覆盖,并标注多样化且准确的多级描述。然后,我们提出了SwanTale,一个支持零样本和指令任务的多说话人表现力语音与音频生成模型。我们引入SwanVAE以支持高质量的多音频模态生成。接着,我们采用奖励条件质量控制和Engram条件化,以及用于多任务和多音频模态建模的Unified MoE。此外,我们使用课程学习和GRPO后训练,让模型逐步学习并增强其能力。实验结果表明,SwanTale在多个关键的零样本和指令指标上领先,在这两项任务中均取得最佳表现力分数,并支持涉及多说话人语音和音频的复杂指令生成。演示可在 https://swanaigc.github.io/#swantale 查看。
查看原文
查看缓存全文

缓存时间: 2026/08/04 05:37

论文页面 - SwanTale:面向指令与零样本任务的统一多说话人语音和音频生成

来源:https://huggingface.co/papers/2608.02023

摘要

语音和音频生成常被用于动画配音、广播剧、电影、广告、游戏、播客和短视频制作。在这些场景中,创作者可能需要在没有参考录音的情况下设计声音,用自然语言控制说话人风格,支持带环境和音效的声学场景,并在之后复用所设计的声音。因此,为指令任务和零样本任务同时支持多说话人语音和音频生成非常重要。指令任务需要环境、说话人风格和细粒度内容的描述,而零样本任务则使用参考音频以及相同的细粒度内容。我们从数据和模型两个层面来解决这些任务。首先,我们提出了 SwanData-Caption,它清洗原始语音和音频数据,补充有针对性的合成数据覆盖,并标注多样化且准确的多层级描述。然后,我们提出了 SwanTale,一个支持零样本和指令任务的多说话人表现力语音和音频生成模型。我们引入 SwanVAE 来支持高质量的多音频模态生成。此外,我们采用基于奖励的质量控制和 Engram 条件机制,同时结合 UnifiedMoE 进行多任务和多音频模态建模。另外,我们使用课程学习和 GRPO 后训练,让模型逐步学习并增强其能力。实验结果表明,SwanTale 在多个关键的零样本和指令指标上领先,在两个任务中均取得最佳表现力得分,并支持涉及多说话人语音和音频的复杂指令生成。演示可在 https://swanaigc.github.io/#swantale 找到。

查看 arXiv 页面 (https://arxiv.org/abs/2608.02023) 查看 PDF (https://arxiv.org/pdf/2608.02023) 项目页面 (https://swanaigc.github.io/#swantale) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.02023)

在您的 agent 中获取此论文:

hf papers read 2608\.02023

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型关联此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.02023,即可从此页面链接到该模型。

引用此论文的数据集 0

没有数据集关联此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.02023,即可从此页面链接到该数据集。

引用此论文的 Space 0

没有 Space 关联此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.02023,即可从此页面链接到该 Space。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从此页面链接到它。

相似文章

多场景长篇语音生成的综合基准评测

Hugging Face Daily Papers

Swanbench-Speech是一个综合基准评测,用于在多样化场景下评估长篇语音生成,采用涵盖声学、语义和表现力的多维度指标,揭示了当前模型的局限性。

基于自回归扩散变换器的流式同步空间音频生成

Hugging Face Daily Papers

SwanSphere 提出了一种统一的流式框架,通过因果自回归扩散变换器和多模态学习策略,从全景视频和文本提示中生成高保真空间音频,在视频到空间音频和文本到空间音频任务中均实现了卓越性能。