StepAudio 3 Gen 技术报告

Hugging Face Daily Papers 论文

摘要

StepAudio 3 Gen 是一个通用音频生成模型,它使用残差向量量化令牌,在一个单一的离散自回归框架内统一了文本转语音、声音设计、音效和音乐。

我们介绍 StepAudio 3 Gen,这是一个通用音频生成模型,支持零样本文本转语音(TTS)、声音设计、人声生成、音效、音乐、氛围语音和多种音频类型的混合,所有这些都在一个统一的框架内。核心上,StepAudio 3 Gen 是一个离散自回归生成器,它直接基于残差向量量化(RVQ)令牌建模音频,这与最近通用音频模型中流行的基于扩散 Transformer 的连续生成范式不同。其 StepAudio Tokenizer 在一个共享的 16 倍 2048 残差代码空间中,以 12.5 Hz 表示通用音频,联合量化语义和波形级声学特征,使得每个代码层都保留这两种类型的信息。对于生成,骨干网络使用自回归建模沿时间轴预测第一个码本,而一个轻量级的因果 Transformer 沿码本轴完成剩余的十五个码本。我们的研究进一步确定了三个关键设计原则:(1)干扰感知渐进预训练,以在获取音频能力的同时保留大语言模型的文本能力;(2)RVQ 适配器,用于有效整合多码本声学表示;(3)在通用音频域共享表示上的离散自回归建模。通过渐进预训练、多任务指令训练和监督微调,StepAudio 3 Gen 在 TTS 和声音设计上都达到了最先进的性能,同时在语音、人声、音效和音乐方面保持了强大的生成能力。音频样本可在 https://stepaudiollm.github.io/step-audio-3-gen/ 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/14 10:34

论文页面 - StepAudio 3 Gen 技术报告

来源:https://huggingface.co/papers/2609.12945
发布于 9月11日

·

由 https://huggingface.co/giantPanda0906 提交

Yang (https://huggingface.co/giantPanda0906) 于 9月14日

作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

StepAudio 3 Gen 是一个离散自回归音频生成模型,它使用残差向量量化 token 在统一框架内整合文本转语音、语音设计、音效和音乐生成。

我们提出 StepAudio 3 Gen,一个通用音频生成模型,在统一框架内支持零样本文本转语音(TTS)、语音设计、人声生成、音效、音乐、氛围语音以及多种音频类型的混合生成。其核心是一个离散自回归生成器 (https://huggingface.co/papers?q=autoregressive%20generator),直接在残差向量量化 (https://huggingface.co/papers?q=residual%20vector%20quantization)(RVQ)token 上建模音频,与近期通用音频模型中流行的基于扩散 Transformer 的连续生成范式不同。其 StepAudio Tokenizer (https://huggingface.co/papers?q=StepAudio%20Tokenizer) 以 12.5 Hz 在共享的 16 x 2048 残差码空间中表示通用音频,联合量化语义和波形级声学特征,使得每个码层都保留两类信息。在生成方面,主干网络使用自回归建模沿时间轴预测第一个码本,而一个轻量级的因果 Transformer (https://huggingface.co/papers?q=causal%20Transformer) 则沿码本轴完成其余十五个码本的预测。我们的研究进一步确定了三个关键设计原则:(1)干扰感知渐进预训练 (https://huggingface.co/papers?q=interference-aware%20progressive%20pretraining),用于在获取音频能力的同时保留大语言模型的文本能力;(2)RVQ 适配器 (https://huggingface.co/papers?q=RVQ%20Adaptor),用于有效融合多码本声学表示 (https://huggingface.co/papers?q=multi-codebook%20acoustic%20representations);(3)基于共享表示的离散自回归建模 (https://huggingface.co/papers?q=discrete%20autoregressive%20modeling),用于跨通用音频领域。通过渐进预训练、多任务指令训练和监督微调,StepAudio 3 Gen 在 TTS 和语音设计方面取得了最先进的性能,同时在语音、人声、音效和音乐生成方面保持了强大的能力。音频示例可在 https://stepaudiollm.github.io/step-audio-3-gen/ 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2609.12945) 查看 PDF (https://arxiv.org/pdf/2609.12945) 项目页面 (https://stepaudiollm.github.io/step-audio-3-gen/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.12945)

在您的智能体中获取本文:

hf papers read 2609.12945

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

无模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2609.12945 以从此页面链接。

引用本文的数据集 0

无数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2609.12945 以从此页面链接。

引用本文的空间 0

无空间链接本文
在空间 README.md 中引用 arxiv.org/abs/2609.12945 以从此页面链接。

包含本文的收藏 1

相似文章

StepAudio 3 Music 技术报告

Hugging Face Daily Papers

StepAudio 3 Music 介绍了一个大规模、长篇音乐生成模型,通过 ABC-CoT 实现显式音乐规划,在音频质量和相似度指标上取得了高分,与其他系统相比表现优异。

StepAudio 3 Realtime 技术报告

Hugging Face Daily Papers

论文介绍了StepAudio3Realtime,一个面向实时语音交互的音频语言基础模型,利用连续的听-说-想-行动循环结合Think-While-Speaking技术,以实现深度推理和低延迟,在MMSU和Full-Duplex Bench等基准测试中达到顶尖性能。

StepAudio 2.5 技术报告

Hugging Face Daily Papers

StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。

Qwen3-TTS 技术报告

Papers with Code Trending

Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。

Stable Audio 3

Hacker News Top

Stable Audio 3 推出了一系列快速潜扩散模型,用于变长音频生成与编辑,并开源了中小型模型权重。