Stable Audio 3

Hacker News Top 论文

摘要

Stable Audio 3 推出了一系列快速潜扩散模型,用于变长音频生成与编辑,并开源了中小型模型权重。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/05/20 17:28

# Stable Audio 3

来源: https://arxiv.org/html/2605.17991

###### 摘要

Stable Audio 3 是一系列快速潜扩散模型(小、中、大),用于可变长度音频生成与编辑。由于我们的模型可以生成数分钟的音频,可变长度生成是避免为短音频生成全长内容而产生计算开销的关键。我们还支持修补(inpainting),从而实现定向音频编辑以及短录音的续写。我们的潜扩散模型构建于一种新颖的语义-声学自编码器之上,该编码器将音频投影到紧凑的潜空间中,支持高效的扩散生成,同时保持音频保真度并促进潜空间中的语义结构。最后,我们采用对抗后训练,既能加速推理又能提升生成质量,减少推理步数,同时提高保真度和提示遵循度。Stable Audio 3 模型基于授权和Creative Commons数据进行训练,可在H200 GPU上以不到2秒的时间生成音乐和音效,在MacBook Pro M4上也只需几秒。我们发布了 `small` 和 `medium` 模型的权重,它们可在消费级硬件上运行,并附带训练和推理流程。

https://github.com/Stability-AI/stable-audio-tools

http://github.com/Stability-AI/stable-audio-3

立体声 44.1 kHz

语义-声学编码器

4096× 下采样

潜扩散Transformer

可变长度推理

长时与快速生成

语义-声学解码器

4096× 上采样

立体声 44.1 kHz

“a jazz piano solo”

持续时间(秒)

编辑控制

图1: Stable Audio 3 文本到音频模型支持通过修补实现可变长度生成和编辑。

表1: Stable Audio 3 模型支持生成长音频序列,同时保持快速推理速度。参数数量仅针对扩散Transformer。SAME-S 和 SAME-L 分别有 1.08亿 和 8.52亿 参数。

## 1 引言

近期音乐和音频生成的进展主要由两大模型家族驱动:自回归模型 [8 (https://arxiv.org/html/2605.17991#bib.bib42), 1 (https://arxiv.org/html/2605.17991#bib.bib43), 94 (https://arxiv.org/html/2605.17991#bib.bib28), 91 (https://arxiv.org/html/2605.17991#bib.bib27)] 和潜扩散模型 [14 (https://arxiv.org/html/2605.17991#bib.bib14), 15 (https://arxiv.org/html/2605.17991#bib.bib15), 50 (https://arxiv.org/html/2605.17991#bib.bib126), 6 (https://arxiv.org/html/2605.17991#bib.bib41), 75 (https://arxiv.org/html/2605.17991#bib.bib44), 52 (https://arxiv.org/html/2605.17991#bib.bib38)]。自回归模型通过顺序处理离散音频标记取得了强劲结果。相比之下,潜扩散模型生成连续的潜表示,随后由单独的自编码器解码,提供一种避免离散标记化和自回归采样的替代方案。作为补充,还有人提出了混合方法,使用自回归模型生成标记,再由扩散模型进行细化 [20 (https://arxiv.org/html/2605.17991#bib.bib18), 95 (https://arxiv.org/html/2605.17991#bib.bib29)]。

Stable Audio 3 包含三个不同规模的潜扩散模型(小、中、大,见表1 (https://arxiv.org/html/2605.17991#S0.T1))。可变长度生成是 Stable Audio 3 的关键能力,尤其是因为我们的模型能生成非常长的音频(表1 (https://arxiv.org/html/2605.17991#S0.T1))。虽然自回归模型由于其顺序特性自然支持可变长度输出,但扩散模型通常需要一次性生成整个音频长度 [14 (https://arxiv.org/html/2605.17991#bib.bib14), 15 (https://arxiv.org/html/2605.17991#bib.bib15)](图2 (https://arxiv.org/html/2605.17991#S1.F2): a)。这意味着,例如,用 small-music 生成一个短样本需要生成一段2分钟的音频,其中大部分是静音。为解决这种计算和内存低效问题,Stable Audio 3 支持可变长度生成(图2 (https://arxiv.org/html/2605.17991#S1.F2): b),从而在不产生全长计算的情况下高效合成短输出。这种效率提升对于在消费级硬件上部署开源权重模型至关重要,因为那里的计算和内存预算有限。

所有时长分配相同的计算和内存

9 s 35 s 100 s 120 s

(a) 固定长度:始终生成 `L_max` 个嵌入。

9 s 35 s 100 s 120 s

(b) 可变长度:生成 `L ∝ d` 个嵌入。

图2: 固定长度 vs. 可变长度生成。 (a) 固定长度生成无论请求的时长 `d` 如何都分配 `L_max` 个嵌入,对于短片段浪费计算于零填充静音。 (b) 可变长度生成分配与请求时长 `d` 成正比的 `L` 个嵌入(也会使用静音填充,见第3.1节 (https://arxiv.org/html/2605.17991#S3.SS1))。

可控性也是现代生成式音频和音乐模型的重要特性。Stable Audio 3 包含修补功能,允许编辑音频的目标片段,例如修改单个片段(图3 (https://arxiv.org/html/2605.17991#S1.F3): 第一行)、执行多片段编辑(图3 (https://arxiv.org/html/2605.17991#S1.F3): 第二行)或支持续写(图3 (https://arxiv.org/html/2605.17991#S1.F3): 第三行),其中模型能连贯地将给定音频扩展到原始端点之外。这使得打击乐音中的瞬态编辑、未完成歌曲的灵感生成或短录音的扩展等应用成为可能。

保留音频

修补(已掩码,待生成)

编辑单个片段(单个掩码)

编辑多个片段(多个掩码)

续写(因果掩码)

无修补(短音频,全掩码)

无修补(长音频,全掩码)

生成长度(可变)

图3: 使用修补进行编辑。用户提供音频并指定目标编辑片段(灰色,已掩码),同时保留原始音频(阴影线)。这支持从单个或多片段编辑到因果续写的任务。

Stable Audio 3 包含构建于语义-声学自编码器之上的潜扩散模型。这种潜表示旨在保持重建保真度,同时在生成上易于处理,并在语义上具有结构性,便于下游使用。我们的目标是在保持高保真音频重建的同时,学习一个紧凑的潜空间(经过4096×下采样),该空间既易于用扩散进行生成建模,又具有语义上有意义的结构。具体而言,使用频谱重建损失和对抗训练 [12 (https://arxiv.org/html/2605.17991#bib.bib45), 41 (https://arxiv.org/html/2605.17991#bib.bib47)] 来强制声学保真度,同时通过潜空间回归目标(包括色度图和耳间电平差回归)来诱导语义结构。所使用的自编码器的一个重要特征是4096×的下采样比率,显著高于先前工作中常见的1024到2048×比率 [12 (https://arxiv.org/html/2605.17991#bib.bib45), 41 (https://arxiv.org/html/2605.17991#bib.bib47), 85 (https://arxiv.org/html/2605.17991#bib.bib5)]。这种激进的下采样是我们的核心目标:它将序列长度减少到足够让 `medium` 和 `small` 模型在消费级GPU和MacBook Pro上使用CPU生成长篇音乐和音效。

扩散模型通常需要多个推理步骤才能生成高质量输出,因为它们通过迭代去噪逐步细化噪声 [26 (https://arxiv.org/html/2605.17991#bib.bib7), 79 (https://arxiv.org/html/2605.17991#bib.bib8)]。然而,快速推理对于响应式的创意工具至关重要,以使其感觉引人入胜且富有灵感。为解决这一问题,我们使用对抗后训练,这可以在保持(或提高)输出质量的同时减少采样步骤数 [60 (https://arxiv.org/html/2605.17991#bib.bib337)]。总的来说,我们的潜扩散训练流程包括三个阶段:流匹配预训练 [54 (https://arxiv.org/html/2605.17991#bib.bib92), 48 (https://arxiv.org/html/2605.17991#bib.bib1), 2 (https://arxiv.org/html/2605.17991#bib.bib2)]、ODE预热蒸馏 [72 (https://arxiv.org/html/2605.17991#bib.bib244), 56 (https://arxiv.org/html/2605.17991#bib.bib333)] 和对抗后训练 [60 (https://arxiv.org/html/2605.17991#bib.bib337)]。

Stable Audio 3 专为广泛的社区采纳而设计,因为它在授权和Creative Commons数据上进行训练,使艺术家和开发者能够无法律顾虑地使用。此外,我们的模型可以从数据中心GPU(如H200)扩展到消费级GPU乃至MacBook Pro。Stable Audio 3 的主要贡献包括:

- • 发布了适用于消费级硬件的 `small` 和 `medium` 权重(表1 (https://arxiv.org/html/2605.17991#S0.T1))。
- • 在器乐和音效的文本到音频生成方面达到最先进水平(第5节 (https://arxiv.org/html/2605.17991#S5))。
- • 快速推理:在H200上生成长达6分20秒的音频少于2秒(第5.2节 (https://arxiv.org/html/2605.17991#S5.SS2) 和 5.3节 (https://arxiv.org/html/2605.17991#S5.SS3))。
- • 通过修补进行音频编辑,包括单片段和多片段编辑以及续写(第5.6节 (https://arxiv.org/html/2605.17991#S5.SS6))。
- • 提出了一种潜扩散模型的可变长度音频生成新方法(第3.1节 (https://arxiv.org/html/2605.17991#S3.SS1))。
- • 多项技术创新:一个语义-声学自编码器,通过学习紧凑的潜空间用于扩散,同时保持高保真重建和语义信息(第2.1节 (https://arxiv.org/html/2605.17991#S2.SS1));使用Transformer重采样块(TRBs, 第2.1节 (https://arxiv.org/html/2605.17991#S2.SS1))进行下/上采样;改进的扩散Transformer,采用了差分注意力 [92 (https://arxiv.org/html/2605.17991#bib.bib9)]、自适应层归一化条件 [67 (https://arxiv.org/html/2605.17991#bib.bib140)] 和记忆嵌入 [3 (https://arxiv.org/html/2605.17991#bib.bib12), 11 (https://arxiv.org/html/2605.17991#bib.bib11)](第5节 (https://arxiv.org/html/2605.17991#S2.F5));用于流匹配训练的mini-batch最优传输耦合(第3.2节 (https://arxiv.org/html/2605.17991#S3.SS2));以及一个蒸馏预热阶段,随后是对抗后训练,以改进少步生成(第3.3节 (https://arxiv.org/html/2605.17991#S3.SS3) 和 3.4节 (https://arxiv.org/html/2605.17991#S3.SS4))。

### 1.1 相关工作

#### 开源模型。

早期的开源模型主要基于自回归方法 [8 (https://arxiv.org/html/2605.17991#bib.bib42), 40 (https://arxiv.org/html/2605.17991#bib.bib32)] 或潜扩散方法 [50 (https://arxiv.org/html/2605.17991#bib.bib126), 6 (https://arxiv.org/html/2605.17991#bib.bib41), 52 (https://arxiv.org/html/2605.17991#bib.bib38), 19 (https://arxiv.org/html/2605.17991#bib.bib39), 57 (https://arxiv.org/html/2605.17991#bib.bib40), 16 (https://arxiv.org/html/2605.17991#bib.bib16), 59 (https://arxiv.org/html/2605.17991#bib.bib30)]。较新的开源模型继续探索自回归方法 [94 (https://arxiv.org/html/2605.17991#bib.bib28), 91 (https://arxiv.org/html/2605.17991#bib.bib27)],同时引入了流匹配方法 [60 (https://arxiv.org/html/2605.17991#bib.bib337), 30 (https://arxiv.org/html/2605.17991#bib.bib31), 53 (https://arxiv.org/html/2605.17991#bib.bib26)] 和结合自回归建模与流匹配的混合架构 [95 (https://arxiv.org/html/2605.17991#bib.bib29), 20 (https://arxiv.org/html/2605.17991#bib.bib18), 30 (https://arxiv.org/html/2605.17991#bib.bib31)]。这些模型已应用于多种音频生成任务,包括器乐 [6 (https://arxiv.org/html/2605.17991#bib.bib41), 8 (https://arxiv.org/html/2605.17991#bib.bib42), 52 (https://arxiv.org/html/2605.17991#bib.bib38)]、音效 [50 (https://arxiv.org/html/2605.17991#bib.bib126), 52 (https://arxiv.org/html/2605.17991#bib.bib38), 60 (https://arxiv.org/html/2605.17991#bib.bib337), 40 (https://arxiv.org/html/2605.17991#bib.bib32), 19 (https://arxiv.org/html/2605.17991#bib.bib39), 16 (https://arxiv.org/html/2605.17991#bib.bib16)] 以及带人声的歌曲 [94 (https://arxiv.org/html/2605.17991#bib.bib28), 91 (https://arxiv.org/html/2605.17991#bib.bib27), 20 (https://arxiv.org/html/2605.17991#bib.bib18), 95 (https://arxiv.org/html/2605.17991#bib.bib29), 59 (https://arxiv.org/html/2605.17991#bib.bib30), 53 (https://arxiv.org/html/2605.17991#bib.bib26), 30 (https://arxiv.org/html/2605.17991#bib.bib31)]。Stable Audio 3 是一个基于流匹配的开源权重模型家族(`small`,`medium`),用于器乐和音效生成。在评估中,我们与最具竞争力的可用开源模型进行比较。

#### 可变长度。

自回归模型通过顺序生成标记直到产生序列结束标记,自然支持可变长度生成,使得可变长度生成成为一种涌现特性。相比之下,潜扩散模型通常定义在固定长度序列上,需要填充较短的输入 [15 (https://arxiv.org/html/2605.17991#bib.bib15), 14 (https://arxiv.org/html/2605.17991#bib.bib14)]。这使得推理成本依赖于预定义的最大长度而非实际内容,导致效率低下并限制其在长时生成中的实际可扩展性。类似问题在图像扩散中已有解决:早期模型 [68 (https://arxiv.org/html/2605.17991#bib.bib57)] 依赖分辨率条件和裁剪来处理不同尺寸,而现代基于Transformer的方法利用位置编码自然消化各种尺寸的输入 [4 (https://arxiv.org/html/2605.17991#bib.bib325), 46 (https://arxiv.org/html/2605.17991#bib.bib326)]。音频扩散开始跟随这种转变,出现了自回归逐块扩散等方法 [30 (https://arxiv.org/html/2605.17991#bib.bib31)]。然而,完全原生支持可变长度音频生成的扩散方法仍未得到充分解决。据我们所知,Stable Audio 3 模型是首个以类似于图像扩散最新进展的方式应对这一挑战的模型。

#### 语义潜空间。

大多数潜扩散模型在来自VAE的低维(64, 32)潜变量上运行,这些VAE的训练侧重于声学重建 [40 (https://arxiv.org/html/2605.17991#bib.bib32), 16 (https://arxiv.org/html/2605.17991#bib.bib16)]。表示自编码器(RAE) [96 (https://arxiv.org/html/2605.17991#bib.bib36), 82 (https://arxiv.org/html/2605.17991#bib.bib37)] 已经表明,在高维、语义结构化的潜空间中进行扩散可以在图像域带来更快的收敛和更好的生成质量。据我们所知,Stable Audio 3 模型首个在音频域探索这一想法,其依赖语义对齐音乐自编码器(SAME) [65 (https://arxiv.org/html/2605.17991#bib.bib17)],该编码器生成256维潜变量,旨在以高下采样率(4096×)同时编码声学保真度和高层语义结构。

#### 可控性。

随着创意工作流程需要的控制超越提示词 [69 (https://arxiv.org/html/2605.17991#bib.bib332)],对可控音频生成的需求日益增加。先前的工作可分为以下几类:基于掩码、基于指令、推理时控制、全局控制、时变控制和歌词编辑。基于掩码的方法支持局部编辑

相似文章

stabilityai/stable-audio-3-medium

Hugging Face Models Trending

Stability AI 发布了 Stable Audio 3,这是一个潜在扩散模型系列,用于可变长度音频生成和编辑,其小型和中型模型的权重已在 Hugging Face 上提供。

Stable Audio 3.0(3分钟阅读)

TLDR AI

Stability AI发布了Stable Audio 3.0,这是一个开放权重模型系列,可生成最长六分钟的变长音频,支持LoRA微调和音频修复,基于完全许可的数据训练。