Stable Audio 3.0(3分钟阅读)
摘要
Stability AI发布了Stable Audio 3.0,这是一个开放权重模型系列,可生成最长六分钟的变长音频,支持LoRA微调和音频修复,基于完全许可的数据训练。
Stability AI发布了全新Stable Audio 3.0模型系列,包括开放权重版本,能够生成超过六分钟的音乐和音效。
查看缓存全文
缓存时间: 2026/05/21 18:14
# Stable Audio 3.0:采用开源权重构建的模型家族 — Stability AI
来源:https://stability.ai/news-updates/meet-stable-audio-3-the-model-family-built-for-artistic-experimentation-with-open-weight-models
### **向实验开放,创作成果归你所有**
所有 Stable Audio 3\.0 模型均使用完全许可的数据进行训练。根据 Stability AI 社区许可,你拥有自己的输出,并可自由分发和商业化。
对于年收入超过 100 万美元的组织,你可以通过我们的企业许可证(https://stability.ai/license)获得商业保障。企业许可证还提供法律赔偿。
3.0 Small SFX、3.0 Small 和 3.0 Medium 均为开源权重。据我们所知,其他开源音乐模型要么限制商业使用,要么因使用未经许可的音乐训练而存在风险。
### **支持变体和迭代的架构进步**
Stable Audio 3.0 是我们的下一代架构,采用了新颖的语义-声学自编码器,能够生成更长、更灵活的音频。你可以在此处阅读完整的研究论文(https://stability.ai/research/stable-audio-3)。
**可变长度生成,最长可达六分钟以上。**Stable Audio 3.0 引入了一种新的可变长度音频生成方法,使你能够以秒级粒度精确生成所需内容。
3.0 Small 可生成长达两分钟的音频,而 Stable Audio Open Small 仅能生成 11 秒,Stable Audio Open 则能生成 47 秒。3.0 Medium 和 3.0 Large 可生成超过六分钟的音频。
**设备端完整音乐创作。**据我们所知,3.0 Small 是唯一能够在设备端进行完整音乐创作的模型。首次,设备端和离线的音频生成不再局限于短样本,而是可以生成完整的音乐曲目。
**在你的素材库上定制模型,支持 LoRa 训练。**LoRa 是一种高效的微调方法,最初在图像生成领域流行,现已成为定制音频生成模型的新兴方法。
我们首次发布了 LoRa 训练文档,同时提供了 3.0 Small 和 3.0 Medium 的权重。对于拥有我们企业许可证(https://stability.ai/license)的组织,我们提供白手套微调支持。
**音频修补选项。**修改音轨中的某个片段,重新制作歌曲的一部分,或扩展你的作品,而无需从头开始。Stable Audio 3.0 支持单片段编辑、多片段编辑和因果延续(将音频扩展到其原始终点之外)。
### **为未来奠定基础**
Stable Audio 3.0 是我们在其上构建下一代完全许可专业音频模型的新架构。
虽然负责任训练的生成式 AI 模型至关重要,但仅靠它们并不足够。以艺术家为中心的 AI 只有在其许可平台上的产品体验优于非许可平台时才能胜出。
我们还在为音乐人开发一系列新产品。加入候补名单(https://share-eu1.hsforms.com/1cBrLVtosT7qN7qwVKjjdiQfjsd0)以抢先体验。
同时,你可以了解我们与环球音乐集团(https://stability.ai/news-updates/universal-music-group-and-stability-ai-announce-strategic-alliance)和华纳音乐集团(https://stability.ai/news-updates/warner-music-group-and-stability-ai-join-forces-to-build-next-gen-tools)的合作。
### **立即开始使用 Stable Audio 3.0**
**开源权重:**在 Hugging Face(https://huggingface.co/collections/stabilityai/stable-audio-3)上下载 3.0 Small SFX、3.0 Small 和 3.0 Medium。对于年收入超过 100 万美元的组织,请联系我们(https://stability.ai/enterprise)讨论企业许可。
**API:**Stable Audio 3.0 Large 可通过 Stability AI API(https://platform.stability.ai/docs/api-reference#tag/Stable-Audio)获取。
**合作伙伴平台:**Stable Audio 3.0 将在 ComfyUI(https://blog.comfy.org/p/stable-audio-3-day-0-support)及其他平台上提供。
相似文章
stabilityai/stable-audio-3-medium
Stability AI 发布了 Stable Audio 3,这是一个潜在扩散模型系列,用于可变长度音频生成和编辑,其小型和中型模型的权重已在 Hugging Face 上提供。
Stable Audio 3
Stable Audio 3 推出了一系列快速潜扩散模型,用于变长音频生成与编辑,并开源了中小型模型权重。
Stability AI 发布新音频模型,可生成6分钟歌曲
Stability AI 发布 Stability Audio 3.0,这是一系列音频模型,能够生成长达6分钟的专业级音乐,其中包含较小模型的开放权重版本以及许可训练数据。
@multimodalart: @StabilityAI 的 Stable Audio 3 刚刚发布。主要提供3种开源变体:- Stable Audio 3 Medium (2B) - …
Stability AI发布了Stable Audio 3,提供用于音乐和VFX的开源变体,具备快速且高质量的音频生成能力。
@thepatch_kev:有些AI音乐模型实际上是专为音乐人打造的,Stable Audio 3就是一个很好的例子。感谢 @z…
Stability AI 发布了 Stable Audio 3.0,这是一个用于生成音频的开放权重模型系列,旨在支持艺术实验并集成到 gary4juce 等 DAW 中。