WanSong v1.0 技术报告

Hugging Face Daily Papers 论文

摘要

WanSong是一个纯扩散式音乐生成模型,能够一次性直接生成长达5分钟的高保真多语种歌曲,并输出双音轨(人声和背景音乐),解决了高效生成、长音频和可控性方面的挑战。

音乐生成基础模型近来引起了工业界的广泛关注。然而,在支持可控性的同时实现高效生成和高保真长音频仍然具有挑战性。为解决这些需求,我们提出了WanSong,一种简单而强大的长篇幅商用级歌曲生成方法。不同于自回归(AR)和级联多阶段流水线(例如,AR后接扩散),WanSong是一个纯扩散模型,能够一次性直接生成长达5分钟的高保真多语种歌曲,并输出双音轨(人声和背景音乐)在一个运行中。此外,我们的扩散框架通过步进蒸馏实现了更快的推理,并为微调和定制提供了高效途径,以支持下游编辑任务。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:43

论文页面 - WanSong v1.0 技术报告

来源:https://huggingface.co/papers/2607.14749

摘要

音乐生成基础模型近期引起了显著的行业关注。然而,在支持可控性的同时实现高效生成和高保真长音频仍然具有挑战性。为应对这些需求,我们提出了 WanSong——一种用于长时长、商业级歌曲生成的简洁而强大的方法。与自回归(AR)和级联多阶段流水线(例如,AR 后接扩散)不同,WanSong 是一个纯扩散模型,可直接生成长达 5 分钟的高保真多语种歌曲,并在单次运行中输出双音轨(人声和背景音乐)。此外,我们的扩散框架通过步蒸馏实现了更快的推理,并为微调和定制提供了高效途径,以支持下游编辑任务。

查看 arXiv 页面 (https://arxiv.org/abs/2607.14749) 查看 PDF (https://arxiv.org/pdf/2607.14749) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14749)

在您的代理中获取该论文:

hf papers read 2607.14749

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.14749 以从该页面链接它。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.14749 以从该页面链接它。

引用此论文的 Space 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2607.14749 以从该页面链接它。

包含此论文的收藏集 3

相似文章

Qwen-Music 技术报告

Hugging Face Daily Papers

Qwen-Music 是一个音乐生成模型,能够生成包含人声的高保真歌曲,支持文本生成音乐和翻唱歌曲生成。它采用了一种新颖的旋律思维链机制,并在 16 项客观指标中的 13 项上取得了最先进的结果。

Wan-Streamer v0.1:端到端实时交互基础模型

Hugging Face Daily Papers

Wan-Streamer是一个统一的端到端多模态模型,用于实时音视频交互,采用因果注意力机制,并集成处理视觉、音频和文本模态,实现了亚秒级延迟。