WanSong v1.0 技术报告
摘要
WanSong是一个纯扩散式音乐生成模型,能够一次性直接生成长达5分钟的高保真多语种歌曲,并输出双音轨(人声和背景音乐),解决了高效生成、长音频和可控性方面的挑战。
查看缓存全文
缓存时间: 2026/07/20 09:43
论文页面 - WanSong v1.0 技术报告
来源:https://huggingface.co/papers/2607.14749
摘要
音乐生成基础模型近期引起了显著的行业关注。然而,在支持可控性的同时实现高效生成和高保真长音频仍然具有挑战性。为应对这些需求,我们提出了 WanSong——一种用于长时长、商业级歌曲生成的简洁而强大的方法。与自回归(AR)和级联多阶段流水线(例如,AR 后接扩散)不同,WanSong 是一个纯扩散模型,可直接生成长达 5 分钟的高保真多语种歌曲,并在单次运行中输出双音轨(人声和背景音乐)。此外,我们的扩散框架通过步蒸馏实现了更快的推理,并为微调和定制提供了高效途径,以支持下游编辑任务。
查看 arXiv 页面 (https://arxiv.org/abs/2607.14749) 查看 PDF (https://arxiv.org/pdf/2607.14749) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.14749)
在您的代理中获取该论文:
hf papers read 2607.14749
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.14749 以从该页面链接它。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.14749 以从该页面链接它。
引用此论文的 Space 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2607.14749 以从该页面链接它。
包含此论文的收藏集 3
相似文章
Qwen-Music 技术报告
Qwen-Music 是一个音乐生成模型,能够生成包含人声的高保真歌曲,支持文本生成音乐和翻唱歌曲生成。它采用了一种新颖的旋律思维链机制,并在 16 项客观指标中的 13 项上取得了最先进的结果。
@junmingong: Khala 1.0 刚刚发布——来自北京中央音乐学院的一个音乐生成模型。论文、代码、权重……
Khala 1.0 是一个开源音乐生成模型,用于从文本和歌词生成高保真完整歌曲,采用统一的声学标记管道。由北京中央音乐学院发布,附带论文、代码、权重和演示。
@askalphaxiv: “Qwen-Music技术报告” AI音乐生成需要同时解决两个问题:创作连贯的歌曲并渲染…
Qwen-Music是一篇新论文,它将音乐生成分为两个阶段:使用紧凑的语义令牌和Melody-CoT进行旋律规划与推理,然后渲染高保真音频,取得了最先进的结果。
Wan-Dancer: 一种用于分钟级别连贯音乐到舞蹈生成的层次化框架
Wan-Dancer 提出了一种层次化框架,用于从音乐生成分钟级别的连贯舞蹈,解决了长时间编舞生成的挑战。
Wan-Streamer v0.1:端到端实时交互基础模型
Wan-Streamer是一个统一的端到端多模态模型,用于实时音视频交互,采用因果注意力机制,并集成处理视觉、音频和文本模态,实现了亚秒级延迟。