Qwen-Music 技术报告
摘要
Qwen-Music 是一个音乐生成模型,能够生成包含人声的高保真歌曲,支持文本生成音乐和翻唱歌曲生成。它采用了一种新颖的旋律思维链机制,并在 16 项客观指标中的 13 项上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/07/20 09:39
论文页面 - Qwen-Music 技术报告
来源:https://huggingface.co/papers/2607.11699 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
在本报告中,我们介绍了 Qwen-Music,一个强大的音乐生成模型,能够生成具有完整人声演唱的高音乐性和高保真度的歌曲。Qwen-Music 支持两项核心任务:文本到音乐生成(根据文本描述、歌词和音乐属性创作全新歌曲)以及翻唱歌曲生成(以不同风格和人声特征重新演绎现有歌曲)。在架构上,Qwen-Music 集成了三个核心组件:Qwen-Music-Tokenizer、Qwen-Music-LLM 和 Qwen-Music-Render。Qwen-Music-Tokenizer 将音频压缩为 25Hz 的单码本音乐语义令牌流,保留语义与旋律信息,供 LLM 预测。基于这些令牌,Qwen-Music-LLM 执行自回归音乐语义建模,其关键创新在于一种基于旋律令牌的思维链(Melody-CoT)机制——在生成完整歌曲之前先规划旋律,从而提升创造力、音乐性、结构连贯性,并支持基于参考音频的旋律克隆。为克服离散语义令牌的保真度限制,Qwen-Music-Render 执行生成式立体声渲染,丰富声学细节,生成高保真立体声波形。最后,我们在超过 500 万小时的多语言音乐数据上训练 Qwen-Music-LLM,覆盖数百种语言。我们首先应用质量感知的预训练课程,然后采用渐进式后训练(包括监督初始化、离线 DPO 和在线 GSPO),进一步提升音乐性和指令遵循能力。在 600 个中文和英文提示的评估中,Qwen-Music 在 16 项客观音乐性与音频质量指标中的 13 项上达到了最先进水平。专业评估人员也更偏爱 Qwen-Music 而非领先的专有系统。在翻唱歌曲生成中,Qwen-Music 相比领先专有系统能更准确地保留参考旋律。
查看 arXiv 页面 (https://arxiv.org/abs/2607.11699)查看 PDF (https://arxiv.org/pdf/2607.11699)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11699)
在您的代理中获取这篇论文:
hf papers read 2607\.11699
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2607.11699 即可从本页面链接该论文。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2607.11699 即可从本页面链接该论文。
引用此论文的 Space0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2607.11699 即可从本页面链接该论文。
包含此论文的收藏集0
没有包含此论文的收藏集
将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从本页面链接它。
相似文章
@askalphaxiv: “Qwen-Music技术报告” AI音乐生成需要同时解决两个问题:创作连贯的歌曲并渲染…
Qwen-Music是一篇新论文,它将音乐生成分为两个阶段:使用紧凑的语义令牌和Melody-CoT进行旋律规划与推理,然后渲染高保真音频,取得了最先进的结果。
Qwen-Image-2.0 技术报告
Qwen-Image-2.0 是一个全新的图像生成基础模型,基于 Qwen3-VL 和多模态扩散 Transformer,将高保真合成与精确编辑能力统一起来。它在富含文本的内容、多语言排版以及照片级真实感生成方面表现卓越。
Qwen3-TTS 技术报告
Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。
Qwen3.5-Omni 技术报告
Qwen3.5-Omni 是一个千亿参数的多模态模型,具备先进的音视频理解与生成能力,引入了新颖的 Audio-Visual Vibe Coding,在215项基准测试中取得SOTA结果,同时与 Gemini-3.1 Pro 持平。
Qwen-Image-2.0 技术报告(阅读时长约57分钟)
本技术报告介绍了阿里巴巴Qwen团队推出的新图像生成模型Qwen-Image-2.0,详细阐述了其架构与能力。