Qwen-Music 技术报告

Hugging Face Daily Papers 论文

摘要

Qwen-Music 是一个音乐生成模型,能够生成包含人声的高保真歌曲,支持文本生成音乐和翻唱歌曲生成。它采用了一种新颖的旋律思维链机制,并在 16 项客观指标中的 13 项上取得了最先进的结果。

在本报告中,我们介绍了 Qwen-Music,这是一个强大的音乐生成模型,能够生成具有完整人声演唱的高音乐性和高保真歌曲。Qwen-Music 支持两个核心任务:文本生成音乐(根据文本描述、歌词和音乐属性创作全新歌曲)和翻唱歌曲生成(以不同风格和人声特征重新演绎现有歌曲)。在架构上,Qwen-Music 集成了三个核心组件:Qwen-Music-Tokenizer、Qwen-Music-LLM 和 Qwen-Music-Render。Qwen-Music-Tokenizer 将音频压缩为 25 Hz 的单码本音乐语义标记流,保留语义和旋律信息以供 LLM 预测。基于这些标记,Qwen-Music-LLM 执行自回归音乐语义建模,其关键创新在于基于旋律标记的思维链(Melody-CoT)机制,该机制在完整歌曲生成之前规划旋律,从而提升创造力、音乐性、结构连贯性以及基于参考音频的旋律克隆。为了克服离散语义标记的保真度限制,Qwen-Music-Render 执行生成式立体声渲染,丰富声学细节并产生高保真立体声波形。最后,我们在超过 500 万小时的多语言音乐数据(涵盖数百种语言)上训练 Qwen-Music-LLM。我们首先应用质量感知的预训练课程,然后使用渐进式后训练,包括监督初始化、离线 DPO 和在线 GSPO,以进一步提高音乐性和指令跟随能力。在 600 个中文和英文提示中,Qwen-Music 在 16 项客观音乐性和音频质量指标中的 13 项上取得了最先进的结果。专业评估人员也更倾向于 Qwen-Music 而非领先的专有系统。对于翻唱歌曲生成,Qwen-Music 比领先的专有系统更准确地保留了参考旋律。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:39

论文页面 - Qwen-Music 技术报告

来源:https://huggingface.co/papers/2607.11699 作者:

摘要

在本报告中,我们介绍了 Qwen-Music,一个强大的音乐生成模型,能够生成具有完整人声演唱的高音乐性和高保真度的歌曲。Qwen-Music 支持两项核心任务:文本到音乐生成(根据文本描述、歌词和音乐属性创作全新歌曲)以及翻唱歌曲生成(以不同风格和人声特征重新演绎现有歌曲)。在架构上,Qwen-Music 集成了三个核心组件:Qwen-Music-Tokenizer、Qwen-Music-LLM 和 Qwen-Music-Render。Qwen-Music-Tokenizer 将音频压缩为 25Hz 的单码本音乐语义令牌流,保留语义与旋律信息,供 LLM 预测。基于这些令牌,Qwen-Music-LLM 执行自回归音乐语义建模,其关键创新在于一种基于旋律令牌的思维链(Melody-CoT)机制——在生成完整歌曲之前先规划旋律,从而提升创造力、音乐性、结构连贯性,并支持基于参考音频的旋律克隆。为克服离散语义令牌的保真度限制,Qwen-Music-Render 执行生成式立体声渲染,丰富声学细节,生成高保真立体声波形。最后,我们在超过 500 万小时的多语言音乐数据上训练 Qwen-Music-LLM,覆盖数百种语言。我们首先应用质量感知的预训练课程,然后采用渐进式后训练(包括监督初始化、离线 DPO 和在线 GSPO),进一步提升音乐性和指令遵循能力。在 600 个中文和英文提示的评估中,Qwen-Music 在 16 项客观音乐性与音频质量指标中的 13 项上达到了最先进水平。专业评估人员也更偏爱 Qwen-Music 而非领先的专有系统。在翻唱歌曲生成中,Qwen-Music 相比领先专有系统能更准确地保留参考旋律。

查看 arXiv 页面 (https://arxiv.org/abs/2607.11699)查看 PDF (https://arxiv.org/pdf/2607.11699)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.11699)

在您的代理中获取这篇论文:

hf papers read 2607\.11699

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2607.11699 即可从本页面链接该论文。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2607.11699 即可从本页面链接该论文。

引用此论文的 Space0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2607.11699 即可从本页面链接该论文。

包含此论文的收藏集0

没有包含此论文的收藏集

将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 即可从本页面链接它。

相似文章

Qwen-Image-2.0 技术报告

Hugging Face Daily Papers

Qwen-Image-2.0 是一个全新的图像生成基础模型,基于 Qwen3-VL 和多模态扩散 Transformer,将高保真合成与精确编辑能力统一起来。它在富含文本的内容、多语言排版以及照片级真实感生成方面表现卓越。

Qwen3-TTS 技术报告

Papers with Code Trending

Qwen3-TTS 技术报告介绍了一系列先进的多语言文本转语音模型,具备语音克隆和可控生成能力,采用双轨 LM 架构和专用分词器以实现低延迟流式处理。

Qwen3.5-Omni 技术报告

Hugging Face Daily Papers

Qwen3.5-Omni 是一个千亿参数的多模态模型,具备先进的音视频理解与生成能力,引入了新颖的 Audio-Visual Vibe Coding,在215项基准测试中取得SOTA结果,同时与 Gemini-3.1 Pro 持平。