通过人类偏好奖励改进文本到音乐生成

Hugging Face Daily Papers 论文

摘要

本文提出了一种文本到音乐生成系统,利用奖励条件、专家迭代和偏好调优,在120M参数模型中提升音频质量,该模型提交至ICME 2026 ATTM Grand Challenge。

我们描述了参加ICME 2026学术文本到音乐(ATTM)Grand Challenge效率赛道的方法。除挑战协议中的FAD-CLAP和CLAP评分外,我们还加入了来自TuneJury的学习型人类偏好奖励——一种基于开放音乐偏好数据集训练的双向配对排名器。该奖励既作为训练时的条件信号,也作为样本选择标准。整个流程在120M参数的FluxAudio-S骨干上结合了五项工程决策,其中四项在训练时实施,一项在推理时实施:(i) 训练时奖励条件,同时作为推理时CFG轴,(ii) 对五种评分条件架构进行扫描,训练和推理使用不同变体,(iii) 对前十分位进行专家迭代,(iv) 短时偏好调优(CRPO)以实现音频-文本对齐,(v) 推理后处理,通过联合CFG、源分离和响度归一化。基于100个Song Describer提示的逐阶段分解表明,训练时奖励条件作为功能条件轴,专家迭代为主要贡献者,偏好调优仅带来噪声级增益,而推理时评分标量在流程结束时已饱和。
查看原文
查看缓存全文

缓存时间: 2026/06/23 09:41

论文页面 - 用人类偏好奖励改进文本到音乐生成

来源:https://huggingface.co/papers/2606.21670

摘要

一种文本到音乐生成系统采用奖励调节、专家迭代和偏好调优的方法,在保持120M参数模型框架效率的同时提升音频质量。

我们描述了参加ICME 2026学术文本到音乐(ATTM)大挑战效率赛道的方法。除了挑战协议中的FAD-CLAP (https://huggingface.co/papers?q=FAD-CLAP)和CLAP得分 (https://huggingface.co/papers?q=CLAP%20score)之外,我们还添加了来自TuneJury (https://huggingface.co/papers?q=TuneJury)的学习型人类偏好奖励,这是一个在开放音乐偏好数据集上训练的双向成对排序器 (https://huggingface.co/papers?q=twin%20pairwise%20ranker)。该奖励既作为训练时的调节信号,也作为样本选择标准。我们的流水线在120M参数的FluxAudio-S (https://huggingface.co/papers?q=FluxAudio-S)骨干上结合了五项工程决策,其中四项在训练时,一项在推理时:(i) 训练时奖励调节 (https://huggingface.co/papers?q=training-time%20reward%20conditioning),同时充当推理时CFG (https://huggingface.co/papers?q=inference-time%20CFG)轴;(ii) 对五种得分调节架构 (https://huggingface.co/papers?q=score-conditioning%20architectures)进行扫描,训练和推理使用不同变体;(iii) 在前十分位数上进行专家迭代 (https://huggingface.co/papers?q=expert%20iteration);(iv) 进行短时的偏好调优步骤(CRPO (https://huggingface.co/papers?q=CRPO))以实现音频文本对齐 (https://huggingface.co/papers?q=audio-text%20alignment);以及(v) 通过联合CFG (https://huggingface.co/papers?q=joint%20CFG)、源分离 (https://huggingface.co/papers?q=source%20separation)和响度归一化 (https://huggingface.co/papers?q=loudness%20normalization)进行推理后处理。在100个Song Describer提示上的逐阶段分解表明,训练时奖励调节 (https://huggingface.co/papers?q=training-time%20reward%20conditioning)是一个有效的调节轴,专家迭代 (https://huggingface.co/papers?q=expert%20iteration)是主要贡献者,偏好调优步骤仅带来噪声级增益,而推理时得分标量在链末端已饱和。

查看arXiv页面 (https://arxiv.org/abs/2606.21670)
查看PDF (https://arxiv.org/pdf/2606.21670)
项目页面 (https://huggingface.co/spaces/yonghyunk1m/TTM-HumanPref)
GitHub1 (https://github.com/yonghyunk1m/TTM-HumanPref)
添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2606.21670)

在你的代理中获取这篇论文:

hf papers read 2606.21670

没有最新CLI?
curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2606.21670以从此页面链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2606.21670以从此页面链接。

引用此论文的空间 1

包含此论文的集合 0

没有集合包含此论文

将此论文添加到一个集合 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

基于人类偏好微调GPT-2

OpenAI Blog

OpenAI展示了使用人类偏好反馈对GPT-2(774M参数)进行微调,用于文本续写和摘要任务,风格任务需要5000个标签,摘要任务需要60000个标签,模型达到了86-88%的人类偏好率,但揭示了标注者启发式利用的问题。

我训练了一个游戏音乐生成器

Reddit r/LocalLLaMA

我训练了一个1.2B DiT模型用于器乐游戏音乐生成,使用Stable Audio的VAE,旨在覆盖多样化的风格。该项目是开源的,包含一个WebUI和可在HuggingFace上获取的样本。

基于音频嵌入的味觉感知音乐检索

Hugging Face Daily Papers

本文介绍了一个从音频嵌入预测味觉品质(如甜、苦等)的基准测试。它评估了10个预训练的音频编码器,实现了0.134的均方根误差,超越了先前的最优水平,并实现了基于味觉的音乐检索。