通过人类偏好奖励改进文本到音乐生成
摘要
本文提出了一种文本到音乐生成系统,利用奖励条件、专家迭代和偏好调优,在120M参数模型中提升音频质量,该模型提交至ICME 2026 ATTM Grand Challenge。
查看缓存全文
缓存时间: 2026/06/23 09:41
论文页面 - 用人类偏好奖励改进文本到音乐生成
来源:https://huggingface.co/papers/2606.21670
摘要
一种文本到音乐生成系统采用奖励调节、专家迭代和偏好调优的方法,在保持120M参数模型框架效率的同时提升音频质量。
我们描述了参加ICME 2026学术文本到音乐(ATTM)大挑战效率赛道的方法。除了挑战协议中的FAD-CLAP (https://huggingface.co/papers?q=FAD-CLAP)和CLAP得分 (https://huggingface.co/papers?q=CLAP%20score)之外,我们还添加了来自TuneJury (https://huggingface.co/papers?q=TuneJury)的学习型人类偏好奖励,这是一个在开放音乐偏好数据集上训练的双向成对排序器 (https://huggingface.co/papers?q=twin%20pairwise%20ranker)。该奖励既作为训练时的调节信号,也作为样本选择标准。我们的流水线在120M参数的FluxAudio-S (https://huggingface.co/papers?q=FluxAudio-S)骨干上结合了五项工程决策,其中四项在训练时,一项在推理时:(i) 训练时奖励调节 (https://huggingface.co/papers?q=training-time%20reward%20conditioning),同时充当推理时CFG (https://huggingface.co/papers?q=inference-time%20CFG)轴;(ii) 对五种得分调节架构 (https://huggingface.co/papers?q=score-conditioning%20architectures)进行扫描,训练和推理使用不同变体;(iii) 在前十分位数上进行专家迭代 (https://huggingface.co/papers?q=expert%20iteration);(iv) 进行短时的偏好调优步骤(CRPO (https://huggingface.co/papers?q=CRPO))以实现音频文本对齐 (https://huggingface.co/papers?q=audio-text%20alignment);以及(v) 通过联合CFG (https://huggingface.co/papers?q=joint%20CFG)、源分离 (https://huggingface.co/papers?q=source%20separation)和响度归一化 (https://huggingface.co/papers?q=loudness%20normalization)进行推理后处理。在100个Song Describer提示上的逐阶段分解表明,训练时奖励调节 (https://huggingface.co/papers?q=training-time%20reward%20conditioning)是一个有效的调节轴,专家迭代 (https://huggingface.co/papers?q=expert%20iteration)是主要贡献者,偏好调优步骤仅带来噪声级增益,而推理时得分标量在链末端已饱和。
查看arXiv页面 (https://arxiv.org/abs/2606.21670)
查看PDF (https://arxiv.org/pdf/2606.21670)
项目页面 (https://huggingface.co/spaces/yonghyunk1m/TTM-HumanPref)
GitHub1 (https://github.com/yonghyunk1m/TTM-HumanPref)
添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2606.21670)
在你的代理中获取这篇论文:
hf papers read 2606.21670
没有最新CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2606.21670以从此页面链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2606.21670以从此页面链接。
引用此论文的空间 1
包含此论文的集合 0
没有集合包含此论文
将此论文添加到一个集合 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
TuneJury: 一个用于改进音乐生成偏好对齐的开放度量
TuneJury 是一个开源的成对奖励模型,用于文本到音乐生成,提供校准的偏好评分,并泛化到多个下游应用。
VA-Judger:基于人类偏好反馈的联合视频-音频生成奖励建模
VA-Judger是首个用于联合视频-音频生成的奖励模型,它使用人类偏好反馈来评估整体质量,包括一个数据集和基准测试,并在应用于像LTX-2这样的模型时展示了人类偏好率的显著提升。
基于人类偏好微调GPT-2
OpenAI展示了使用人类偏好反馈对GPT-2(774M参数)进行微调,用于文本续写和摘要任务,风格任务需要5000个标签,摘要任务需要60000个标签,模型达到了86-88%的人类偏好率,但揭示了标注者启发式利用的问题。
我训练了一个游戏音乐生成器
我训练了一个1.2B DiT模型用于器乐游戏音乐生成,使用Stable Audio的VAE,旨在覆盖多样化的风格。该项目是开源的,包含一个WebUI和可在HuggingFace上获取的样本。
基于音频嵌入的味觉感知音乐检索
本文介绍了一个从音频嵌入预测味觉品质(如甜、苦等)的基准测试。它评估了10个预训练的音频编码器,实现了0.134的均方根误差,超越了先前的最优水平,并实现了基于味觉的音乐检索。