VA-Judger:基于人类偏好反馈的联合视频-音频生成奖励建模

Hugging Face Daily Papers 论文

摘要

VA-Judger是首个用于联合视频-音频生成的奖励模型,它使用人类偏好反馈来评估整体质量,包括一个数据集和基准测试,并在应用于像LTX-2这样的模型时展示了人类偏好率的显著提升。

使用强化学习对联合视频-音频生成模型进行后训练需要奖励信号。现有方法通过结合各个质量维度的指标来构建这个奖励,包括音频质量、视觉保真度和同步性。然而,这些指标分别评估感知维度,未能捕捉文本提示、视频和音频之间的整体语义和时序连贯性,而这塑造了人类偏好。针对这些指标优化模型会鼓励奖励黑客,生成在这些指标上得分高但对人类观众来说不连贯或不真实的视频-音频内容。为了解决这个问题,我们首先构建了一个大规模的人类偏好数据集VAPref-10K,用于联合视频-音频生成,包含9K个提示和10.3K个来自开源生成模型的细粒度配对比较。我们还引入了VA-Judger-Bench基准测试,包含域内和域外模型比较,以评估奖励模型是否真正与人类偏好对齐。我们进一步提出了VA-Judger,一个用于联合视频-音频生成的思维链全奖励模型。具体而言,VA-Judger首先从具有明确质量差距的配对中学习,以建立结构化输出和粗糙偏好区分,然后通过拒绝采样蒸馏出可靠的偏好解释,用于更困难的近质量比较,并经过人类注释验证,最后执行维度强化学习,将人类反馈分解为各个质量维度,以获得比单个二元偏好标签更密集的奖励信号。实验表明,VA-Judger在预测人类偏好方面优于指标基线,在域内和域外评估中均表现更佳。使用其人类对齐的奖励对音频-视频生成模型进行后训练,也显著提高了生成质量。
查看原文
查看缓存全文

缓存时间: 2026/08/21 04:10

论文页面 - VA-Judger:基于人类偏好反馈的联合视频-音频生成奖励建模

来源:https://huggingface.co/papers/2608.18607

🚀 我们很高兴介绍VA-Judger:基于人类偏好反馈的联合视频-音频生成奖励建模,这是首个专为联合视频-音频生成设计的奖励模型

现有指标通常分别评估视频和音频,忽略了塑造人类偏好的整体跨模态一致性。当用于后训练时,这些碎片化指标也可能导致奖励欺骗——即指标分数提升但感知质量并未相应改善。

我们的主要贡献包括:

  • VA-Judger,一种基于推理的全模态奖励模型,可联合评估视觉与音频质量、文本对齐度、音视频同步性、语义连贯性及整体人类偏好。
  • VAPref-10KVA-Judger-Bench,提供人类偏好标注及一个具有挑战性的基准测试集,涵盖域内和域外视频-音频生成模型。
  • 一个完整的奖励建模与后训练框架,利用VA-Judger改进联合视频-音频生成。

VA-Judger显著优于单维度指标和全模态模型基线(如Qwen3-Omni)。它还能可靠地泛化至未见过的闭源生成模型。

当用于后训练LTX-2时,所得模型达到了62.30%的人类偏好率,而OmniNFT训练版本为27.63%,原始LTX-2为10.08%。它还在13个客观指标中的11个取得了最佳性能。

🔗 项目主页:https://sharelab-sii.github.io/VA-Judger/
📄 论文:https://arxiv.org/abs/2608.18607
💻 代码:https://github.com/ShareLab-SII/VA-Judger
🤗 模型:https://huggingface.co/ShareLab-SII/VA-Judger
📊 数据集:https://huggingface.co/datasets/ShareLab-SII/VA-Judger-Bench
🎮 演示:https://www.youtube.com/watch?v=HUiEFLTY9-E

更多训练代码和完整的VAPref-10K数据集即将发布。敬请期待!

相似文章

通过人类偏好奖励改进文本到音乐生成

Hugging Face Daily Papers

本文提出了一种文本到音乐生成系统,利用奖励条件、专家迭代和偏好调优,在120M参数模型中提升音频质量,该模型提交至ICME 2026 ATTM Grand Challenge。