VA-Judger:基于人类偏好反馈的联合视频-音频生成奖励建模
摘要
VA-Judger是首个用于联合视频-音频生成的奖励模型,它使用人类偏好反馈来评估整体质量,包括一个数据集和基准测试,并在应用于像LTX-2这样的模型时展示了人类偏好率的显著提升。
查看缓存全文
缓存时间: 2026/08/21 04:10
论文页面 - VA-Judger:基于人类偏好反馈的联合视频-音频生成奖励建模
来源:https://huggingface.co/papers/2608.18607
🚀 我们很高兴介绍VA-Judger:基于人类偏好反馈的联合视频-音频生成奖励建模,这是首个专为联合视频-音频生成设计的奖励模型。
现有指标通常分别评估视频和音频,忽略了塑造人类偏好的整体跨模态一致性。当用于后训练时,这些碎片化指标也可能导致奖励欺骗——即指标分数提升但感知质量并未相应改善。
我们的主要贡献包括:
- VA-Judger,一种基于推理的全模态奖励模型,可联合评估视觉与音频质量、文本对齐度、音视频同步性、语义连贯性及整体人类偏好。
- VAPref-10K和VA-Judger-Bench,提供人类偏好标注及一个具有挑战性的基准测试集,涵盖域内和域外视频-音频生成模型。
- 一个完整的奖励建模与后训练框架,利用VA-Judger改进联合视频-音频生成。
VA-Judger显著优于单维度指标和全模态模型基线(如Qwen3-Omni)。它还能可靠地泛化至未见过的闭源生成模型。
当用于后训练LTX-2时,所得模型达到了62.30%的人类偏好率,而OmniNFT训练版本为27.63%,原始LTX-2为10.08%。它还在13个客观指标中的11个取得了最佳性能。
🔗 项目主页:https://sharelab-sii.github.io/VA-Judger/
📄 论文:https://arxiv.org/abs/2608.18607
💻 代码:https://github.com/ShareLab-SII/VA-Judger
🤗 模型:https://huggingface.co/ShareLab-SII/VA-Judger
📊 数据集:https://huggingface.co/datasets/ShareLab-SII/VA-Judger-Bench
🎮 演示:https://www.youtube.com/watch?v=HUiEFLTY9-E
更多训练代码和完整的VAPref-10K数据集即将发布。敬请期待!
相似文章
TuneJury: 一个用于改进音乐生成偏好对齐的开放度量
TuneJury 是一个开源的成对奖励模型,用于文本到音乐生成,提供校准的偏好评分,并泛化到多个下游应用。
OmniVAE:具有跨模态对齐的音频-视频VAE,用于联合生成
OmniVAE是一种联合训练的音频-视频VAE,使用分段级对比学习和特征蒸馏来对齐潜在空间,从而提升文本到音频-视频生成中的联合生成质量和同步性。
MSAVBench:迈向多镜头音视频生成的全面可靠评估
MSAVBench是首个面向多镜头音视频生成的综合基准与自适应评估框架,评估了19个模型在多样化任务上的表现,并与人类判断实现了高度对齐。
DeltaRubric:通过联合规划与验证实现生成式多模态奖励建模
DeltaRubric 是一篇研究论文,介绍了一种使用单一多模态大语言模型(MLLM)的两步多模态偏好评估方法,通过联合规划与验证来提高奖励建模的可靠性。
通过人类偏好奖励改进文本到音乐生成
本文提出了一种文本到音乐生成系统,利用奖励条件、专家迭代和偏好调优,在120M参数模型中提升音频质量,该模型提交至ICME 2026 ATTM Grand Challenge。