WorldReward: 针对相机条件化世界模型的奖励建模

Hugging Face Daily Papers 论文

摘要

WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。

相机条件化世界模型生成交互式视频,其中命令的动作应引起预期的场景变化,同时外观、几何和时间动态保持连贯。现有奖励分别评估这些需求:基于几何的奖励估计轨迹执行,但不能判断执行运动的视觉质量,而基于图像的奖励测量帧质量,但不捕捉动作执行或时间动态。我们假设视觉语言模型(VLM)提供了一个共享推理空间,用于将动作与其视觉结果相关联。然而,根据完整的动作序列判断一个完整的长视频会产生冗长、嘈杂的上下文,其中短暂的局部动作证据可能被遗漏或稀释。我们提出WorldReward,一种基于VLM的成对偏好奖励模型,为相机条件化世界模型统一动作一致性和视觉质量评估。WorldReward将配对视频分解为动作对齐的分块,将每个分块组织成结构化的视觉证据,并通过投票将分块级决策聚合为单独的视频级动作和视觉质量偏好。为了训练它,我们构建了一个大规模推理增强的偏好数据集,使用前沿VLM生成的结构化判断,并通过基于工具的代理审核和针对性人工审查进行精炼。我们进一步引入WorldReward-Bench,一个人工标注的基准,测量奖励模型在动作一致性、外观质量和运动质量方面与人类偏好的一致性。WorldReward在所有三个维度上实现了最高的一致性,分别超过GPT-5.5 3.42、1.45和3.56个百分点。当用于HY-WorldPlay 1.5的强化学习后训练时,它在不同时间范围内一致提高了动作执行和视觉质量。
查看原文
查看缓存全文

缓存时间: 2026/09/04 03:55

论文页面 - WorldReward:基于相机条件的视频世界模型的奖励建模

来源:https://huggingface.co/papers/2609.03952 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

WorldReward 是一个视觉语言奖励模型,它通过对齐视频片段与动作,并综合评估动作执行一致性与视觉质量的偏好,来评估基于相机条件的视频世界模型。

基于相机条件的视频世界模型(https://huggingface.co/papers?q=Camera-conditioned%20world%20models)能够生成交互式视频,其中指令化的动作应引发预期的场景变化,同时保持外观、几何结构和时间动态的一致性。现有的奖励机制分别评估这些要求:基于几何的奖励可以估计轨迹执行情况,但无法判断执行动作的视觉质量;而基于图像的奖励可以衡量帧质量,但无法捕捉动作执行或时间动态。我们认为视觉语言模型(https://huggingface.co/papers?q=vision-language%20model)(VLM)提供了一个共享的推理空间,可以将动作与其视觉结果关联起来。然而,将完整的长视频与其完整的动作序列进行对比评估,会产生冗长且嘈杂的上下文,导致短暂的局部动作证据可能被遗漏或稀释。我们提出了 WorldReward,这是一个基于 VLM 的成对偏好奖励模型(https://huggingface.co/papers?q=pairwise%20preference%20reward%20model),它统一了针对基于相机条件的视频世界模型(https://huggingface.co/papers?q=camera-conditioned%20world%20models)的动作一致性和视觉质量评估。WorldReward 将成对的视频分解为动作对齐的片段(https://huggingface.co/papers?q=action-aligned%20chunks),将每个片段组织成结构化的视觉证据(https://huggingface.co/papers?q=structured%20visual%20evidence),并通过投票方式汇总片段级别的决策,形成独立的视频级动作偏好和视觉质量偏好。为了训练它,我们构建了一个大规模的推理增强偏好数据集(https://huggingface.co/papers?q=reasoning-augmented%20preference%20dataset),该数据集利用前沿 VLM 生成结构化判断,并通过基于工具的代理审核(https://huggingface.co/papers?q=tool-based%20agent%20auditing)和针对性的人工审查进行精炼。我们还引入了 WorldReward-Bench(https://huggingface.co/papers?q=WorldReward-Bench),这是一个由人工标注的基准,用于衡量奖励模型在动作一致性、外观质量和运动质量三个维度上与人类偏好的一致性。WorldReward 在这三个维度上都达到了最高的一致性,分别超越 GPT-5.5 3.42、1.45 和 3.56 个百分点。当用于 HY-WorldPlay 1.5 的强化学习后训练(https://huggingface.co/papers?q=RL%20post-training)时,它在短期到长期范围内一致地提升了动作执行效果和视觉质量。

查看 arXiv 页面 (https://arxiv.org/abs/2609.03952) 查看 PDF (https://arxiv.org/pdf/2609.03952) 项目页面 (https://codegoat24.github.io/WorldReward/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.03952)

通过您的智能体获取此论文:

hf papers read 2609\.03952

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型1

CodeGoat24/WorldReward-qwen35-9b 图像-文本到文本 • 9B • 约1小时前更新 • 2 • 2 (https://huggingface.co/CodeGoat24/WorldReward-qwen35-9b)

引用本文的数据集1

CodeGoat24/WorldReward-Bench 查看器 • 约1小时前更新 • 760 • 1 • 2 (https://huggingface.co/datasets/CodeGoat24/WorldReward-Bench)

引用本文的空间0

没有链接到本文的空间

在空间的 README.md 文件中引用 arxiv.org/abs/2609.03952,即可从本页面链接到它。

包含本文的收藏夹1

相似文章

WorldCycle:面向长视界视频世界模型的自验证强化学习

Hugging Face Daily Papers

WorldCycle提出了一种面向长视界视频世界模型的自验证强化学习方法,利用可逆动作循环作为免费监督,将状态回归漂移降低最多44%,并将复合动作准确率提升近4倍。它还引入了CycleBench,以评估作为模拟器的世界模型。

奖励作为具身世界模型的智能体

arXiv cs.AI

本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。

Wonder:更优的视频世界模型

Hugging Face Daily Papers

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。