WorldReward: 针对相机条件化世界模型的奖励建模
摘要
WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。
查看缓存全文
缓存时间: 2026/09/04 03:55
论文页面 - WorldReward:基于相机条件的视频世界模型的奖励建模
来源:https://huggingface.co/papers/2609.03952 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
WorldReward 是一个视觉语言奖励模型,它通过对齐视频片段与动作,并综合评估动作执行一致性与视觉质量的偏好,来评估基于相机条件的视频世界模型。
基于相机条件的视频世界模型(https://huggingface.co/papers?q=Camera-conditioned%20world%20models)能够生成交互式视频,其中指令化的动作应引发预期的场景变化,同时保持外观、几何结构和时间动态的一致性。现有的奖励机制分别评估这些要求:基于几何的奖励可以估计轨迹执行情况,但无法判断执行动作的视觉质量;而基于图像的奖励可以衡量帧质量,但无法捕捉动作执行或时间动态。我们认为视觉语言模型(https://huggingface.co/papers?q=vision-language%20model)(VLM)提供了一个共享的推理空间,可以将动作与其视觉结果关联起来。然而,将完整的长视频与其完整的动作序列进行对比评估,会产生冗长且嘈杂的上下文,导致短暂的局部动作证据可能被遗漏或稀释。我们提出了 WorldReward,这是一个基于 VLM 的成对偏好奖励模型(https://huggingface.co/papers?q=pairwise%20preference%20reward%20model),它统一了针对基于相机条件的视频世界模型(https://huggingface.co/papers?q=camera-conditioned%20world%20models)的动作一致性和视觉质量评估。WorldReward 将成对的视频分解为动作对齐的片段(https://huggingface.co/papers?q=action-aligned%20chunks),将每个片段组织成结构化的视觉证据(https://huggingface.co/papers?q=structured%20visual%20evidence),并通过投票方式汇总片段级别的决策,形成独立的视频级动作偏好和视觉质量偏好。为了训练它,我们构建了一个大规模的推理增强偏好数据集(https://huggingface.co/papers?q=reasoning-augmented%20preference%20dataset),该数据集利用前沿 VLM 生成结构化判断,并通过基于工具的代理审核(https://huggingface.co/papers?q=tool-based%20agent%20auditing)和针对性的人工审查进行精炼。我们还引入了 WorldReward-Bench(https://huggingface.co/papers?q=WorldReward-Bench),这是一个由人工标注的基准,用于衡量奖励模型在动作一致性、外观质量和运动质量三个维度上与人类偏好的一致性。WorldReward 在这三个维度上都达到了最高的一致性,分别超越 GPT-5.5 3.42、1.45 和 3.56 个百分点。当用于 HY-WorldPlay 1.5 的强化学习后训练(https://huggingface.co/papers?q=RL%20post-training)时,它在短期到长期范围内一致地提升了动作执行效果和视觉质量。
查看 arXiv 页面 (https://arxiv.org/abs/2609.03952) 查看 PDF (https://arxiv.org/pdf/2609.03952) 项目页面 (https://codegoat24.github.io/WorldReward/) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.03952)
通过您的智能体获取此论文:
hf papers read 2609\.03952
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型1
CodeGoat24/WorldReward-qwen35-9b 图像-文本到文本 • 9B • 约1小时前更新 • 2 • 2 (https://huggingface.co/CodeGoat24/WorldReward-qwen35-9b)
引用本文的数据集1
CodeGoat24/WorldReward-Bench 查看器 • 约1小时前更新 • 760 • 1 • 2 (https://huggingface.co/datasets/CodeGoat24/WorldReward-Bench)
引用本文的空间0
没有链接到本文的空间
在空间的 README.md 文件中引用 arxiv.org/abs/2609.03952,即可从本页面链接到它。
包含本文的收藏夹1
相似文章
WorldCycle:面向长视界视频世界模型的自验证强化学习
WorldCycle提出了一种面向长视界视频世界模型的自验证强化学习方法,利用可逆动作循环作为免费监督,将状态回归漂移降低最多44%,并将复合动作准确率提升近4倍。它还引入了CycleBench,以评估作为模拟器的世界模型。
奖励作为具身世界模型的智能体
本文介绍了奖励作为智能体(Reward as an Agent)和DynDiff-GRPO,以解决具身世界模型中强化学习的奖励黑客攻击和有限探索问题,实现了显著的准确率提升。
WCM:一种用于视觉-语言-行动强化学习的世界评论模型
介绍了WCM,一种世界评论模型,它联合预测未来的潜在状态并估计价值,以改进视觉-语言-行动强化学习的时间建模,在多个机器人操作基准上取得了最先进的结果。
WorldExam:从表观外观到内在反应性的世界模型基准评测
WorldExam 是一个新的分层基准,用于评估可控视频生成中的世界模型,涵盖视觉质量、控制遵循、空间一致性和世界反应性。对20个模型的测试表明,高视觉质量和指令完成并不保证内在反应性。
Wonder:更优的视频世界模型
Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。