WorldCycle:面向长视界视频世界模型的自验证强化学习

Hugging Face Daily Papers 论文

摘要

WorldCycle提出了一种面向长视界视频世界模型的自验证强化学习方法,利用可逆动作循环作为免费监督,将状态回归漂移降低最多44%,并将复合动作准确率提升近4倍。它还引入了CycleBench,以评估作为模拟器的世界模型。

交互式视频世界模型对于长视界规划和探索至关重要,但存在累积误差。强化学习(RL)等后训练方法可以改进这些模型,但遇到了验证瓶颈:对于任意动作序列,不存在可用于衡量长期漂移的真值未来状态。我们的关键洞察在于,可逆动作循环使这种验证成为可能:一个序列与其逆序列组合后,在解析上必须回到初始状态,从而为长视界正确性提供无需标注的监督。基于此,我们提出了WorldCycle,一个自验证的强化学习框架,它从普通动作序列中构造闭合动作循环及其重复执行,并优化两种互补的奖励:空间闭合奖励(强制镜像的前向和后向片段之间的对称性)和时间一致性奖励(在重复循环执行中对齐状态)。这些奖励迫使模型将动作学习为一致的状态算子,而非记忆化的时间模式,并且能够自然地扩展到基础模型处理不佳的分布外复合动作循环。我们进一步发布了CycleBench,一个用于评估复杂动作结构下状态返回能力的诊断基准。WorldCycle将状态返回漂移降低了最多44%,并将复合动作准确率相较于基础模型提升近4倍,为基于物理的世界模型提供了重要基础。
查看原文
查看缓存全文

缓存时间: 2026/08/06 05:49

论文页 - WorldCycle: 面向长时程视频世界模型的自验证强化学习

来源:https://huggingface.co/papers/2608.04964 👋 作者在此——欢迎提出关于 WorldCycle 的问题!

TL;DR: 视频世界模型在逐帧层面上看起来很棒,但如果你让它向前再向后移动,它永远不会回到起点。我们将这种失败转化为免费的监督信号。WorldCycle 利用可逆动作循环作为自验证的强化学习信号——无需真实轨迹——将长时程状态返回漂移降低高达 44%,同时将复合动作准确率提升近 4倍

无人测量的难题 🔍

视频世界模型的后训练主要优化短时程的视觉质量或逐步动作对齐。但时程的真正瓶颈在于没有监督信号:对于任意动作序列,不存在真实未来状态来衡量累积误差。因此模型会漂移,而我们甚至无从察觉。

关键洞见 💡

物理学为我们免费提供了一个精确、无需标注的参考:**可逆动作循环必须回到其初始状态。**将相机向前再向后移动→你应该看到完全相同的视图。我们表明,强基线模型(WorldPlay, WorldCompass)在两个方面都未能通过这个最小检查:

  • 空间闭合失败 — 逆动作序列无法恢复起始视图。
  • 时间一致性失败相同动作在不同展开深度产生不同的位移。

这两种失败对于任何短时程奖励都是不可见的,并且它们会随着时程长度而复合累积。

方法 🛠️

我们将闭合动作程序转化为密集监督:

  • 空间闭合奖励 — 在循环的每个中间深度构建镜像帧对并比较它们,使每个片段成为独立可验证的闭合检查(而非稀疏的仅端点信号)。
  • 时间状态一致性奖励 — 重复循环并比较跨循环的对应索引帧,惩罚相同动作随时间的漂移。

这些共同迫使模型将动作学习为一致的状态算子,而不是记忆的时间模式——并且同样的目标扩展到复合动作(例如边移动边转弯),且无需真实视频。

CycleBench 📊

由于现有基准测试都没有诊断状态返回一致性,我们发布了 CycleBench:涵盖短/中/长时程设置的可逆、重复和复合循环——将视频世界模型作为模拟器来评估,而不仅仅是短时程生成器。

结果

  • 状态返回漂移降低高达 44%
  • 复合动作准确率比基线提升近 4倍(而基线本身在复合动作与简单动作上的准确率就出现了 5倍 的崩塌)。

相似文章

通过残差潜在动作学习基于视觉特征的世界模型

Hugging Face Daily Papers

本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。

MiniWorld:从零训练视频世界模型的民主化

Hugging Face Daily Papers

MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。

视频模型可通过可验证奖励进行推理

Hugging Face Daily Papers

VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。