WorldCycle:面向长视界视频世界模型的自验证强化学习
摘要
WorldCycle提出了一种面向长视界视频世界模型的自验证强化学习方法,利用可逆动作循环作为免费监督,将状态回归漂移降低最多44%,并将复合动作准确率提升近4倍。它还引入了CycleBench,以评估作为模拟器的世界模型。
查看缓存全文
缓存时间: 2026/08/06 05:49
论文页 - WorldCycle: 面向长时程视频世界模型的自验证强化学习
来源:https://huggingface.co/papers/2608.04964 👋 作者在此——欢迎提出关于 WorldCycle 的问题!
TL;DR: 视频世界模型在逐帧层面上看起来很棒,但如果你让它向前再向后移动,它永远不会回到起点。我们将这种失败转化为免费的监督信号。WorldCycle 利用可逆动作循环作为自验证的强化学习信号——无需真实轨迹——将长时程状态返回漂移降低高达 44%,同时将复合动作准确率提升近 4倍。
无人测量的难题 🔍
视频世界模型的后训练主要优化短时程的视觉质量或逐步动作对齐。但长时程的真正瓶颈在于没有监督信号:对于任意动作序列,不存在真实未来状态来衡量累积误差。因此模型会漂移,而我们甚至无从察觉。
关键洞见 💡
物理学为我们免费提供了一个精确、无需标注的参考:**可逆动作循环必须回到其初始状态。**将相机向前再向后移动→你应该看到完全相同的视图。我们表明,强基线模型(WorldPlay, WorldCompass)在两个方面都未能通过这个最小检查:
- 空间闭合失败 — 逆动作序列无法恢复起始视图。
- 时间一致性失败 — 相同动作在不同展开深度产生不同的位移。
这两种失败对于任何短时程奖励都是不可见的,并且它们会随着时程长度而复合累积。
方法 🛠️
我们将闭合动作程序转化为密集监督:
- 空间闭合奖励 — 在循环的每个中间深度构建镜像帧对并比较它们,使每个片段成为独立可验证的闭合检查(而非稀疏的仅端点信号)。
- 时间状态一致性奖励 — 重复循环并比较跨循环的对应索引帧,惩罚相同动作随时间的漂移。
这些共同迫使模型将动作学习为一致的状态算子,而不是记忆的时间模式——并且同样的目标扩展到复合动作(例如边移动边转弯),且无需真实视频。
CycleBench 📊
由于现有基准测试都没有诊断状态返回一致性,我们发布了 CycleBench:涵盖短/中/长时程设置的可逆、重复和复合循环——将视频世界模型作为模拟器来评估,而不仅仅是短时程生成器。
结果
- 状态返回漂移降低高达 44%。
- 复合动作准确率比基线提升近 4倍(而基线本身在复合动作与简单动作上的准确率就出现了 5倍 的崩塌)。
相似文章
世界模型自蒸馏:训练世界模型解决通用任务
一个可扩展的框架结合了自蒸馏和强化学习,将任务解决能力从视觉语言模型迁移到视频扩散模型,无需标注的任务-视频数据。
WCM:一种用于视觉-语言-行动强化学习的世界评论模型
介绍了WCM,一种世界评论模型,它联合预测未来的潜在状态并估计价值,以改进视觉-语言-行动强化学习的时间建模,在多个机器人操作基准上取得了最先进的结果。
通过残差潜在动作学习基于视觉特征的世界模型
本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。
MiniWorld:从零训练视频世界模型的民主化
MiniWorld 是一个可复现的框架,用于从零训练视频世界模型,采用带流匹配的块因果视频扩散变换器,能够实现高效的流式生成,并可在单台 8-GPU 服务器上数天内完成训练。
视频模型可通过可验证奖励进行推理
VideoRLVR利用基于规则的奖励的强化学习,优化视频扩散模型以进行可验证推理任务,在约束满足的视频生成中取得了优于监督方法的性能。