WCM:一种用于视觉-语言-行动强化学习的世界评论模型
摘要
介绍了WCM,一种世界评论模型,它联合预测未来的潜在状态并估计价值,以改进视觉-语言-行动强化学习的时间建模,在多个机器人操作基准上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/08/04 05:37
论文页面 - WCM:一种用于视觉-语言-动作强化学习的世界评论模型
来源:https://huggingface.co/papers/2607.29613
摘要
强化学习(RL)后训练视觉-语言-动作(VLA)模型在机器人操作方面展现出巨大潜力。在RL方法中,基于评论家的方法依赖于一个价值估计器,该估计器主要基于单帧观测或单帧VLM骨干网络潜在变量进行运算,这与机器人控制的部分可观测性本质存在根本性不匹配。一种将观测历史纳入评论家的朴素方法会在高维视觉空间中产生指数级复杂度,并且仍然失败,因为纯标量回报回归无法为学习跨时间动态提供足够的监督。我们将根本原因识别为状态近似问题:如果没有明确的世界建模目标,评论家的表示无法捕捉准确价值估计所需的时间结构。为解决这一问题,我们提出了世界评论模型(WCM),构建在轻量级LeJEPA架构之上;WCM联合预测未来潜在状态并估计价值,从而显式地训练评论家的表示以捕捉时间动态,而不仅仅是回归标量回报。WCM无缝集成到在策略和离策略训练流程中,并与包括Pi0、Pi0.5和OpenVLA-OFT在内的最先进VLA骨干网络兼容。在四个基准测试的149个任务上进行的大量实验表明,WCM在分布内和分布外设置中均持续达到最先进性能,尤其在泛化提升方面表现突出。我们进一步使用OpenVLA-OFT和Pi0.5通过离策略RL在七个真实世界操作任务上验证了WCM,确认了在不同场景中的稳定部署。
查看 arXiv 页面查看 PDF项目页面GitHub11添加到收藏
在您的智能体中获取此论文:
hf papers read 2607\.29613
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.29613 以从此页面链接到它。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.29613 以从此页面链接到它。
引用此论文的Space0
没有Space链接到此论文
在Space README.md 中引用 arxiv.org/abs/2607.29613 以从此页面链接到它。
包含此论文的收藏集0
没有收藏集包含此论文
将该论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接到它。
相似文章
World-Language-Action模型:统一世界建模、语言推理与动作合成
本文介绍了World-Language-Action(WLA)模型,这是一种具身基础模型,能够从文本、图像和机器人状态中联合预测文本子任务、子目标图像和机器人动作,在模拟和真实环境中实现了最先进的多任务与长周期学习能力。
通过残差潜在动作学习基于视觉特征的世界模型
本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。
WorldCycle:面向长视界视频世界模型的自验证强化学习
WorldCycle提出了一种面向长视界视频世界模型的自验证强化学习方法,利用可逆动作循环作为免费监督,将状态回归漂移降低最多44%,并将复合动作准确率提升近4倍。它还引入了CycleBench,以评估作为模拟器的世界模型。
World Pilot: 使用世界动作先验引导视觉-语言-动作模型
World Pilot 通过融入来自世界动作模型的动态场景演变和轨迹先验来增强视觉-语言-动作模型,在操作任务上实现了最先进的零样本性能。
面向机器人控制的上下文世界建模
本文介绍了上下文世界建模(ICWM),这是一个使机器人策略能够从自身生成的交互中推断系统变量的框架,通过将系统识别视为一个上下文自适应问题,无需参数更新即可适应新的配置。在模拟和真实世界实验中,它在处理新的相机视角时优于标准的VLA基线。