WCM:一种用于视觉-语言-行动强化学习的世界评论模型

Hugging Face Daily Papers 论文

摘要

介绍了WCM,一种世界评论模型,它联合预测未来的潜在状态并估计价值,以改进视觉-语言-行动强化学习的时间建模,在多个机器人操作基准上取得了最先进的结果。

视觉-语言-行动(VLA)模型的强化学习(RL)后训练已在机器人操作领域展现出巨大的潜力。在RL方法中,基于评论家的方法依赖于主要在单帧观测或单帧VLM骨干网络潜变量上运行的价值估计器,这与机器人控制的部分可观测性本质存在根本性错配。将观测历史纳入评论家的一种朴素方法会在高维视觉空间中产生指数级复杂度,并且仍然失败,因为纯标量回报回归无法为学习跨时间动态提供足够的监督。我们将根本原因识别为状态近似问题:没有显式的世界建模目标,评论家的表示无法捕获准确价值估计所需的时间结构。为了解决这个问题,我们提出了基于轻量级LeJEPA架构的世界评论模型(WCM);WCM联合预测未来潜在状态并估计价值,从而使评论家的表示被显式训练以捕获时间动态,而不仅仅是回归标量回报。WCM可以无缝集成到在线策略和离线策略训练流程中,并与包括Pi0、Pi0.5和OpenVLA-OFT在内的最先进VLA骨干网络兼容。在四个基准的149个任务上进行的大量实验表明,WCM在分布内和分布外设置中都始终实现了最先进的性能,尤其是在泛化方面取得了显著提升。我们进一步使用OpenVLA-OFT和Pi0.5以及离线策略RL,在七个真实世界操作任务上验证了WCM,证实了其在多种设置下的稳定部署。
查看原文
查看缓存全文

缓存时间: 2026/08/04 05:37

论文页面 - WCM:一种用于视觉-语言-动作强化学习的世界评论模型

来源:https://huggingface.co/papers/2607.29613

摘要

强化学习(RL)后训练视觉-语言-动作(VLA)模型在机器人操作方面展现出巨大潜力。在RL方法中,基于评论家的方法依赖于一个价值估计器,该估计器主要基于单帧观测或单帧VLM骨干网络潜在变量进行运算,这与机器人控制的部分可观测性本质存在根本性不匹配。一种将观测历史纳入评论家的朴素方法会在高维视觉空间中产生指数级复杂度,并且仍然失败,因为纯标量回报回归无法为学习跨时间动态提供足够的监督。我们将根本原因识别为状态近似问题:如果没有明确的世界建模目标,评论家的表示无法捕捉准确价值估计所需的时间结构。为解决这一问题,我们提出了世界评论模型(WCM),构建在轻量级LeJEPA架构之上;WCM联合预测未来潜在状态并估计价值,从而显式地训练评论家的表示以捕捉时间动态,而不仅仅是回归标量回报。WCM无缝集成到在策略和离策略训练流程中,并与包括Pi0、Pi0.5和OpenVLA-OFT在内的最先进VLA骨干网络兼容。在四个基准测试的149个任务上进行的大量实验表明,WCM在分布内和分布外设置中均持续达到最先进性能,尤其在泛化提升方面表现突出。我们进一步使用OpenVLA-OFT和Pi0.5通过离策略RL在七个真实世界操作任务上验证了WCM,确认了在不同场景中的稳定部署。

查看 arXiv 页面查看 PDF项目页面GitHub11添加到收藏

在您的智能体中获取此论文:

hf papers read 2607\.29613

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2607.29613 以从此页面链接到它。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.29613 以从此页面链接到它。

引用此论文的Space0

没有Space链接到此论文

在Space README.md 中引用 arxiv.org/abs/2607.29613 以从此页面链接到它。

包含此论文的收藏集0

没有收藏集包含此论文

将该论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接到它。

相似文章

通过残差潜在动作学习基于视觉特征的世界模型

Hugging Face Daily Papers

本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。

WorldCycle:面向长视界视频世界模型的自验证强化学习

Hugging Face Daily Papers

WorldCycle提出了一种面向长视界视频世界模型的自验证强化学习方法,利用可逆动作循环作为免费监督,将状态回归漂移降低最多44%,并将复合动作准确率提升近4倍。它还引入了CycleBench,以评估作为模拟器的世界模型。

面向机器人控制的上下文世界建模

Hugging Face Daily Papers

本文介绍了上下文世界建模(ICWM),这是一个使机器人策略能够从自身生成的交互中推断系统变量的框架,通过将系统识别视为一个上下文自适应问题,无需参数更新即可适应新的配置。在模拟和真实世界实验中,它在处理新的相机视角时优于标准的VLA基线。