WCM:一种用于视觉-语言-行动强化学习的世界评论模型
摘要
介绍了WCM,一种世界评论模型,它联合预测未来的潜在状态并估计价值,以改进视觉-语言-行动强化学习的时间建模,在多个机器人操作基准上取得了最先进的结果。
查看缓存全文
缓存时间: 2026/08/04 05:37
论文页面 - WCM:一种用于视觉-语言-动作强化学习的世界评论模型
来源:https://huggingface.co/papers/2607.29613
摘要
强化学习(RL)后训练视觉-语言-动作(VLA)模型在机器人操作方面展现出巨大潜力。在RL方法中,基于评论家的方法依赖于一个价值估计器,该估计器主要基于单帧观测或单帧VLM骨干网络潜在变量进行运算,这与机器人控制的部分可观测性本质存在根本性不匹配。一种将观测历史纳入评论家的朴素方法会在高维视觉空间中产生指数级复杂度,并且仍然失败,因为纯标量回报回归无法为学习跨时间动态提供足够的监督。我们将根本原因识别为状态近似问题:如果没有明确的世界建模目标,评论家的表示无法捕捉准确价值估计所需的时间结构。为解决这一问题,我们提出了世界评论模型(WCM),构建在轻量级LeJEPA架构之上;WCM联合预测未来潜在状态并估计价值,从而显式地训练评论家的表示以捕捉时间动态,而不仅仅是回归标量回报。WCM无缝集成到在策略和离策略训练流程中,并与包括Pi0、Pi0.5和OpenVLA-OFT在内的最先进VLA骨干网络兼容。在四个基准测试的149个任务上进行的大量实验表明,WCM在分布内和分布外设置中均持续达到最先进性能,尤其在泛化提升方面表现突出。我们进一步使用OpenVLA-OFT和Pi0.5通过离策略RL在七个真实世界操作任务上验证了WCM,确认了在不同场景中的稳定部署。
查看 arXiv 页面查看 PDF项目页面GitHub11添加到收藏
在您的智能体中获取此论文:
hf papers read 2607\.29613
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2607.29613 以从此页面链接到它。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.29613 以从此页面链接到它。
引用此论文的Space0
没有Space链接到此论文
在Space README.md 中引用 arxiv.org/abs/2607.29613 以从此页面链接到它。
包含此论文的收藏集0
没有收藏集包含此论文
将该论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接到它。
相似文章
World Action Agent:通过世界动作预演利用VLMs进行机器人操作
本文提出了World Action Agent(WAA),一个多智能体系统,利用视觉语言模型(VLMs)通过具有接触视图、动作预演和视图内校正的视觉动作工作空间进行机器人操作,在基准测试中取得了最先进的结果。
使用潜空间世界模型预测后果并强化导航策略
本文提出了一种用于机器人导航的潜空间世界模型(LWM),该模型预测基于动作条件的潜特征兼容性,使得能够从无标签视频数据中学习策略,并通过无需额外环境交互的强化学习来提升性能,优于现有方法。
World-Language-Action模型:统一世界建模、语言推理与动作合成
本文介绍了World-Language-Action(WLA)模型,这是一种具身基础模型,能够从文本、图像和机器人状态中联合预测文本子任务、子目标图像和机器人动作,在模拟和真实环境中实现了最先进的多任务与长周期学习能力。
通过残差潜在动作学习基于视觉特征的世界模型
本文介绍了 RLA-WM,一种基于视觉特征的世界模型,该模型利用残差潜在动作与流匹配技术高效预测未来视觉状态。该方法性能优于现有的视频扩散与特征基方法,同时支持从离线、无动作演示视频中探索新型机器人学习技术。
WorldReward: 针对相机条件化世界模型的奖励建模
WorldReward 介绍了一种针对相机条件化世界模型的视觉语言奖励模型,通过分块分解和偏好聚合统一了动作一致性和视觉质量评估,在基准测试中优于现有方法如GPT-5.5。