RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放
摘要
本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。
查看缓存全文
缓存时间: 2026/08/03 13:32
论文页面 - RL^2-VLA: 面向视觉-语言-动作模型的自适应RL潜在组合引导与测试时扩展
来源:https://huggingface.co/papers/2607.26991
摘要
尽管视觉-语言-动作(VLA)模型带来了令人印象深刻的视觉运动能力,但在具有挑战性和分布外任务上,其性能往往会下降。最近的测试时引导和扩展方法无需大规模数据收集和重新训练即可提升性能,但动作样本往往集中在相似的行为附近,因此继承了相关的失败模式。此外,现有方法在每个时间步都采用相同的干预策略,而不考虑基础策略是否已经很可能成功。为解决这些局限性,我们引入了RL^2,一种自适应的推理时引导框架,利用VLA潜在空间上的强化学习(RL)。首先,我们训练一个轻量级离线RL策略,以VLA动作专家提取的表达性潜在特征为条件,并在推理时将其流速度与冻结VLA的速度组合。这种组合引导策略将大规模模仿学习的行为先验与离线RL在主要示范模式之外引入的动作多样性相结合。我们进一步发现,推理时引导在成功和失败状态下遵循根本不同的缩放定律,表明当基础VLA可能失败时,动作多样性最有益,但当成功可能性较高时,可能不必要地扰动已经准确的动作。基于这一洞见,RL^2仅在预测到失败时激活组合引导。在SIMPLER和PolaRiS基准上,RL^2在分布外设置中将成功率提升最高达+17.3%,而消融和扩展研究证明了潜在表示和RL训练的重要性。最后,真实世界实验表明这些收益可迁移到仿真之外,使RL^2成为VLA部署中实用且模块化的引导框架。
查看arXiv页面 (https://arxiv.org/abs/2607.26991)查看PDF (https://arxiv.org/pdf/2607.26991)项目页面 (https://rl2-vla.github.io/)GitHub8 (https://github.com/marmotlab/RL2-VLA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26991)
在您的智能体中获取此论文:
hf papers read 2607\.26991
还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型1
rl2-vla/rl2-vla-qam-bridge 更新于约20小时前 (https://huggingface.co/rl2-vla/rl2-vla-qam-bridge)
引用此论文的数据集0
没有关联此论文的数据集
在数据集README.md中引用arxiv.org/abs/2607.26991即可从此页面关联它。
引用此论文的Spaces0
没有关联此论文的Space
在Space的README.md中引用arxiv.org/abs/2607.26991即可从此页面关联它。
收录此论文的Collections0
没有包含此论文的Collection
将此论文添加到collection (https://huggingface.co/new-collection)中即可从此页面关联它。
相似文章
碰撞前的预见:基于冻结视觉语言模型的预测性安全强化学习
本文提出VLM-Safe-RL框架,该框架将冻结的视觉语言模型集成到约束MDP的拉格朗日更新中,为高速视觉控制任务的安全强化学习提供预测性成本信号。该方法在Safety-Gymnasium FormulaOne L2上优于标准约束感知基线,并能泛化到未见过的环境。
视觉-语言-动作模型中的闭环神经激活控制
提出CTRL-STEER,一种闭环框架,通过时变控制信号对视觉-语言-动作模型进行自适应引导,在无需重新训练的情况下,实现了概念调节与任务成功率之间的更好权衡。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。
D-VLA: 面向视觉-语言-动作模型的高并发分布式异步强化学习框架
D-VLA 提出了一种高并发分布式异步强化学习框架,用于视觉-语言-动作模型,采用平面解耦和泳道管线提升大规模具身智能训练中的吞吐量和效率。
小型RL控制器与大型语言模型:RL引导的测试时自适应采样
本文将大型语言模型的自适应采样建模为马尔可夫决策过程,并训练一个轻量级强化学习控制器来平衡正确性、延迟和计算成本,从而实现了更好的权衡。