RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放

Hugging Face Daily Papers 论文

摘要

本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。

尽管视觉-语言-动作(VLA)模型展现出令人瞩目的视觉运动能力,但它们在具有挑战性和域外任务上的性能往往会退化。近期的测试时引导和缩放方法无需大量数据收集和重新训练即可提升性能,但动作样本往往仍集中在相似行为附近,因此继承了相关的失败模式。此外,现有方法在每个时间步都采用相同的干预策略,而不考虑基础策略是否已有可能成功。为了解决这些局限性,我们提出了RL^2,一种利用VLA潜在表示上的强化学习的自适应推理时引导框架。首先,我们训练一个轻量级离线强化学习策略,该策略以从VLA动作专家中提取的表达性潜在表示为条件,并在推理期间将其流速度与冻结的VLA的流速度组合。这种组合引导策略将大规模模仿学习的行为先验与离线强化学习所带来的、超越主导演示模式的动作多样性相结合。我们进一步发现,推理时引导在成功和失败状态下遵循根本不同的缩放定律,这揭示出动作多样性在基础VLA可能失败时最为有益,而在可能成功时却会不必要地扰动已经准确的动作。基于这一发现,RL^2仅在预测到失败时激活组合引导。在SIMPLER和PolaRiS基准上,RL^2在域外设置中将成功率提升了高达+17.3%,同时消融研究和缩放研究证明了潜在表示和RL训练的重要性。最后,真实世界实验表明,这些收益能够迁移到仿真环境之外,使RL^2成为适用于VLA部署的实用且模块化的引导框架。
查看原文
查看缓存全文

缓存时间: 2026/08/03 13:32

论文页面 - RL^2-VLA: 面向视觉-语言-动作模型的自适应RL潜在组合引导与测试时扩展

来源:https://huggingface.co/papers/2607.26991

摘要

尽管视觉-语言-动作(VLA)模型带来了令人印象深刻的视觉运动能力,但在具有挑战性和分布外任务上,其性能往往会下降。最近的测试时引导和扩展方法无需大规模数据收集和重新训练即可提升性能,但动作样本往往集中在相似的行为附近,因此继承了相关的失败模式。此外,现有方法在每个时间步都采用相同的干预策略,而不考虑基础策略是否已经很可能成功。为解决这些局限性,我们引入了RL^2,一种自适应的推理时引导框架,利用VLA潜在空间上的强化学习(RL)。首先,我们训练一个轻量级离线RL策略,以VLA动作专家提取的表达性潜在特征为条件,并在推理时将其流速度与冻结VLA的速度组合。这种组合引导策略将大规模模仿学习的行为先验与离线RL在主要示范模式之外引入的动作多样性相结合。我们进一步发现,推理时引导在成功和失败状态下遵循根本不同的缩放定律,表明当基础VLA可能失败时,动作多样性最有益,但当成功可能性较高时,可能不必要地扰动已经准确的动作。基于这一洞见,RL^2仅在预测到失败时激活组合引导。在SIMPLER和PolaRiS基准上,RL^2在分布外设置中将成功率提升最高达+17.3%,而消融和扩展研究证明了潜在表示和RL训练的重要性。最后,真实世界实验表明这些收益可迁移到仿真之外,使RL^2成为VLA部署中实用且模块化的引导框架。

查看arXiv页面 (https://arxiv.org/abs/2607.26991)查看PDF (https://arxiv.org/pdf/2607.26991)项目页面 (https://rl2-vla.github.io/)GitHub8 (https://github.com/marmotlab/RL2-VLA)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.26991)

在您的智能体中获取此论文:

hf papers read 2607\.26991

还没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型1

rl2-vla/rl2-vla-qam-bridge 更新于约20小时前 (https://huggingface.co/rl2-vla/rl2-vla-qam-bridge)

引用此论文的数据集0

没有关联此论文的数据集

在数据集README.md中引用arxiv.org/abs/2607.26991即可从此页面关联它。

引用此论文的Spaces0

没有关联此论文的Space

在Space的README.md中引用arxiv.org/abs/2607.26991即可从此页面关联它。

收录此论文的Collections0

没有包含此论文的Collection

将此论文添加到collection (https://huggingface.co/new-collection)中即可从此页面关联它。

相似文章

视觉-语言-动作模型中的闭环神经激活控制

arXiv cs.AI

提出CTRL-STEER,一种闭环框架,通过时变控制信号对视觉-语言-动作模型进行自适应引导,在无需重新训练的情况下,实现了概念调节与任务成功率之间的更好权衡。