StructRL: 长周期视觉-语言-动作任务的在线结构化强化学习
摘要
StructRL 引入了一个在线强化学习框架,该框架使用来自可验证子任务的结构化中间奖励,以增强长周期视觉-语言-动作任务,在 RoboCasa365 和 LIBERO-Long 等基准测试中展示了卓越性能。
查看缓存全文
缓存时间: 2026/09/30 08:19
论文页面 - StructRL:面向长时视觉-语言-动作任务的在线结构化强化学习
来源:https://huggingface.co/papers/2609.36352
摘要
视觉-语言-动作(VLA)模型在较短时程的操控任务中表现良好,但在需要从单一指令执行多个连续依赖操控的长时程任务中仍面临挑战。在线强化学习(RL)可以通过环境交互改进策略,但现有方法大多仅在整个任务成功完成后提供奖励。然而,这种终端监督信号稀疏,无法区分早期失败与已取得实质性部分进展的任务执行过程。我们提出StructRL,一个通过可验证的子任务完成情况构建结构化中间监督信号的在线强化学习框架。StructRL将每个任务分解为可验证的子任务,仅在前置子任务完成后才给予中间奖励,并根据完成进度调整奖励尺度。在RoboCasa365和LIBERO-Long数据集上使用GR00T-N1.5与pi0.5模型进行评估时,StructRL持续优于所测试的在线RL基线方法。这些结果表明,可验证的结构化中间奖励能够有效提升长时程VLA模型的后训练效果。代码已开源:https://github.com/amazon-science/StructRL
查看arXiv页面 (https://arxiv.org/abs/2609.36352) 查看PDF (https://arxiv.org/pdf/2609.36352) 项目主页 (https://amazon-science.github.io/StructRL) GitHub1 (https://github.com/amazon-science/StructRL) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.36352)
在您的代理中获取此论文:
hf papers read 2609.36352
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型链接此论文
在模型README.md中引用 arxiv.org/abs/2609.36352 以从本页链接。
引用此论文的数据集0
暂无数据集链接此论文
在数据集README.md中引用 arxiv.org/abs/2609.36352 以从本页链接。
引用此论文的Spaces0
暂无Space链接此论文
在Space README.md中引用 arxiv.org/abs/2609.36352 以从本页链接。
包含此论文的收藏集0
暂无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接。
相似文章
RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放
本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。
从 RLVR 到 RLSVR(GitHub 仓库)
介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。
SocialRL:通过多轮强化学习和奖励设计提升大语言模型的社会智能
本文介绍了SocialRL,一个多轮强化学习框架,通过延迟奖励传播和细粒度过程奖励增强大语言模型的社会智能,显著改善了对话系统的目标完成度。
@askalphaxiv: “实时视觉-语言-动作策略的强化学习” VLA 模型通常对实时机器人控制来说太慢...
本文介绍了一种方法,将视觉-语言-动作模型中的动作生成分离为慢层和快层,从而实现实时反应式机器人控制,并将成功率从42%提高到97%,仅需10分钟的在线数据。
OpenWebRL:揭秘面向视觉网页代理的在线多轮强化学习
OpenWebRL提出了一个开放框架,用于在真实网站上利用在线多轮强化学习训练视觉网页代理,以极少的初始监督实现了最先进的性能。其4B参数模型优于先前的开放代理,并与OpenAI CUA和Gemini CUA等专有系统竞争。