StructRL: 长周期视觉-语言-动作任务的在线结构化强化学习

Hugging Face Daily Papers 论文

摘要

StructRL 引入了一个在线强化学习框架,该框架使用来自可验证子任务的结构化中间奖励,以增强长周期视觉-语言-动作任务,在 RoboCasa365 和 LIBERO-Long 等基准测试中展示了卓越性能。

视觉-语言-动作 (VLA) 模型在短周期操作任务中表现良好,但在需要从单个命令执行多个依赖操作的长周期任务中仍然面临挑战。在线强化学习 (RL) 可以通过环境交互来改进这些策略,但许多现有方法仅在任务完全成功后提供奖励。然而,这种终端监督是稀疏的,无法区分早期失败和取得显著部分进展的轮次。我们提出 StructRL,一个在线 RL 框架,它从可验证子任务完成中构建结构化中间监督。StructRL 将每个任务分解为可验证子任务,仅在前置子任务完成后才授予中间奖励,并根据完成进度调整每个奖励。在 RoboCasa365 和 LIBERO-Long 上,使用 GR00T-N1.5 和 pi 0.5,StructRL 持续优于评估的在线 RL 基线。这些结果表明,可验证的结构化中间奖励改善了长周期 VLA 的后训练。代码可在 https://github.com/amazon-science/StructRL 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/30 08:19

论文页面 - StructRL:面向长时视觉-语言-动作任务的在线结构化强化学习

来源:https://huggingface.co/papers/2609.36352

摘要

视觉-语言-动作(VLA)模型在较短时程的操控任务中表现良好,但在需要从单一指令执行多个连续依赖操控的长时程任务中仍面临挑战。在线强化学习(RL)可以通过环境交互改进策略,但现有方法大多仅在整个任务成功完成后提供奖励。然而,这种终端监督信号稀疏,无法区分早期失败与已取得实质性部分进展的任务执行过程。我们提出StructRL,一个通过可验证的子任务完成情况构建结构化中间监督信号的在线强化学习框架。StructRL将每个任务分解为可验证的子任务,仅在前置子任务完成后才给予中间奖励,并根据完成进度调整奖励尺度。在RoboCasa365和LIBERO-Long数据集上使用GR00T-N1.5与pi0.5模型进行评估时,StructRL持续优于所测试的在线RL基线方法。这些结果表明,可验证的结构化中间奖励能够有效提升长时程VLA模型的后训练效果。代码已开源:https://github.com/amazon-science/StructRL

查看arXiv页面 (https://arxiv.org/abs/2609.36352) 查看PDF (https://arxiv.org/pdf/2609.36352) 项目主页 (https://amazon-science.github.io/StructRL) GitHub1 (https://github.com/amazon-science/StructRL) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.36352)

在您的代理中获取此论文:

hf papers read 2609.36352

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型链接此论文

在模型README.md中引用 arxiv.org/abs/2609.36352 以从本页链接。

引用此论文的数据集0

暂无数据集链接此论文

在数据集README.md中引用 arxiv.org/abs/2609.36352 以从本页链接。

引用此论文的Spaces0

暂无Space链接此论文

在Space README.md中引用 arxiv.org/abs/2609.36352 以从本页链接。

包含此论文的收藏集0

暂无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

从 RLVR 到 RLSVR(GitHub 仓库)

TLDR AI

介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。

OpenWebRL:揭秘面向视觉网页代理的在线多轮强化学习

Hugging Face Daily Papers

OpenWebRL提出了一个开放框架,用于在真实网站上利用在线多轮强化学习训练视觉网页代理,以极少的初始监督实现了最先进的性能。其4B参数模型优于先前的开放代理,并与OpenAI CUA和Gemini CUA等专有系统竞争。