从预训练到精通:最小化人工干预的现实世界子任务强化学习用于长期操作任务

Hugging Face Daily Papers 论文

摘要

本文提出PARTS,一个现实世界子任务强化学习框架,通过专注于瓶颈子任务并最小化人工干预来提升长期操作任务,在实验中实现了更高的成功率。

一个预训练的机器人基础策略可能执行大部分长期任务,但在少数关键子任务上反复失败。为监督微调(SFT)收集额外的全任务演示需要操作员重复策略已经执行良好的行为。强化学习(RL)微调提供了一个有前景的途径来弥合这一差距,但现有方法在仅使用稀疏奖励时难以解决长期任务。我们提出PARTS(基于目标子任务的强化学习策略适应),一个现实世界子任务强化学习框架,专注于这些瓶颈的同时,允许训练展开以最小化人工干预。冻结的预训练策略在整个执行过程中提供名义动作,而代理生成的选择器和成功验证器激活残差校正并提供局部结果奖励。这些奖励支持从成功的子任务中学习,即使完整任务的成功很少见。训练将在线强化学习与成功重加权重训相结合,并且每个重训的残差策略被重新部署以收集更多经验。人类在设置期间识别瓶颈,并在需要时进行物理重置。在双臂YAM和单臂Franka任务上,PARTS分别将完整任务成功率从32%提升到61%和从50%提升到95%,平均每任务使用数十分钟的现实世界强化学习展开。与现有的现实世界强化学习微调方法相比,PARTS在相同的机器人展开预算下将全任务成功率提高了25%以上,同时需要更少的人工干预。
查看原文
查看缓存全文

缓存时间: 2026/09/21 19:22

论文页面 - 从预训练到精通:以最小人类干预实现长时域操控任务的真实世界子任务强化学习

来源:https://huggingface.co/papers/2609.21788

摘要

一个预训练的机器人基础策略可能完成大部分长时域任务,却会在少数关键子任务上反复失败。为收集额外的完整任务示范以进行监督微调,需要操作员重复执行策略已能良好完成的行为。强化学习微调为弥合这一差距提供了有前景的路径,但现有方法在仅使用稀疏奖励求解长时域任务时仍面临挑战。我们提出 PARTS(针对目标子任务的强化学习策略适应),这是一种真实世界子任务强化学习框架。该框架将练习集中于这些瓶颈子任务,同时允许训练回合在最小人类干预下进行。冻结的预训练策略在整个执行过程中提供名义动作,而代理生成的选择器和成功验证器则激活残差修正并提供局部结果奖励。这些奖励支持从成功的子任务中学习,即使完整任务的成功案例稀少。训练结合在线强化学习与成功加权重训练,每个重训练的残差策略都会重新部署以收集更多经验。人类在设置阶段识别瓶颈,并在需要时执行物理重置。在双手 YAM 任务和单臂 Franka 任务上,PARTS 分别将完整任务成功率从 32% 提升至 61%、从 50% 提升至 95%,平均每任务仅需数十分钟真实世界强化学习回合。与现有真实世界强化学习微调方法相比,在相同的机器人回合预算下,PARTS 将完整任务成功率提升了 25% 以上,同时需要更少的人类参与。

查看 arXiv 页面 (https://arxiv.org/abs/2609.21788) 查看 PDF (https://arxiv.org/pdf/2609.21788) 项目页面 (https://destiny000621.github.io/PARTS/) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.21788)

通过您的代理获取此论文:

hf papers read 2609\.21788

尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.21788 即可从本页链接到该模型。

引用此论文的数据集 0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.21788 即可从本页链接到该数据集。

引用此论文的 Space 0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2609.21788 即可从本页链接到该 Space。

包含此论文的收藏 0

无收藏包含此论文

将此论文添加至收藏 (https://huggingface.co/new-collection) 以从本页链接到它。

相似文章

面向长时程工具使用智能体任务的高效强化学习

arXiv cs.LG

本文介绍了 SinkFlex-RL,一个用于长时程工具使用智能体任务中内存可行的强化学习的模块化训练系统。它结合了兼容 Gymnasium 的环境封装、基于 GRPO 的策略优化,以及 sink 感知的 FlexAttention 路径,在 4096 个 token 时峰值显存降低 19.7%,并能在 eager attention 内存溢出的情况下支持 8192 个 token 的运行。