从预训练到精通:最小化人工干预的现实世界子任务强化学习用于长期操作任务
摘要
本文提出PARTS,一个现实世界子任务强化学习框架,通过专注于瓶颈子任务并最小化人工干预来提升长期操作任务,在实验中实现了更高的成功率。
查看缓存全文
缓存时间: 2026/09/21 19:22
论文页面 - 从预训练到精通:以最小人类干预实现长时域操控任务的真实世界子任务强化学习
来源:https://huggingface.co/papers/2609.21788
摘要
一个预训练的机器人基础策略可能完成大部分长时域任务,却会在少数关键子任务上反复失败。为收集额外的完整任务示范以进行监督微调,需要操作员重复执行策略已能良好完成的行为。强化学习微调为弥合这一差距提供了有前景的路径,但现有方法在仅使用稀疏奖励求解长时域任务时仍面临挑战。我们提出 PARTS(针对目标子任务的强化学习策略适应),这是一种真实世界子任务强化学习框架。该框架将练习集中于这些瓶颈子任务,同时允许训练回合在最小人类干预下进行。冻结的预训练策略在整个执行过程中提供名义动作,而代理生成的选择器和成功验证器则激活残差修正并提供局部结果奖励。这些奖励支持从成功的子任务中学习,即使完整任务的成功案例稀少。训练结合在线强化学习与成功加权重训练,每个重训练的残差策略都会重新部署以收集更多经验。人类在设置阶段识别瓶颈,并在需要时执行物理重置。在双手 YAM 任务和单臂 Franka 任务上,PARTS 分别将完整任务成功率从 32% 提升至 61%、从 50% 提升至 95%,平均每任务仅需数十分钟真实世界强化学习回合。与现有真实世界强化学习微调方法相比,在相同的机器人回合预算下,PARTS 将完整任务成功率提升了 25% 以上,同时需要更少的人类参与。
查看 arXiv 页面 (https://arxiv.org/abs/2609.21788) 查看 PDF (https://arxiv.org/pdf/2609.21788) 项目页面 (https://destiny000621.github.io/PARTS/) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.21788)
通过您的代理获取此论文:
hf papers read 2609\.21788
尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.21788 即可从本页链接到该模型。
引用此论文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.21788 即可从本页链接到该数据集。
引用此论文的 Space 0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.21788 即可从本页链接到该 Space。
包含此论文的收藏 0
无收藏包含此论文
将此论文添加至收藏 (https://huggingface.co/new-collection) 以从本页链接到它。
相似文章
面向长时程工具使用智能体任务的高效强化学习
本文介绍了 SinkFlex-RL,一个用于长时程工具使用智能体任务中内存可行的强化学习的模块化训练系统。它结合了兼容 Gymnasium 的环境封装、基于 GRPO 的策略优化,以及 sink 感知的 FlexAttention 路径,在 4096 个 token 时峰值显存降低 19.7%,并能在 eager attention 内存溢出的情况下支持 8192 个 token 的运行。
ContextPilot: 通过细粒度强化学习训练智能体进行主动上下文管理
ContextPilot引入了一个用于长期智能体推理的主动上下文管理框架,通过细粒度强化学习结合分支采样来提升在维持紧凑工作上下文方面的性能和效率。
将任务专业知识融入强化学习,实现在text-to-SQL上的最佳性能(18分钟阅读)
本文描述了一种带有可验证奖励的强化学习方法,用于微调AI模型以进行text-to-SQL任务,在BIRD基准上达到了无需辅助结构的人类水平准确率。
GoLongRL:面向能力的长上下文强化学习与多任务对齐
GoLongRL 提出了一种开源方法,通过面向能力的数据构建和 TMN-Reweight 方法,实现具有多样化奖励优化的长上下文强化学习。
GE-Act 2.0: 用于机器人操作的预训练与扩展世界-动作模型
本文介绍了GE-Act 2.0,这是一个从头预训练的世界-动作模型,旨在实现可扩展的零样本机器人操作,提升在多样化任务和条件下的成功率。