分层优势加权:面向稀疏回合结果的VLA在线强化学习微调
摘要
本文提出分层优势加权行为克隆(HABC),用于利用具有稀疏二进制回合结果的在线强化学习微调视觉-语言-动作(VLA)策略。HABC通过自适应评价器头和干预感知的信用分配将可行性和效率目标分离,显著提高了接触密集型双手操作任务的成功率。
查看缓存全文
缓存时间: 2026/06/16 11:31
Paper page - 面向VLA在线RL微调的层次化优势加权方法,基于稀疏回合结果
来源:https://huggingface.co/papers/2606.17043 发布于 6月15日
·
由 Siyuan (https://huggingface.co/SiyuanH) 于6月16日提交
摘要
Hierarchical Advantage-Weighted Behavior Cloning (HABC) 通过分别优化可行性目标和效率目标,采用自适应评判头与干预感知信用分配,解决了机器人学习中的稀疏奖励挑战,显著提升了高接触型操作任务的成功率。
当预训练的VLA策略通过在线RL (https://huggingface.co/papers?q=online%20RL) 进行微调时,每次轨迹展开仅产生一个二元结果(成功或失败),但策略更新 (https://huggingface.co/papers?q=actor%20update) 需要每个时间步的监督 (https://huggingface.co/papers?q=per-transition%20supervision)。现有方法通常将此稀疏结果 (https://huggingface.co/papers?q=sparse%20outcome) 简化为单个标量奖励 (https://huggingface.co/papers?q=scalar%20reward) 或优势信号 (https://huggingface.co/papers?q=advantage%20signal),这混淆了不同形式的逐时间步反馈,且在基本任务成功达到后提供的指导有限。首先,单一标量信号混淆了可行性 (https://huggingface.co/papers?q=viability) 和效率 (https://huggingface.co/papers?q=efficiency) 两个目标;一旦基本成功实现,二元标签无法提供梯度来区分高效完成与缓慢完成。其次,真实世界的轨迹展开混合了自主段和干预段;跨这些边界直接分配回合结果会导致错误的信用分配。为解决这些问题,我们提出了Hierarchical Advantage-Weighted Behavior Cloning (HABC),它在不同数据子集上为这两个目标训练独立的评判头 (https://huggingface.co/papers?q=critic%20heads),并通过状态自适应平衡 (https://huggingface.co/papers?q=state-adaptive%20balance) 组合其输出。状态自适应门控g_t融合它们的一步优势,当成功不确定时优先考虑可行性 (https://huggingface.co/papers?q=viability),仅在可行性 (https://huggingface.co/papers?q=viability) 高时转向效率 (https://huggingface.co/papers?q=efficiency),并将结果转换为策略损失的逐时间步权重。干预感知信用分配 (https://huggingface.co/papers?q=Intervention-aware%20credit%20assignment) 进一步将结果标签限制在当前策略执行的片段内,防止监督跨越干预边界泄漏。在三个高接触型双手操作任务 (https://huggingface.co/papers?q=contact-rich%20bimanual%20tasks) 的真实机器人实验中,HABC将监督微调 (https://huggingface.co/papers?q=supervised%20fine-tuning) (SFT) 基线从36%、44%、12%提升至92%、88%、38%。
查看arXiv页面 (https://arxiv.org/abs/2606.17043) 查看PDF (https://arxiv.org/pdf/2606.17043) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.17043)
在您的智能体中获取此论文:
hf papers read 2606.17043
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2606.17043以从此页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2606.17043以从此页面链接。
引用此论文的Space0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2606.17043以从此页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放
本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。
基于表示锚定与语言-动作对齐的泛化VLA微调
Anchor-Align通过视觉-语言锚定增强行为克隆,以保留预训练表示和语言-动作对齐,在xArm7上使真实机器人成功率提升超过20%,并在模拟基准测试中持续取得改进。
EventVLA: 事件驱动的视觉证据记忆用于长时域视觉-语言-动作策略
EventVLA 提出了一种稀疏视觉证据记忆框架用于长时域机器人操作,相较于最先进的记忆增强型VLA,平均成功率提升了40%。
VLA-Corrector:一种用于自适应动作视野的轻量级检测与纠正推理框架
VLA-Corrector 提出了一种轻量级的检测与纠正推理框架,可在无需重新训练的情况下自适应调整视觉-语言-动作策略中的动作视野,提升机器人操控任务的鲁棒性和效率。