分层优势加权:面向稀疏回合结果的VLA在线强化学习微调

Hugging Face Daily Papers 论文

摘要

本文提出分层优势加权行为克隆(HABC),用于利用具有稀疏二进制回合结果的在线强化学习微调视觉-语言-动作(VLA)策略。HABC通过自适应评价器头和干预感知的信用分配将可行性和效率目标分离,显著提高了接触密集型双手操作任务的成功率。

当预训练的VLA策略通过在线强化学习进行微调时,每次rollout回合只产生一个二进制结果(成功或失败),但actor更新需要每个转换(transition)的监督。现有方法通常将这个稀疏结果简化为一个标量奖励或优势信号,这会混淆不同形式的转换级反馈,并且在基本任务成功可实现后提供的指导有限。首先,单个标量信号混淆了可行性和效率两个目标;一旦基本成功实现,二进制标签无法提供梯度来区分高效完成和缓慢完成。其次,真实世界的rollout混合了自主段和干预段;天真地跨这些边界分配回合结果会导致错误的信用分配。为了解决这些问题,我们提出分层优势加权行为克隆(HABC),它在不同的数据子集上为这两个目标训练独立的评价器头,并通过状态自适应平衡(state-adaptive balance)组合其输出。一个状态自适应门g_t合并它们的一步优势,当成功不确定时优先考虑可行性,仅当可行性高时才转向效率,并将结果转换为actor损失上的逐转换权重。干预感知的信用分配进一步将结果标签限制在当前策略执行的段上,防止监督信息跨干预边界泄露。在三个接触密集型双手操作任务的实际机器人实验中,HABC将成功从监督微调(SFT)基线的36%、44%和12%提高到92%、88%和38%。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:31

Paper page - 面向VLA在线RL微调的层次化优势加权方法,基于稀疏回合结果

来源:https://huggingface.co/papers/2606.17043 发布于 6月15日

·

Siyuan (https://huggingface.co/SiyuanH) 于6月16日提交

摘要

Hierarchical Advantage-Weighted Behavior Cloning (HABC) 通过分别优化可行性目标和效率目标,采用自适应评判头与干预感知信用分配,解决了机器人学习中的稀疏奖励挑战,显著提升了高接触型操作任务的成功率。

当预训练的VLA策略通过在线RL (https://huggingface.co/papers?q=online%20RL) 进行微调时,每次轨迹展开仅产生一个二元结果(成功或失败),但策略更新 (https://huggingface.co/papers?q=actor%20update) 需要每个时间步的监督 (https://huggingface.co/papers?q=per-transition%20supervision)。现有方法通常将此稀疏结果 (https://huggingface.co/papers?q=sparse%20outcome) 简化为单个标量奖励 (https://huggingface.co/papers?q=scalar%20reward) 或优势信号 (https://huggingface.co/papers?q=advantage%20signal),这混淆了不同形式的逐时间步反馈,且在基本任务成功达到后提供的指导有限。首先,单一标量信号混淆了可行性 (https://huggingface.co/papers?q=viability) 和效率 (https://huggingface.co/papers?q=efficiency) 两个目标;一旦基本成功实现,二元标签无法提供梯度来区分高效完成与缓慢完成。其次,真实世界的轨迹展开混合了自主段和干预段;跨这些边界直接分配回合结果会导致错误的信用分配。为解决这些问题,我们提出了Hierarchical Advantage-Weighted Behavior Cloning (HABC),它在不同数据子集上为这两个目标训练独立的评判头 (https://huggingface.co/papers?q=critic%20heads),并通过状态自适应平衡 (https://huggingface.co/papers?q=state-adaptive%20balance) 组合其输出。状态自适应门控g_t融合它们的一步优势,当成功不确定时优先考虑可行性 (https://huggingface.co/papers?q=viability),仅在可行性 (https://huggingface.co/papers?q=viability) 高时转向效率 (https://huggingface.co/papers?q=efficiency),并将结果转换为策略损失的逐时间步权重。干预感知信用分配 (https://huggingface.co/papers?q=Intervention-aware%20credit%20assignment) 进一步将结果标签限制在当前策略执行的片段内,防止监督跨越干预边界泄漏。在三个高接触型双手操作任务 (https://huggingface.co/papers?q=contact-rich%20bimanual%20tasks) 的真实机器人实验中,HABC将监督微调 (https://huggingface.co/papers?q=supervised%20fine-tuning) (SFT) 基线从36%、44%、12%提升至92%、88%、38%。

查看arXiv页面 (https://arxiv.org/abs/2606.17043) 查看PDF (https://arxiv.org/pdf/2606.17043) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.17043)

在您的智能体中获取此论文:

hf papers read 2606.17043

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2606.17043以从此页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2606.17043以从此页面链接。

引用此论文的Space0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2606.17043以从此页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到一个收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

基于表示锚定与语言-动作对齐的泛化VLA微调

Hugging Face Daily Papers

Anchor-Align通过视觉-语言锚定增强行为克隆,以保留预训练表示和语言-动作对齐,在xArm7上使真实机器人成功率提升超过20%,并在模拟基准测试中持续取得改进。