基于权重空间元学习的机器人策略自适应
摘要
提出WIZARD,一种权重空间元学习框架,它从语言指令和演示视频中为冻结的VLA策略生成任务特定的LoRA参数,从而实现无需微调的高效任务自适应。
查看缓存全文
缓存时间: 2026/06/10 00:08
论文页面 - 基于权重空间元学习的机器人策略自适应
来源:https://huggingface.co/papers/2606.07217
摘要
WIZARD 是一种权重空间元学习框架,能够仅通过语言指令和演示视频,为冻结的 VLA 策略生成任务特定的 LoRA 参数,从而无需微调即可实现高效的任务自适应。
视觉-语言-动作 (VLA) 模型正成为机器人操作领域一种有前景的范式,能够从大规模演示和动作标签数据集中训练通用策略。然而,将这些模型应用于新任务通常仍需任务特定的演示、动作标注以及额外的微调,导致部署成本高且难以规模化。我们提出 WIZARD,一种权重空间元学习框架,它通过为冻结的 VLA 策略生成任务特定的 LoRA 参数,绕过了任务特定的微调步骤。只需一条语言指令和一个简短的演示视频,WIZARD 即可在单次前向传播中预测对应的自适应权重,无需目标任务的动作标签或测试时优化。在元训练阶段,WIZARD 学习将任务证据直接映射到专家 LoRA 更新,从而捕获权重空间中任务之间的关系。在 LIBERO 上的实验表明,WIZARD 在未见过的数据集集合上性能提升高达约 2 倍,在未见过任务上性能提升高达约 14 倍。在 Franka Emika Panda 平台上,WIZARD 持续优于基于真实域自适应的基线,表明所生成的适配器能够提供超越仿真的任务级专业化。
查看 arXiv 页面 (https://arxiv.org/abs/2606.07217)查看 PDF (https://arxiv.org/pdf/2606.07217)项目页面 (https://fascetta.github.io/WIZARD/)GitHub0 (https://github.com/Fascetta/WIZARD)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.07217)
在您的 agent 中获取此论文:
hf papers read 2606\.07217
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
暂无模型链接到此论文
在模型的 README.md 中引用 arxiv.org/abs/2606.07217 以从此页面建立链接。
引用该论文的数据集0
暂无数据集链接到此论文
在数据集的 README.md 中引用 arxiv.org/abs/2606.07217 以从此页面建立链接。
引用该论文的 Space0
暂无 Space 链接到此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2606.07217 以从此页面建立链接。
包含该论文的收藏0
暂无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面建立链接。
相似文章
LaWAM:面向高效动力学感知机器人策略的潜在世界动作模型
LaWAM通过预测紧凑的潜在视觉子目标而非昂贵的视频生成,实现了高效的机器人控制,相比像素空间世界动作模型,成功率可达最先进水平,同时延迟降低高达24倍。
分层优势加权:面向稀疏回合结果的VLA在线强化学习微调
本文提出分层优势加权行为克隆(HABC),用于利用具有稀疏二进制回合结果的在线强化学习微调视觉-语言-动作(VLA)策略。HABC通过自适应评价器头和干预感知的信用分配将可行性和效率目标分离,显著提高了接触密集型双手操作任务的成功率。
Warp RL: 重塑基础策略分布以适应动力学变化
Warp RL 用基于单调有理二次样条流的可逆状态条件变换替代强化学习中的加性残差修正,该变换作用于基础策略的动作分布,从而在动力学偏移下适应分布的形状、尺度和几何结构。在 ManiSkill3 操作任务中,Warp RL 与残差修正性能相当或更优,并在真实机器人插销任务中实现了任务完成速度提高 30%。
语言模型推理的选择性状态空间适配与检索
提出了MaLoRA和MaRA两种适配器系列,在冻结的语言模型中引入选择性状态空间递归,实现token级和上下文级适配,在MuSiQue和2WikiMultihopQA等多跳推理基准上取得了显著提升。
语言代理的策略与世界模型协同训练
本文介绍PaW,一种协同训练框架,在在线策略强化学习(on-policy RL)轨迹中向策略学习添加辅助世界模型监督,无需额外计算开销即可改进语言代理的训练。