有意图的行动:蒸馏视觉-语言-动作模型的行为意图

Hugging Face Daily Papers 论文

摘要

本文提出意图蒸馏 (INDI),将行为意图蒸馏到视觉-语言-动作模型的动作解码器中,从而在SimplerEnv-Bridge等基准测试和现实世界任务中提高了性能。

视觉-语言-动作 (VLA) 模型可以将多模态上下文转化为机器人动作,但其动作解码器主要仍通过行为克隆进行训练。这监督了演示的哪个电机命令,同时使行为在指令下的局部目标保持隐含。基于未来的监督通过帧、潜在观察、轨迹或运动表示丰富了动作学习,但这些信号捕获的是可能发生情况的特定实现,而不是未来行为的共享语义目标。我们提出意图蒸馏 (INDI),将行为级意图蒸馏到动作解码器中。在训练期间,一个冻结的教师VLM从当前观察、指令、粗略动作摘要和相应的执行视频中解释一个演示片段。从其标准输入中,部署的VLA在解码器的中间层恢复由此产生的多模态意图表示,并利用它来组织动作预测,同时结合行为如何展开及其所实现内容的表示。在SimplerEnv-Bridge上,INDI将GR00T-N1.7从64.3%提高到84.7%,在RoboCasa Kitchen上,它将控制的GR00T-N1.7基线从64.1%提高到70.3%,在两个基准测试中π_{0.5}均有一致的提升。在现实世界任务中,INDI将平均成功率从62.0%提高到68.7%,在长视野任务上提升高达12.0个百分点。进一步分析表明,恢复的潜在表示被解码器使用,捕获了行为目标和执行进度,并以目标依赖的方式组织下游预测。这些结果表明,动作解码器从明确建模其生成行为的语义目标中受益。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:01

论文页面 - 以意念行动:为视觉-语言-动作模型提炼行为意图

来源:https://huggingface.co/papers/2608.23478

摘要

视觉-语言-动作模型能够将多模态上下文转化为机器人动作,但其动作解码器仍在很大程度上依赖行为克隆进行训练。这种方法仅监督示范中的电机指令,却隐去了该行为在指令下所服务的局部目标。基于未来的监督通过帧、潜在观测、轨迹或运动表示来丰富动作学习,但这些信号仅捕捉了可能发生事件的特定实现,而非未来行为的共同语义目标。我们提出意图蒸馏法,将行为层面的意图提炼到动作解码器中。训练期间,一个冻结的教师视觉语言模型会从当前观测、指令、粗略动作摘要及相应执行视频中解读示范片段。在部署时,视觉语言模型从标准输入中恢复其生成的多模态意图表示,并在中间解码器层利用该表示,结合行为展开过程及其成果的表征,共同组织动作预测。在简化环境桥接测试中,意图蒸馏将GR00T-N1.7的性能从64.3%提升至84.7%;在机器人厨房基准测试中,受控GR00T-N1.7基线从64.1%提升至70.3%,且π₀.₅在两个基准测试中均获得一致增益。在实际任务中,平均成功率从62.0%提升至68.7%,长时任务最高提升12.0个百分点。进一步分析显示,解码器确实利用了恢复的潜在表示,该表示既能捕捉行为目标与执行进度,又能以目标依赖的方式组织后续预测。这些结果表明,动作解码器能从显式建模其生成行为的语义目标中获益。

查看arXiv页面 (https://arxiv.org/abs/2608.23478) 查看PDF (https://arxiv.org/pdf/2608.23478) 项目主页 (https://leesangoh.github.io/indi-project-page/) GitHub代码库 (https://github.com/Leesangoh/INDI) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.23478)

在您的智能体中获取此论文:

hf papers read 2608.23478

尚未安装最新CLI?执行 curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

无关联模型

在模型README.md中引用 arxiv.org/abs/2608.23478 以从本页面关联。

引用本文的数据集0

无关联数据集

在数据集README.md中引用 arxiv.org/abs/2608.23478 以从本页面关联。

引用本文的交互空间0

无关联交互空间

在空间README.md中引用 arxiv.org/abs/2608.23478 以从本页面关联。

包含本文的收藏集0

无包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面关联。

相似文章

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。

TBD-VLA: 时序块扩散视觉语言动作模型

Hugging Face Daily Papers

TBD-VLA 提出了一种离散的视觉-语言-动作框架,结合了块扩散与自回归生成,以实现高效的时序动作建模和更快的推理速度,在仿真和真实世界的操作任务中显著优于之前的 VLA 方法。

视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟

Hugging Face Daily Papers

视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。