有意图的行动:蒸馏视觉-语言-动作模型的行为意图
摘要
本文提出意图蒸馏 (INDI),将行为意图蒸馏到视觉-语言-动作模型的动作解码器中,从而在SimplerEnv-Bridge等基准测试和现实世界任务中提高了性能。
查看缓存全文
缓存时间: 2026/09/01 12:01
论文页面 - 以意念行动:为视觉-语言-动作模型提炼行为意图
来源:https://huggingface.co/papers/2608.23478
摘要
视觉-语言-动作模型能够将多模态上下文转化为机器人动作,但其动作解码器仍在很大程度上依赖行为克隆进行训练。这种方法仅监督示范中的电机指令,却隐去了该行为在指令下所服务的局部目标。基于未来的监督通过帧、潜在观测、轨迹或运动表示来丰富动作学习,但这些信号仅捕捉了可能发生事件的特定实现,而非未来行为的共同语义目标。我们提出意图蒸馏法,将行为层面的意图提炼到动作解码器中。训练期间,一个冻结的教师视觉语言模型会从当前观测、指令、粗略动作摘要及相应执行视频中解读示范片段。在部署时,视觉语言模型从标准输入中恢复其生成的多模态意图表示,并在中间解码器层利用该表示,结合行为展开过程及其成果的表征,共同组织动作预测。在简化环境桥接测试中,意图蒸馏将GR00T-N1.7的性能从64.3%提升至84.7%;在机器人厨房基准测试中,受控GR00T-N1.7基线从64.1%提升至70.3%,且π₀.₅在两个基准测试中均获得一致增益。在实际任务中,平均成功率从62.0%提升至68.7%,长时任务最高提升12.0个百分点。进一步分析显示,解码器确实利用了恢复的潜在表示,该表示既能捕捉行为目标与执行进度,又能以目标依赖的方式组织后续预测。这些结果表明,动作解码器能从显式建模其生成行为的语义目标中获益。
查看arXiv页面 (https://arxiv.org/abs/2608.23478) 查看PDF (https://arxiv.org/pdf/2608.23478) 项目主页 (https://leesangoh.github.io/indi-project-page/) GitHub代码库 (https://github.com/Leesangoh/INDI) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.23478)
在您的智能体中获取此论文:
hf papers read 2608.23478
尚未安装最新CLI?执行 curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
无关联模型
在模型README.md中引用 arxiv.org/abs/2608.23478 以从本页面关联。
引用本文的数据集0
无关联数据集
在数据集README.md中引用 arxiv.org/abs/2608.23478 以从本页面关联。
引用本文的交互空间0
无关联交互空间
在空间README.md中引用 arxiv.org/abs/2608.23478 以从本页面关联。
包含本文的收藏集0
无包含本文的收藏集
将本文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面关联。
相似文章
IntentVLA: 针对混叠机器人操作的短期意图建模
IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。
它们推断出你的意图:模型对交际意图的表征比实际行动更可靠
本文研究了语言模型尽管具有稳健的内部表征,但在行动上却未能体现交际意图的问题。通过线性探针,作者发现意图可以从隐藏状态中解码,但通常不反映在输出中,而引导一个较后层的方向可以恢复预期的行为。
意图胜于言语:超越响应模仿的可控用户模拟
本文介绍了UserIDA,一种用于可控用户模拟的方法,将交互意图与语言表达分离,在LMSYS-USP基准上实现了比基线显著更高的意图准确率和响应质量。
TBD-VLA: 时序块扩散视觉语言动作模型
TBD-VLA 提出了一种离散的视觉-语言-动作框架,结合了块扩散与自回归生成,以实现高效的时序动作建模和更快的推理速度,在仿真和真实世界的操作任务中显著优于之前的 VLA 方法。
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。