AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型

Hugging Face Daily Papers 论文

摘要

AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。

视觉-语言-动作(VLA)模型利用预训练的视觉-语言模型(VLM)丰富的世界知识,实现指令跟随的机器人操作。然而,VLM语义空间与具身控制策略之间的结构不匹配常常阻碍精确感知—动作映射的学习。为了解决这一挑战,我们提出了AffordanceVLA,一个统一框架,该框架引入结构化可供性预测作为面向任务的中间表示,以建立更精确和鲁棒的感知—动作映射。具体来说,我们通过三个互补组件逐步建模操作先验:1) Which2Act通过视觉潜在预测进行以物体为中心的接地,以抑制干扰;2) Where2Act通过可供性图估计进行2D交互定位;3) How2Act进行3D几何推理以指导操作策略。这些可供性线索提供了空间接地、语义条件和动作耦合的中间表示,从而自然地连接了视觉、语言和动作。我们将这些模块集成到一个具有专门专家的混合Transformer(MoT)架构中,并使用三阶段训练策略和渐进式数据课程训练模型。为了克服机器人数据集中密集可供性标签的稀缺性,我们还开发了一个鲁棒的自动化数据增强流水线。在仿真和真实世界上的大量实验表明,AffordanceVLA在各种操作场景中都取得了强大的性能。
查看原文
查看缓存全文

缓存时间: 2026/06/05 18:09

论文页面 - AffordanceVLA: 一种通过功能感知理解赋能动作生成的视觉-语言-动作模型

来源: https://huggingface.co/papers/2606.06155 作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

AffordanceVLA 引入了一个统一框架,利用结构化的功能预测作为中间表示,通过视觉-语言模型提升机器人操作中感知-动作映射的精度。

视觉-语言-动作(VLA)模型利用预训练视觉-语言模型(https://huggingface.co/papers?q=vision-language%20models)(VLM)丰富的世界知识,实现遵循指令的机器人操作。然而,VLM语义空间与具身控制策略(https://huggingface.co/papers?q=embodied%20control%20policies)之间的结构性不匹配,常常阻碍精确感知-动作映射的学习。为解决这一挑战,我们提出了 AffordanceVLA,一个统一框架,引入结构化功能预测(https://huggingface.co/papers?q=affordance%20forecasting)作为面向任务的中间表示,以建立更精确、鲁棒的感知-动作映射。具体来说,我们通过三个互补组件逐步建模操作先验:1) Which2Act:通过视觉潜变量预测(https://huggingface.co/papers?q=visual%20latent%20prediction)实现物体级接地,抑制干扰;2) Where2Act:通过功能图估计(https://huggingface.co/papers?q=affordance%20map%20estimation)实现2D交互定位;3) How2Act:通过3D几何推理(https://huggingface.co/papers?q=3D%20geometric%20reasoning)指导操作策略。这些功能线索提供了空间接地、语义条件化和动作耦合的中间表示,从而自然地将视觉、语言和动作连接起来。我们将这些模块集成到混合Transformer(https://huggingface.co/papers?q=Mixture-of-Transformer)(MoT)架构中,配备专门的专家网络,并通过三阶段训练策略和渐进式数据课程训练模型。为克服机器人数据集中密集功能标签的稀缺性,我们还开发了一个稳健的自动数据增强(https://huggingface.co/papers?q=automated%20data%20augmentation)流水线。在仿真和真实世界上的大量实验表明,AffordanceVLA 在多种操作场景中均取得了优异性能。

查看 arXiv 页面 (https://arxiv.org/abs/2606.06155) 查看 PDF (https://arxiv.org/pdf/2606.06155) 项目页面 (https://skywalker-yqz.github.io/AffordanceVLA/) GitHub1 (https://github.com/Skywalker-yqz/AffordanceVLA) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.06155)

在您的智能体中获取此论文:

hf papers read 2606\.06155

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.06155 即可从此页面链接。

引用此论文的数据集 0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.06155 即可从此页面链接。

引用此论文的 Spaces 0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.06155 即可从此页面链接。

包含此论文的收藏 0

无收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

SmolVLA:一种经济高效的视觉-语言-动作模型

Papers with Code Trending

SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。

HiVLA: 一种以视觉接地为中心的分层具身操作系统

Hugging Face Daily Papers

HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。

LabVLA:在科学实验室中落地视觉-语言-动作模型

Hugging Face Daily Papers

LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。

IntentVLA: 针对混叠机器人操作的短期意图建模

Hugging Face Daily Papers

IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。