AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
摘要
AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。
查看缓存全文
缓存时间: 2026/06/05 18:09
论文页面 - AffordanceVLA: 一种通过功能感知理解赋能动作生成的视觉-语言-动作模型
来源: https://huggingface.co/papers/2606.06155 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
AffordanceVLA 引入了一个统一框架,利用结构化的功能预测作为中间表示,通过视觉-语言模型提升机器人操作中感知-动作映射的精度。
视觉-语言-动作(VLA)模型利用预训练视觉-语言模型(https://huggingface.co/papers?q=vision-language%20models)(VLM)丰富的世界知识,实现遵循指令的机器人操作。然而,VLM语义空间与具身控制策略(https://huggingface.co/papers?q=embodied%20control%20policies)之间的结构性不匹配,常常阻碍精确感知-动作映射的学习。为解决这一挑战,我们提出了 AffordanceVLA,一个统一框架,引入结构化功能预测(https://huggingface.co/papers?q=affordance%20forecasting)作为面向任务的中间表示,以建立更精确、鲁棒的感知-动作映射。具体来说,我们通过三个互补组件逐步建模操作先验:1) Which2Act:通过视觉潜变量预测(https://huggingface.co/papers?q=visual%20latent%20prediction)实现物体级接地,抑制干扰;2) Where2Act:通过功能图估计(https://huggingface.co/papers?q=affordance%20map%20estimation)实现2D交互定位;3) How2Act:通过3D几何推理(https://huggingface.co/papers?q=3D%20geometric%20reasoning)指导操作策略。这些功能线索提供了空间接地、语义条件化和动作耦合的中间表示,从而自然地将视觉、语言和动作连接起来。我们将这些模块集成到混合Transformer(https://huggingface.co/papers?q=Mixture-of-Transformer)(MoT)架构中,配备专门的专家网络,并通过三阶段训练策略和渐进式数据课程训练模型。为克服机器人数据集中密集功能标签的稀缺性,我们还开发了一个稳健的自动数据增强(https://huggingface.co/papers?q=automated%20data%20augmentation)流水线。在仿真和真实世界上的大量实验表明,AffordanceVLA 在多种操作场景中均取得了优异性能。
查看 arXiv 页面 (https://arxiv.org/abs/2606.06155) 查看 PDF (https://arxiv.org/pdf/2606.06155) 项目页面 (https://skywalker-yqz.github.io/AffordanceVLA/) GitHub1 (https://github.com/Skywalker-yqz/AffordanceVLA) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.06155)
在您的智能体中获取此论文:
hf papers read 2606\.06155
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.06155 即可从此页面链接。
引用此论文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.06155 即可从此页面链接。
引用此论文的 Spaces 0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.06155 即可从此页面链接。
包含此论文的收藏 0
无收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
SmolVLA:一种经济高效的视觉-语言-动作模型
SmolVLA是一种紧凑的视觉-语言-动作模型,在降低计算成本的同时实现了具有竞争力的机器人控制性能,使其能够部署在消费级硬件上。它引入了异步推理,并利用了社区收集的数据集。
AR-VLA: 面向视觉-语言-动作模型的真正自回归动作专家
提出了AR-VLA,一个自回归动作专家,它通过长期记忆生成连续的、具有上下文感知能力的机器人策略训练的动作序列,相比反应式VLA模型,提高了轨迹平滑度和任务成功率。
HiVLA: 一种以视觉接地为中心的分层具身操作系统
HiVLA 提出了一种分层视觉-语言-动作框架,通过使用扩散变换器动作专家将语义规划与运动控制解耦,从而改进机器人操作。该系统结合了用于任务分解和视觉接地的VLM规划器与使用级联交叉注意力的专用DiT动作专家,在长周期任务和细粒度操作方面尤其优于端到端基线。
LabVLA:在科学实验室中落地视觉-语言-动作模型
LabVLA是一种面向科学实验室自动化的视觉-语言-动作模型,采用两阶段训练方法,结合动作令牌预训练与流匹配。通过在LabUtopia基准上利用模拟数据弥合家庭演示与实验室特定任务之间的差距,它实现了最先进的成功率。
IntentVLA: 针对混叠机器人操作的短期意图建模
IntentVLA 是一种历史条件视觉-语言-动作框架,通过从视觉观察中编码短期意图来提高机器人模仿学习的稳定性,解决了部分可观察性和模糊观察带来的挑战。它还引入了 AliasBench,这是一个用于评估此类方法的模糊感知基准。