AFUN:迈向功能性理解的可供性基础模型

Hugging Face Daily Papers 论文

摘要

AFUN 提出了一种可供性基础模型,该模型从 RGB-D 观测和语言描述中预测功能掩码和 3D 运动曲线,从而能够在多种环境中实现泛化的机器人操作。该模型在多个基准测试上优于基线方法,并且无需微调即可部署到实际任务中。

可供性理解连接了视觉感知与物理动作,作为机器人在开放且非结构化的现实环境中进行操作的可解释接口。然而,构建一个不仅理解交互发生的位置和方式,还能在多种环境、物体和任务中泛化的可供性基础模型,仍然是一个长期的研究挑战。现有方法通常仅解决部分挑战,要么定位任务相关区域而未指定可执行动作,要么预测动作但扩展性有限。在本文中,我们提出了 ourmodel,这是迈向功能性理解的可供性基础模型的一步。从单一的 RGB-D 观测和语言任务描述中,ourmodel 预测出任务条件功能掩码(交互位置)和 3D 接触后运动曲线(交互方式)。为了支持开放世界泛化,我们构建了一个大规模标准化数据管道,将异构的机器人、人类、仿真和真实世界扫描数据转换为共享的可供性模式,包含语言、掩码和以物体为中心的 3D 运动标签。我们从三个方面评估 ourmodel:在可供性分割方面,ourmodel 在来自 4 个基准测试的 8 个测试集上以较大优势优于所有基线方法,平均 gIoU/cIoU 分别提升 +23.9/+26.3;在接触点预测方面,它预测的点更准确,相比最佳基线命中率提升 12.7% 至 61.3%;在 3D 运动方面,它在所有三个测试集上均达到最佳性能。ourmodel 可以部署到实际机器人操作中,无需针对机器人形态进行微调或使用任务特定启发式方法,展示了适应开放世界可供性任务的能力。Project page: https://www.zhaoningwang.com/AFUN
查看原文
查看缓存全文

缓存时间: 2026/06/02 19:33

论文页面 - AFUN:迈向功能理解的功能可供性基础模型

来源:https://huggingface.co/papers/2606.02551

摘要

功能可供性理解模型能从RGB-D观测和语言描述中预测功能性掩码与3D运动曲线,从而在多样化环境中实现可泛化的机器人操作。

功能可供性理解桥接了视觉感知与物理动作,为开放、非结构化真实世界中的机器人操作提供了可解释的接口。然而,构建一个既能理解交互位置与方式,又能在不同环境、物体和任务间泛化的功能可供性基础模型(https://huggingface.co/papers?q=affordance%20foundation%20model),始终是长期存在的科研挑战。现有方法通常仅解决部分问题:要么定位任务相关区域但未指定可执行运动,要么预测运动但可扩展性有限。本文提出了我们的模型,朝着功能理解的功能可供性基础模型迈出一步。仅需单张RGB-D观测(https://huggingface.co/papers?q=RGB-D%20observation)和语言任务描述(https://huggingface.co/papers?q=language%20task%20description),我们的模型即可预测任务条件功能掩码(https://huggingface.co/papers?q=task-conditional%20functional%20mask)(交互位置)和3D接触后运动曲线(https://huggingface.co/papers?q=3D%20post-contact%20motion%20curve)(交互方式)。为支持开放世界泛化(https://huggingface.co/papers?q=open-world%20generalization),我们构建了大规模标准化数据流水线,将异构的机器人、人类、仿真及真实世界扫描数据转换为共享的功能可供性模式,包含语言、掩码和以物体为中心的3D运动标签。我们从三个方面评估我们的模型:在功能可供性分割方面,我们的模型在来自4个基准的8个测试集上大幅优于所有基线,平均gIoU/cIoU分别提升+23.9/+26.3;在接触点预测(https://huggingface.co/papers?q=contact-point%20prediction)方面,它预测出显著更精确的点,相比最佳基线命中率提升12.7%-61.3%;在3D运动方面,它在全部三个测试集上均取得最佳性能。我们的模型可直接部署于真实世界机器人操作,无需针对机器人形态微调或使用任务特定启发式规则,展示了适应开放世界功能可供性任务的能力。项目页面:https://www.zhaoningwang.com/AFUN

查看arXiv页面(https://arxiv.org/abs/2606.02551)查看PDF(https://arxiv.org/pdf/2606.02551)项目页面(https://www.zhaoningwang.com/AFUN/)GitHub0(https://github.com/EricWang12/AFUN)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.02551)

在你的Agent中获取本论文:

hf papers read 2606.02551

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

尚无模型关联本论文

请在模型README.md中引用arxiv.org/abs/2606.02551以便从本页面链接。

引用本文的数据集0

尚无数据集关联本论文

请在数据集README.md中引用arxiv.org/abs/2606.02551以便从本页面链接。

引用本文的Space0

尚无Space关联本论文

请在Space README.md中引用arxiv.org/abs/2606.02551以便从本页面链接。

包含本论文的收藏0

尚无收藏包含本论文

请将本论文添加到一个收藏(https://huggingface.co/new-collection)中以便从本页面链接。

相似文章

物体能提供什么,而非它们是什么:用于可供性推理的功能潜在空间

arXiv cs.LG

本文介绍了A4D,一个将视觉观察映射到围绕可供性(例如“可移动”)构建的共享潜在空间中的框架,用于机器人规划。它在现有可供性上实现了94%的推理准确率,比现有最优方法高出15%,并且实现了100倍的推理速度提升,对未见过的物体功能具有更强的泛化能力。

AFFORDANCE20Q:基于物理属性的可操作推理评估

arXiv cs.AI

Affordance20Q 是一个基准测试,采用20个问题格式,评估大型语言模型在隐藏物体身份的情况下,从物理属性推断物体可操作性的能力。实验表明,大型语言模型与人类之间存在约20个百分点的差距,而提出的KARI流水线可将开源大型语言模型的性能提升高达15.2个百分点。

ABot-N1:迈向通用视觉语言导航基础模型

Hugging Face Daily Papers

ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。