AFUN:迈向功能性理解的可供性基础模型
摘要
AFUN 提出了一种可供性基础模型,该模型从 RGB-D 观测和语言描述中预测功能掩码和 3D 运动曲线,从而能够在多种环境中实现泛化的机器人操作。该模型在多个基准测试上优于基线方法,并且无需微调即可部署到实际任务中。
查看缓存全文
缓存时间: 2026/06/02 19:33
论文页面 - AFUN:迈向功能理解的功能可供性基础模型
来源:https://huggingface.co/papers/2606.02551
摘要
功能可供性理解模型能从RGB-D观测和语言描述中预测功能性掩码与3D运动曲线,从而在多样化环境中实现可泛化的机器人操作。
功能可供性理解桥接了视觉感知与物理动作,为开放、非结构化真实世界中的机器人操作提供了可解释的接口。然而,构建一个既能理解交互位置与方式,又能在不同环境、物体和任务间泛化的功能可供性基础模型(https://huggingface.co/papers?q=affordance%20foundation%20model),始终是长期存在的科研挑战。现有方法通常仅解决部分问题:要么定位任务相关区域但未指定可执行运动,要么预测运动但可扩展性有限。本文提出了我们的模型,朝着功能理解的功能可供性基础模型迈出一步。仅需单张RGB-D观测(https://huggingface.co/papers?q=RGB-D%20observation)和语言任务描述(https://huggingface.co/papers?q=language%20task%20description),我们的模型即可预测任务条件功能掩码(https://huggingface.co/papers?q=task-conditional%20functional%20mask)(交互位置)和3D接触后运动曲线(https://huggingface.co/papers?q=3D%20post-contact%20motion%20curve)(交互方式)。为支持开放世界泛化(https://huggingface.co/papers?q=open-world%20generalization),我们构建了大规模标准化数据流水线,将异构的机器人、人类、仿真及真实世界扫描数据转换为共享的功能可供性模式,包含语言、掩码和以物体为中心的3D运动标签。我们从三个方面评估我们的模型:在功能可供性分割方面,我们的模型在来自4个基准的8个测试集上大幅优于所有基线,平均gIoU/cIoU分别提升+23.9/+26.3;在接触点预测(https://huggingface.co/papers?q=contact-point%20prediction)方面,它预测出显著更精确的点,相比最佳基线命中率提升12.7%-61.3%;在3D运动方面,它在全部三个测试集上均取得最佳性能。我们的模型可直接部署于真实世界机器人操作,无需针对机器人形态微调或使用任务特定启发式规则,展示了适应开放世界功能可供性任务的能力。项目页面:https://www.zhaoningwang.com/AFUN
查看arXiv页面(https://arxiv.org/abs/2606.02551)查看PDF(https://arxiv.org/pdf/2606.02551)项目页面(https://www.zhaoningwang.com/AFUN/)GitHub0(https://github.com/EricWang12/AFUN)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.02551)
在你的Agent中获取本论文:
hf papers read 2606.02551
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
尚无模型关联本论文
请在模型README.md中引用arxiv.org/abs/2606.02551以便从本页面链接。
引用本文的数据集0
尚无数据集关联本论文
请在数据集README.md中引用arxiv.org/abs/2606.02551以便从本页面链接。
引用本文的Space0
尚无Space关联本论文
请在Space README.md中引用arxiv.org/abs/2606.02551以便从本页面链接。
包含本论文的收藏0
尚无收藏包含本论文
请将本论文添加到一个收藏(https://huggingface.co/new-collection)中以便从本页面链接。
相似文章
物体能提供什么,而非它们是什么:用于可供性推理的功能潜在空间
本文介绍了A4D,一个将视觉观察映射到围绕可供性(例如“可移动”)构建的共享潜在空间中的框架,用于机器人规划。它在现有可供性上实现了94%的推理准确率,比现有最优方法高出15%,并且实现了100倍的推理速度提升,对未见过的物体功能具有更强的泛化能力。
AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。
AFFORDANCE20Q:基于物理属性的可操作推理评估
Affordance20Q 是一个基准测试,采用20个问题格式,评估大型语言模型在隐藏物体身份的情况下,从物理属性推断物体可操作性的能力。实验表明,大型语言模型与人类之间存在约20个百分点的差距,而提出的KARI流水线可将开源大型语言模型的性能提升高达15.2个百分点。
ABot-N1:迈向通用视觉语言导航基础模型
ABot-N1 是一种视觉语言导航基础模型,通过采用带有双重视觉语言信号的慢-快架构将认知与控制解耦,在室内和室外导航任务中取得了新的最先进成果。
Foresight: 长时域机器人操作中基于动作条件的世界模型潜在表示的故障检测
Foresight 是一个用于长时域机器人操作的故障检测框架,它利用基于动作条件的世界模型潜在表示和功能性保形预测来监控轨迹,仅使用最终任务标签进行训练。在仿真和真实机器人任务中均展示了最先进的性能。