物体能提供什么,而非它们是什么:用于可供性推理的功能潜在空间
摘要
本文介绍了A4D,一个将视觉观察映射到围绕可供性(例如“可移动”)构建的共享潜在空间中的框架,用于机器人规划。它在现有可供性上实现了94%的推理准确率,比现有最优方法高出15%,并且实现了100倍的推理速度提升,对未见过的物体功能具有更强的泛化能力。
arXiv:2606.05533v1 Announce Type: new
摘要:现有的机器人规划系统依赖于基于外观的推理,即将视觉观察编码到围绕物体外观组织的潜在空间中(例如,根据外观识别“推车”)。然而,规划需要对物体的任务相关功能进行推理(例如,物体是否“可移动”),这是基于外观的潜在空间无法捕捉的。因此,现有方法难以泛化到新的机器人-物体交互场景。我们通过可供性推理来解决这一泛化能力有限的问题,使得规划可以基于任务相关的物体功能而非仅基于外观。我们引入了A4D,它将视觉观察映射到一个围绕可供性(例如“可移动”)构建的共享潜在空间中。通过将视觉观察投影到这个功能潜在空间中并测量它们与可供性的接近程度,A4D推断出与观察对象相关的功能。此外,我们引入了一种可供性发现机制,该机制扩展潜在空间以处理现有可供性不足的未见场景。A4D利用功能潜在空间中的接近度来量化可供性推理的不确定性,并选择性地触发可供性发现。我们在涉及多种和未见过可供性的多个规划任务上评估了A4D。A4D在现有可供性上实现了94%的推理准确率,比现有最优方法高出超过15个百分点,将新可供性的推理准确率从70%提升到90%以上,且仅使用不到10%的原始训练数据,并实现了100倍的推理速度提升。代码、视频和数据可在 https://A4Dance-reasoning.github.io 获取。
查看缓存全文
缓存时间: 2026/06/05 08:11
# 物体能做什么,而非它是什么:面向可供性推理的功能潜空间
来源:https://arxiv.org/html/2606.05533
Rohan Siva\*¹ Neel P. Bhatt\*¹,² Yunhao Yang\*¹,² Seoyoung Lee¹ Nishant Gadde¹ Christian Ellis¹,² Alvaro Velasquez²,³ Zhangyang Wang¹ Ufuk Topcu¹,² ¹德克萨斯大学奥斯汀分校 ²神经符号智能 ³科罗拉多大学博尔德分校 \*同等贡献 \{rohansiva,npbhatt,yunhaoyang234,seoyounglee,nishantg\}@utexas.edu \{chrisitan.ellis@austin.,atlaswang@,utpocu@\}utexas.edu [email protected]
###### 摘要
现有的机器人规划系统依赖于基于外观的推理,即视觉观测被编码到围绕物体外观组织的潜空间中(例如,根据外观识别“推车”)。然而,规划需要推理物体的任务相关功能(例如,物体是否“可移动”),而基于外观的潜空间无法捕捉这些功能。因此,现有方法难以泛化到新的机器人-物体交互。我们通过可供性推理来解决这种有限的泛化性,使得规划能够基于任务相关的物体功能而非仅凭外观。我们提出了**A4D**,它将视觉观测映射到一个围绕可供性(例如“可移动”)结构化的共享潜空间中。通过将视觉观测投影到这个功能潜空间并测量它们与可供性的接近度,**A4D** *推断*出与观测物体相关的功能。此外,我们引入了一种可供性*发现*机制,在现有可供性不足时扩展潜空间以处理未见场景。**A4D**利用功能潜空间中的接近度来量化可供性推断中的不确定性,并选择性触发可供性发现。我们在涉及多样化和未见可供性的多个规划任务上评估了**A4D**。**A4D**在现有可供性上实现了94%的推断准确率,比最先进方法高出超过15个百分点;在少于约10%原始训练数据的情况下,将新可供性推断准确率从约70%提升至超过90%;并实现了100倍更快的推断。代码、视频和数据可在: https://a4dance-reasoning.github.io/ 获取。
> 关键词:可供性推理,功能潜空间,不确定性量化,机器人规划
## 1 引言
机器人规划的最新进展主要依赖于围绕物体外观组织的潜空间\[15,10,8\]。虽然这种方法能有效识别物体是什么,但基于外观的推理往往无法捕捉机器人如何将物体用于任务。例如,识别出“推车”并不能直接表明它是“可移动”还是“可支撑”。因此,这些系统难以泛化到新的机器人-物体交互,因为视觉上不同的物体可能支持相同的功能,而视觉上相似的物体可能不支持。
规划反而需要推理*可供性*,即由物体物理属性与机器人能力之间的关系定义的任务相关物体功能\[9,14\]。与物体类别不同,可供性描述物体如何在规划中被使用,例如它是否可移动、可搬运或可支撑。因此,基于可供性的推理为规划提供了比单纯外观更可泛化的基础。最近的视觉-语言和基于交互的方法开始将语义表示与机器人可供性联系起来,实现了基于语言的规划、开放世界操作和空间可供性预测\[15,1,16,19,4\]。然而,现有方法通常依赖于任务特定的可供性预测器、机器人交互数据或昂贵的VLM推断,这使得难以支持用于实时规划的细粒度、不确定性感知的可供性推理。
为了实现可泛化且高效的可供性推理,我们引入了**A4D**,一个将视觉观测映射到围绕可供性结构化的共享*功能潜空间*的框架。通过在这个潜空间中进行推理,**A4D**直接从视觉观测推断任务相关功能,同时保持对新颖物体和交互的鲁棒性。此外,**A4D**量化可供性推断中的不确定性,并在现有可供性不足时通过可供性发现选择性地扩展其可供性记忆。
我们在涉及多样化和未见可供性的多个规划任务上评估了**A4D**。**A4D**在现有可供性上实现了94%的推断准确率,比最先进方法高出超过20个百分点;在少于16个标注例子的情况下将新可供性推断准确率从约70%提升至超过90%;并实现了100倍更快的推断,适用于实时规划。我们总结主要贡献如下:
图1:**A4D**将视觉观测和可供性映射到一个功能潜空间。
1. **用于可供性推理的功能潜空间**:我们提出了**A4D**,它将视觉观测映射到一个围绕可供性结构化的共享功能潜空间,使得规划能够基于任务相关的物体功能而非仅凭外观。
2. **准确且高效的可供性推断**:我们展示了在多样化规划任务中准确且高效的可供性推断,在现有可供性上实现了94%的推断准确率,在少于原始训练数据10%的情况下将新可供性推断准确率从约70%提升至超过90%,并实现了100倍更快的推断。
3. **不确定性感知的可供性发现**:我们引入了一种可供性发现机制,利用功能潜空间中的接近度来量化可供性推断中的不确定性,并在现有可供性不足以处理未见场景时选择性地扩展空间。
## 2 相关工作
关于视觉可供性的现有工作涵盖基于外观的推理、基于交互的可供性学习以及利用以可供性结构化的功能潜空间的方法\[10,7\]。基于外观的方法通过标记适合动作(抓取、放置、穿越等)的区域来识别图像和视频中的可供性。通常,少数可供性特定于物体类别或任务,难以泛化到其训练分布之外\[10,20,2,11,18,6\]。基于交互的系统如AffordanceNet、PLATO、SayCan和ImagineThat通过价值函数或显式可供性预测器从机器人经验中学习可供性。这些方法通常具有领域特定性,绑定于特定的机器人平台或技能库,并且适应新任务的成本较高\[8,4,1,17,3\]。最近的工作探索了视觉-语言模型和功能潜空间,以超越封闭世界假设并实现开放词汇的可供性推理,但现成模型往往产生粗粒度的可供性输出,且需要高推断时间和计算资源,限制了它们在细粒度、实时机器人规划中的应用\[15,19,5,12\]。相比之下,我们的框架利用可供性-反义词对将一个预训练的视觉-语言嵌入空间(CLIP\[15\])结构化为功能潜空间,支持不确定性感知的可供性推断,并无需重新训练即可显式发现新可供性,为开放词汇的可供性推理与实时机器人规划之间提供了实用的桥梁\[16,13\]。关于先前工作的更详细综述和讨论,包括额外的基于外观、基于交互和功能潜空间方法,见附录E。
## 3 问题形式化
我们考虑这样一个设定:可供性无法直接观测,必须从视觉观测中推断,并且相关可供性集合可能随着新任务和环境的出现而演变。给定一张图像 \(x \in \mathcal{X}\),目标是为每个可供性 \(a \in \mathcal{A}\) 推断二进制可供性标签 \(\hat{y}_a \in \{0,1\}\),指示图像中的物体是否支持给定的任务相关功能(例如,可移动、可搬运、可支撑)。目标是学习一个模型,能够从 \(x\) 预测可供性而无需任务特定的重新训练,同时泛化到未见物体并支持在测试时添加新的可供性。
## 4 方法
在本节中,我们描述可供性推理过程,如图2所示,包括功能潜空间中的可供性推断、不确定性量化、可供性发现和可供性标注。我们在附录A中定义本节所用所有变量的正式符号。
图2:**A4D**概览:包括可供性生成、发现、推断和标注。
### 4.1 可供性推断
我们通过利用预训练视觉-语言嵌入空间(CLIP\[15\])的语义结构来推断物体可供性,在该空间中,图像和文本都被映射到一个共享的功能潜空间。我们在图1中展示了这个功能潜空间。
如图1所示,我们通过连接一个可供性及其反义词的文本嵌入来构建一个*可供性轴*。该轴捕捉了可供性存在与缺失之间的语义对比。给定一张图像,我们将其嵌入投影到对应的可供性轴上,并确定其沿该方向的相对位置。为了进一步改进视觉观测与可供性之间的对齐,我们在少量标注的可供性-图像对数据集上微调功能潜空间。
#### 4.1.1 功能潜空间中的可供性轴
设 \(\mathcal{Z} \subset \mathbb{R}^d\) 为由预训练视觉-语言模型(例如CLIP)诱导的共享潜空间,该模型包含一个图像编码器 \(f_{\mathrm{img}}: \mathcal{X} \to \mathcal{Z}\) 和一个文本编码器 \(f_{\mathrm{text}}: \mathcal{T} \to \mathcal{Z}\)。两个编码器都将输入映射到一个功能潜空间,其中语义相似性由余弦相似度捕捉。
给定一个可供性 \(a\),我们定义两个文本描述:(i)一个正面描述 \(t_a \in \mathcal{T}\),描述该可供性的存在;(ii)一个反义描述 \(t_{\bar{a}} \in \mathcal{T}\),描述其缺失。它们的嵌入为:\(z_a = f_{\text{text}}(t_a)\) 和 \(z_{\bar{a}} = f_{\text{text}}(t_{\bar{a}})\)。
我们将*语义可供性轴*定义为连接这两个嵌入的一维仿射子空间。对应的方向向量为:\(u_a = z_a - z_{\bar{a}}\)。
根据构造,\(u_a\) 的正方向从反义词指向可供性,其大小编码了两者之间的语义分离。这种构造假设预训练潜空间编码了有意义的语义关系,使得差异向量 \(u_a\) 捕捉了区分可供性存在与缺失的主要方向。
##### 学习功能潜空间。
虽然语义轴纯粹由文本定义,但视觉嵌入与该轴的对齐可以通过少量标注图像进一步改进。设 \(\mathcal{D}_a = \{(x_i, y_i)\}_{i=1}^n, y_i \in \{0,1\}\) 为一个数据集,其中 \(y_i=1\) 表示可供性 \(a\) 的存在。
我们使用一个对比目标微调编码器 \(f_{\mathrm{img}}\) 和 \(f_{\mathrm{text}}\),该目标鼓励图像与正确的文本概念对齐。具体来说,对于每个样本 \((x_i, y_i)\),我们定义目标文本嵌入:
\[
z_i^+ = \begin{cases} z_a, & y_i=1, \\ z_{\bar{a}}, & y_i=0, \end{cases} \qquad z_i^- = \begin{cases} z_{\bar{a}}, & y_i=1, \\ z_a, & y_i=0. \end{cases}
\]
令 \(z_i = f_{\mathrm{img}}(x_i)\) 表示图像嵌入。我们采用以下形式的对比损失:
\[
\mathcal{L}_i = -\log \frac{\exp(\mathrm{sim}(z_i, z_i^+)/\tau)}{\exp(\mathrm{sim}(z_i, z_i^+)/\tau) + \exp(\mathrm{sim}(z_i, z_i^-)/\tau)},
\]
其中 \(\mathrm{sim}(\cdot,\cdot)\) 表示余弦相似度,\(\tau > 0\) 是温度参数。
该目标鼓励具有可供性 \(a\) 的图像的嵌入与 \(z_a\) 对齐,并远离 \(z_{\bar{a}}\),反之亦然对于负样本。因此,视觉嵌入被重塑,使其沿语义可供性轴的投影更具区分性,同时保留预训练潜空间的全局结构。最终的可供性轴 \(u_a\) 由(可选微调后的)文本嵌入定义,并在下游推断中跨所有图像共享。
#### 4.1.2 使用投影接近度进行可供性推断
给定一张图像 \(x\),我们获得其嵌入 \(z_{\mathrm{img}} = f_{\mathrm{img}}(x) \in \mathcal{Z}\)。我们将 \(z_{\mathrm{img}}\) 投影到由 \((z_{\bar{a}}, z_a)\) 定义的语义可供性轴上。标量投影坐标为:
\[
\lambda_a(z_{\mathrm{img}}) = \langle z_{\mathrm{img}} - z_{\bar{a}}, u_a \rangle / \|u_a\|^2,
\]
其中 \(\langle,\rangle\) 是 \(\mathbb{R}^d\) 中的标准内积,\(\|\cdot\|\) 表示欧几里得范数。
该坐标表示 \(z_{\mathrm{img}}\) 沿轴的相对位置,其中 \(\lambda_a(z_{\mathrm{img}})=0\) 对应于反义可供性,\(\lambda_a(z_{\mathrm{img}})=1\) 对应于可供性本身。
我们基于轴的中点进行分类:
\[
\hat{y}_a = \begin{cases} 1, & \lambda_a(z_{\mathrm{img}}) > \frac{1}{2}, \\ 0, & \lambda_a(z_{\mathrm{img}}) \leq \frac{1}{2}. \end{cases}
\]相似文章
AFUN:迈向功能性理解的可供性基础模型
AFUN 提出了一种可供性基础模型,该模型从 RGB-D 观测和语言描述中预测功能掩码和 3D 运动曲线,从而能够在多种环境中实现泛化的机器人操作。该模型在多个基准测试上优于基线方法,并且无需微调即可部署到实际任务中。
AFFORDANCE20Q:基于物理属性的可操作推理评估
Affordance20Q 是一个基准测试,采用20个问题格式,评估大型语言模型在隐藏物体身份的情况下,从物理属性推断物体可操作性的能力。实验表明,大型语言模型与人类之间存在约20个百分点的差距,而提出的KARI流水线可将开源大型语言模型的性能提升高达15.2个百分点。
AffordanceVLA: 一种通过可供性感知理解赋能动作生成的视觉-语言-动作模型
AffordanceVLA引入了一个统一框架,利用结构化可供性预测作为中间表示,结合视觉-语言模型和混合Transformer架构,以改进机器人操作中的感知-动作映射。
4DThinker:利用 4D 意象进行动态空间理解
4DThinker 是一个新框架,使视觉-语言模型能够利用 4D 潜在心理意象执行动态空间推理。该论文引入了可扩展的数据生成方法以及新颖的微调技术(包括 4D 强化学习),以提升模型在复杂动态任务上的性能。
AlloSpatial:面向基础模型空间推理的代理框架
AlloSpatial是一个代理框架,通过将自我中心观察转换为结构化的全局空间表征,利用认知映射和工具使用推理,增强基础模型的空间推理能力。在基准测试中性能提升5%-18%,并通过冷启动强化学习胜过更大的模型。