桥接学习的视觉感知与符号信念空间规划

arXiv cs.AI 论文

摘要

本文提出一种新范式VLM-as-probabilistic-grounder,它将视觉语言模型中的不确定性建模为概率分布,用于符号信念空间规划,从而增强在部分可观测环境中的鲁棒性。

arXiv:2609.16884v1 公告类型:新 摘要:在部分可观测环境中,智能体必须在没有完整世界状态知识的情况下行动,并依赖不确定的状态估计管道。在这种不确定性下获得有依据且可验证的符号计划仍然是一个关键挑战。最近的工作集成了视觉语言模型(VLMs)来桥接感知和符号推理,遵循两种主要范式。第一种,VLM-as-planner,直接将图像映射为动作序列;第二种,VLM-as-grounder,将观察结果转化为符号谓词,用作现成规划器的初始状态。这两种方法都忽略了规划过程中的不确定性,从而损害了鲁棒性。我们引入第三种范式,VLM-as-probabilistic-grounder,这是一种新方法,它捕获VLM谓词接地的不确定性,作为符号状态上的概率分布。这使得在信念空间中进行规划成为可能,并在不确定性下产生稳健的计划。在模拟家庭机器人环境中的实验表明,与确定性接地相比,该方法在鲁棒性和任务成功率方面有所提高,强调了我们的方法如何利用基础模型进行可靠的不确定性下规划。
查看原文
查看缓存全文

缓存时间: 2026/09/16 09:05

# 通过概率接地连接学习视觉感知与符号信念空间规划  
来源:https://arxiv.org/html/2609.16884 \\jmlrpages Guy AzranEmail:[guy\.azran@campus\.technion\.ac\.il](mailto:[email protected])所属机构:Technion - Israel Institute of Technology计算机科学系Taub学院与Technion - Israel Institute of Technology数学系、Technion - Israel Institute of Technology计算机科学系Taub学院Sarah KerenEmail:[sarahk@cs\.technion\.ac\.il](mailto:[email protected])所属机构: ###### 摘要 在部分可观测环境中,智能体必须在没有完整世界状态信息的情况下行动,并依赖不确定的状态估计管道。在这种不确定性下获取接地且可验证的符号规划仍是一项关键挑战。近期研究通过整合vlm (https://arxiv.org/html/2609.16884#id2)来桥接感知与符号推理,主要遵循两种范式。第一种,vlm (https://arxiv.org/html/2609.16884#id2)作为规划器,将图像直接映射为动作序列;第二种,vlm (https://arxiv.org/html/2609.16884#id2)作为接地器,将观测接地为符号谓词,作为现成规划器的初始状态。两种方法都忽略了规划过程中的不确定性,损害了鲁棒性。我们引入了第三种范式——vlm (https://arxiv.org/html/2609.16884#id2)作为概率接地器——这是一种新方法,它将vlm (https://arxiv.org/html/2609.16884#id2)谓词接地的不确定性捕获为符号状态上的概率分布。这使得在信念空间中进行规划成为可能,并在不确定性下生成鲁棒计划。在模拟家庭机器人环境中的实验表明,与确定性接地相比,我们的方法在鲁棒性和任务成功率方面均有提升,突显了基础模型如何用于不确定性下的可靠规划。 ††年份:2026††会议记录:: 预印本††研讨会:已被NeuS 2026接收###### 关键词 不确定性下的规划、视觉-语言模型、鲁棒决策 ## 1引言 \\subfigure\[“将书放到书架”\]参见图注\\subfigure\[“将碗放到水槽”\]参见图注 图1:ViPlan家庭基准测试中两个任务的观测(Merler等人,2025 (https://arxiv.org/html/2609.16884#bib.bib21))。机器人应用由于感知和动作结果中固有的不确定性而仍然具有挑战性。许多传统框架采用cwa (https://arxiv.org/html/2609.16884#id1)(Reiter,1981 (https://arxiv.org/html/2609.16884#bib.bib29)),将未知的事实视为假,并依赖手工制作的、特定任务的解决方案(Wertheim等人,2024 (https://arxiv.org/html/2609.16884#bib.bib33);Moreno等人,2024 (https://arxiv.org/html/2609.16884#bib.bib22);Rana等人,2023 (https://arxiv.org/html/2609.16884#bib.bib28);Garrett等人,2020 (https://arxiv.org/html/2609.16884#bib.bib8))。最近,vlm (https://arxiv.org/html/2609.16884#id2)已被纳入从视觉观测中推断任务相关信息,从而实现更具通用性和灵活性的规划系统(Zhang等人,2024 (https://arxiv.org/html/2609.16884#bib.bib36);Hu等人,2023 (https://arxiv.org/html/2609.16884#bib.bib13))。Merler等人(2025)(https://arxiv.org/html/2609.16884#bib.bib21)区分了两种用于vlm (https://arxiv.org/html/2609.16884#id2)规划集成的范式:vlm (https://arxiv.org/html/2609.16884#id2)作为规划器,其中vlm (https://arxiv.org/html/2609.16884#id2)直接从视觉输入生成计划;以及vlm (https://arxiv.org/html/2609.16884#id2)作为接地器,其中vlm (https://arxiv.org/html/2609.16884#id2)提供符号谓词,现成规划器使用这些谓词来计算计划。这些方法忽略了视觉接地中固有的不确定性,并将vlm (https://arxiv.org/html/2609.16884#id2)预测视为确定性的。在感知嘈杂且模糊的家庭机器人等领域,这是无效的,在这些领域中,当模糊性和缺失信息导致错误的谓词分配时,生成确定性计划可能会失败。 \\cref fig:example展示了两个任务,由于误导性的vlm (https://arxiv.org/html/2609.16884#id2)预测和部分可观测性,说明了规划的不确定性。在\\creffig:example:radio中,机器人必须将一本书放到目标书架上,而书架在画面之外。一台收音机出现在机器人夹爪后面,但vlm (https://arxiv.org/html/2609.16884#id2)认为它正拿着书。机器人计划导航到书架,在那里它将意识到错误,从而触发重新规划。在\\creffig:example:kitchen中,机器人必须将一个隐藏的碗带到水槽。vlm (https://arxiv.org/html/2609.16884#id2)没有迹象表明碗在橱柜里,因此它将反复计划导航到看不见的碗,永远无法完成任务。机器人可以通过维护对可能世界状态(例如,书在手中或不在手中,或者碗在橱柜里或不在橱柜里)的信念,并据此规划来解决任务来克服这些挑战。这将使机器人能够以较少的重新规划来解决任务。与此一致,我们提出了sc (https://arxiv.org/html/2609.16884#id11)(sc (https://arxiv.org/html/2609.16884#id11)),它利用vlm (https://arxiv.org/html/2609.16884#id2)来指导一个鲁棒的决策过程,而不是盲目信任其输出。我们使用vlm (https://arxiv.org/html/2609.16884#id2)来生成谓词概率,以维护对高级状态的显式信念,并将问题框架为cpp (https://arxiv.org/html/2609.16884#id6)(cpp (https://arxiv.org/html/2609.16884#id6))(Domshlak和Hoffmann,2006 (https://arxiv.org/html/2609.16884#bib.bib5))。这在保留符号接地可解释性改进的同时,产生了更鲁棒的计划。我们工作的贡献如下: 1. 1\.我们引入了vlm (https://arxiv.org/html/2609.16884#id2)作为概率接地器,这是一种新的vlm (https://arxiv.org/html/2609.16884#id2)规划范式,它利用流词级概率,而不是脆弱的确定性接地或直接动作生成。 2. 2\.我们将rvp (https://arxiv.org/html/2609.16884#id10)(rvp (https://arxiv.org/html/2609.16884#id10))问题形式化,为视觉机器人领域中的部分可观测性和感知不确定性下的规划提供了原则性定义。 3. 3\.我们提出了sc (https://arxiv.org/html/2609.16884#id11),一个鲁棒的视觉任务规划器,它维护一个源自基于vlm (https://arxiv.org/html/2609.16884#id2)概率的符号信念,并将其编译为cp (https://arxiv.org/html/2609.16884#id5)(cp (https://arxiv.org/html/2609.16884#id5))问题。 4. 4\.我们开发了一个理论上合理的规划-执行循环,对正确性和安全性提供了保证,包括在vlm (https://arxiv.org/html/2609.16884#id2)足够准确和有用的条件下。我们在ViPlan-HH基准测试(Merler等人,2025 (https://arxiv.org/html/2609.16884#bib.bib21))上评估了我们的方法,该基准测试包含各种家庭场景中的多个机器人规划任务。我们的实验表明,sc (https://arxiv.org/html/2609.16884#id11)的鲁棒计划使机器人能够在其他方法失败的不确定性下解决复杂任务。 参见图注 图2:vlm (https://arxiv.org/html/2609.16884#id2)作为接地器(上)和vlm (https://arxiv.org/html/2609.16884#id2)作为规划器(下) 参见图注 图3:sc (https://arxiv.org/html/2609.16884#id11)(sc (https://arxiv.org/html/2609.16884#id11))流程 ## 2背景与相关工作 我们的方法基于利用预训练vlm (https://arxiv.org/html/2609.16884#id2)的力量来回答关于视觉输入的语义查询(Li等人,2022b (https://arxiv.org/html/2609.16884#bib.bib18);Radford等人,2021 (https://arxiv.org/html/2609.16884#bib.bib27);Li等人,2019 (https://arxiv.org/html/2609.16884#bib.bib17))。令OO为可能图像观测的集合,令V\\mathcal\{V\}为称为词汇表的文本标记集合。vlm (https://arxiv.org/html/2609.16884#id2)是一个函数φ:O×V∗→\[0,1\]V\\phi:O\\times\\mathcal\{V\}^\{\*\}\\to\[0,1\]^\{\\mathcal\{V\}\},它以图像观测o∈Oo\\in O和文本标记序列(提示)x=⟨v1,...,vn⟩∈V∗x=\\left\\langle v_\{1},\\ldots,v_\{n}\\right\\rangle\\in\\mathcal\{V\}^\{\*\}作为输入。其输出是对序列中下一个标记的预测。通过迭代地将预测的标记插入提示,vlm (https://arxiv.org/html/2609.16884#id2)生成以视觉输入为条件的文本输出。最近在vla (https://arxiv.org/html/2609.16884#id3)(vla (https://arxiv.org/html/2609.16884#id3))机器人学中的工作使用视觉和语言输入直接生成低级机器人动作,或支持任务级规划。端到端vla (https://arxiv.org/html/2609.16884#id3)策略将观测和自然语言指令映射为机器人控制(Kim等人,2024 (https://arxiv.org/html/2609.16884#bib.bib15);Duan等人,2024 (https://arxiv.org/html/2609.16884#bib.bib6);Jiang等人,2023 (https://arxiv.org/html/2609.16884#bib.bib14)),而规划循环方法将vlm (https://arxiv.org/html/2609.16884#id2)用作高级规划器或符号接地器(Rana等人,2023 (https://arxiv.org/html/2609.16884#bib.bib28);Zhang等人,2024 (https://arxiv.org/html/2609.16884#bib.bib36);Hu等人,2023 (https://arxiv.org/html/2609.16884#bib.bib13))。在这项工作中,我们专注于后者。 Merler等人(2025)(https://arxiv.org/html/2609.16884#bib.bib21)区分了将vlm (https://arxiv.org/html/2609.16884#id2)集成到规划循环中的两种范式。在vlm (https://arxiv.org/html/2609.16884#id2)作为规划器(如\\creffig:methods:theirs(下)所示)中,模型将图像观测和任务描述直接映射为动作序列(Yang等人,2025 (https://arxiv.org/html/2609.16884#bib.bib34);Duan等人,2024 (https://arxiv.org/html/2609.16884#bib.bib6);Hu等人,2023 (https://arxiv.org/html/2609.16884#bib.bib13))。在vlm (https://arxiv.org/html/2609.16884#id2)作为接地器(如\\creffig:methods:theirs(上)所示)中,模型为接地的任务流词分配布尔值,符号规划器从所得状态估计进行规划(Azran等人,2025 (https://arxiv.org/html/2609.16884#bib.bib1);Liang等人,2024 (https://arxiv.org/html/2609.16884#bib.bib19);Chen等人,2024 (https://arxiv.org/html/2609.16884#bib.bib3);Ding等人,2024 (https://arxiv.org/html/2609.16884#bib.bib4);Zhang等人,2024 (https://arxiv.org/html/2609.16884#bib.bib36))。这两种范式通常都承诺一个单一的vlm (https://arxiv.org/html/2609.16884#id2)输出,而不是在多个合理的符号状态上传播不确定性。我们的方法则提取每个流词的概率,构建符号状态上的信念,选择累积概率至少为θ\\theta的状态,并计算一个对每个所选状态都有效的符合性计划。 这些任务级方法通常使用确定性符号动作模型(Ghallab等人,2004 (https://arxiv.org/html/2609.16884#bib.bib10))。基于接地器的系统将一个接地状态传递给经典规划器,而基于规划器的系统生成用相同符号模型表示的动作序列。这些模型通常使用strips (https://arxiv.org/html/2609.16884#id4)形式体系表示(Fikes和Nilsson,1971 (https://arxiv.org/html/2609.16884#bib.bib7))。strips (https://arxiv.org/html/2609.16884#id4)将规划问题定义为一个元组⟨F,I,A,G⟩\\left\\langle F,I,A,G\\right\\rangle,其中FF是表示世界状态的流词集合,II是初始状态,AA是一组动作(操作符),它们具有决定其适用性的前置条件,并可以通过其效果改变状态,G⊆FG\\subseteq F是目标条件。虽然通常使用经典规划算法并在出现意外结果时重新规划(Yoon等人,2007 (https://arxiv.org/html/2609.16884#bib.bib35)),但在重新规划代价高昂甚至不可能的环境中,这是非常无效的。例如,机器人可能需要与外部计算源通信进行规划,由于连接不良或没有连接,这可能花费很长时间甚至失败。在光谱的另一端,*cp (https://arxiv.org/html/2609.16884#id5)*(Palacios和Geffner,2009 (https://arxiv.org/html/2609.16884#bib.bib26);Smith和Weld,1998 (https://arxiv.org/html/2609.16884#bib.bib31))通过生成保证从任何可能初始状态实现目标的计划来解决部分可观测性下的规划问题。在cp (https://arxiv.org/html/2609.16884#id5)中,智能体必须找到一个从称为*信念集*的一组可能状态(记为bIb^\{I\})实现目标的计划。*cpp (https://arxiv.org/html/2609.16884#id6)*(Domshlak和Hoffmann,2006 (https://arxiv.org/html/2609.16884#bib.bib5))通过用可能状态上的概率分布β:2F→\[0,1\]\\beta:2^\{F\}\\rightarrow\[0,1\](称为*信念状态*或*信念*)替换信念集来扩展此框架。cpp (https://arxiv.org/html/2609.16884#id6)的目标是找到一个以某个阈值概率θ\\theta实现目标的计划。我们的工作基于cpp (https://arxiv.org/html/2609.16884#id6),利用vlm (https://arxiv.org/html/2609.16884#id2)根据视觉观测定义和更新信念,允许在视觉丰富的环境中进行更明智的不确定性下的规划。我们使用来自Taig和Brafman(2013)(https://arxiv.org/html/2609.16884#bib.bib32)的见解以及现成的符合性规划器(Maliah等人,2022 (https://arxiv.org/html/2609.16884#bib.bib20);Shani和Brafman,2011 (https://arxiv.org/html/2609.16884#bib.bib30);Palacios和Geffner,2009 (https://arxiv.org/html/2609.16884#bib.bib26))来寻找鲁棒计划。 ## 3问题表述 我们旨在构建从原始视觉输入接地符号推理的感知-动作管道。这些管道应生成满意的任务级计划,尽管存在传感器噪声、遮挡和部分可观测性,这些计划仍然有效。因此,我们为在复杂、部分可观测环境中运行的智能体表述了*rvp (https://arxiv.org/html/2609.16884#id10)*。此后,我们专注于一个具身机器人智能体,并将其称为机器人。在rvp (https://arxiv.org/html/2609.16884#id10)中,机器人必须通过机载传感器(例如,摄像头、深度传感器、本体感觉)感知世界,从原始视觉输入推断符号状态信息,并选择要执行的高级动作。这些动作被表示为*技能*,即由低级运动控制器实现的机器人动作。我们将问题形式化为一个元组⟨F,A,G,W,O,M,ξ⟩\\left\\langle F,A,G,W,O,M,\\xi\\right\\rangle,它在符号任务模型的基础上增加了连续配置空间、观测模型和随机技能执行。每个组件捕捉了机器人智能体感知-动作层次结构的一层: - •FF、AA和GG定义了符号任务空间,遵循strips (https://arxiv.org/html/2609.16884#id4)(Fikes和Nilsson,1971 (https://arxiv.org/html/2609.16884#bib.bib7))。 - •WW代表机器人工作空间,包含场景中机器人和可操作对象的所有可行连续配置。工作空间配置w∈Ww\\in W编码了机器人的关节位置、对象姿态和环境状态。 - •OO表示机器人可用的观测空间,例如RGB-D或多视角相机图像。 - •M:W→ΔOM:W\\to\\Delta O是观测模型。

相似文章

迈向基于信念的LLM智能体世界模型

arXiv cs.AI

本文提出基于信念的世界模型(BB-WMs),旨在通过直接访问关于不确定状态的信念,提升LLM智能体在部分可观测环境中的决策性能,并展示任务表现的改善。