PRISM:用于顺序决策的感知与推理交织方法
摘要
本文介绍了 PRISM,这是一个通过动态问答流程整合视觉-语言模型和大语言模型的框架,旨在提升具身 AI 任务中的顺序决策能力。
arXiv:2605.05407v1 公告类型:新论文
摘要:将基于大语言模型的具身智能体从纯文本环境扩展到复杂的多模态环境仍然是一个重大挑战。近期研究指出,独立的视觉-语言模型(VLM)存在感知-推理-决策的鸿沟,往往忽视对任务至关重要的信息。在本文中,我们引入了 PRISM,这是一个通过动态问答(DQA)流程将感知(VLM)与决策(LLM)紧密耦合的框架。大语言模型并非被动接受 VLM 的描述,而是对其进行批判性评估,向 VLM 提出以目标为导向的问题,并综合生成紧凑的图像描述。这种闭环互动产生了对场景的敏锐且以任务为导向的理解。我们在 ALFWorld 和 Room-to-Room (R2R) 基准上对 PRISM 进行了评估。我们证明了:(1) PRISM 显著优于最先进的基于图像模型;(2) 我们的交互式目标导向感知流程带来了系统且显著的增益;(3) PRISM 是完全自动化的,无需人工设计问题或答案。
查看缓存全文
缓存时间: 2026/05/08 08:13
# PRISM:用于序列决策的感知与推理交替
来源: https://arxiv.org/html/2605.05407
Clemence Grislain, Clement Romac, Laure Soulier, Mohamed Chetouani, Olivier Sigaud, Nicolas Thome
###### 摘要
将基于大型语言模型(LLM)的具身智能体从纯文本环境扩展到复杂的多模态设置仍是一项主要挑战。最近的研究指出,独立的视觉-语言模型(VLM)中存在感知-推理-决策差距,这些模型往往忽略任务关键信息。在本文中,我们引入了 **prism**,这是一个通过动态问答(DQA)管道紧密耦合感知(VLM)和决策(LLM)的框架。LLM 不再被动接受 VLM 的描述,而是对其进行批判性评估,用目标导向的问题探询 VLM,并合成紧凑的图像描述。这种闭环交互产生了对场景的尖锐、任务驱动的理解。我们在 ALFWorld 和 Room-to-Room (R2R) 基准上评估了 **prism**。我们表明:(1) **prism** 显著优于最先进的基于图像的模型,(2) 我们的交互式目标导向感知管道带来了系统性和实质性的增益,(3) **prism** 是完全自动化的,消除了对手工制作问题或答案的需求。
机器学习, ICML
## 1 引言
**图 1:prism 交替感知(VLM)和推理(LLM)的图示。** 给定图像和目标,**prism** 的动态问答(DQA)使 LLM 能够向 VLM 查询任务关键信息。这产生了细粒度的、任务驱动的描述(底部),确保准确的动作预测。相反,解耦 VLM 和 LLM 的方法会产生与任务无关的、不完整的描述,导致智能体失败。
具身人工智能领域旨在开发能够感知并与物理世界自主交互的智能体,随着基础模型的出现,该领域已吸引了大量关注。特别是,大型语言模型(LLM)和视觉-语言模型(VLM)在逻辑推理、语义理解和常识知识方面展示了非凡的新兴能力 (Ichter et al., 2023; Zhai et al., 2024; Li et al., 2025)。这自然引发了人们日益浓厚的兴趣,去研究如何将它们作为组成部分集成到与世界交互的具身智能体中。我们的工作研究了如何将它们作为在视觉环境中交互以解决自然语言指令的智能体的组成部分进行整合。先前的研究表明,当提供环境的文本描述时,LLM 可以用于序列决策,无论是零样本 (Yao et al., 2023; Shin et al., 2023) 还是通过微调 (Carta et al., 2023; Wang et al., 2023)。这些方法通常假设完美的感知,即提示包含所有必要信息。然而,从这种理想化的文本过渡到原始视觉输入仍然是一个重大挑战。VLM 处理图像和生成文本的强大能力自然地使它们成为应对这一挑战的候选者 (Alayrac et al., 2022; Liu et al., 2023)。最近的工作探索了两种主要的集成策略:(1) 直接用 VLM 替换 LLM (Zhai et al., 2024; Yang et al., 2024),或 (2) 将 VLM 用作中间感知模块,为决策 LLM 生成文本描述 (Pan et al., 2024; Zhou et al., 2023; Aissi et al., 2025)。然而,性能仍然落后于在文本环境中实现的性能。对于后者,这一差距凸显了当感知(VLM)和决策(LLM)松耦合时,VLM 捕获任务关键的、细粒度视觉信息的能力有限。相比之下,在人类中,感知和决策是紧密交织的,其中感官输入优先处理对当前目标至关重要的信息 (Gibson, 1986)。为了模仿这种交互性,最近的工作提出了引入从决策到感知的反馈机制,使用人类澄清或问答 (Gao et al., 2022; Shen et al., 2024; Long et al., 2023)。然而,感知和推理在决策中的集成是通过朴素的解决方案实现的,例如,仅仅是文本交互的拼接。更重要的是,这些方法依赖于预定义的问题或答案,限制了它们在现实环境中的适用性。
在本文中,我们引入了 **prism**<sup>1</sup>:<sup>1</sup>代码可以在 [这里](https://github.com/sal1717lim/PRISM-Perception-Reasoning-Interleaved-for-Sequential-Decision-Making) 找到。
**P**erception and **R**easoning **I**nterleaved for **S**equential **M**aking (**prism**)。**prism** 通过动态问答(DQA)机制在感知和决策之间建立了紧密的耦合。感知模块(VLM)提供初始场景描述,决策模块(LLM)根据目标对其进行批判以识别和查询缺失的信息。一旦 VLM 响应,LLM 将交互反馈合成为一个紧凑的、任务驱动的描述。如图 1 所示,**prism** 的交替推理产生了比解耦 VLM 和 LLM 模块的方法 (Zhou et al., 2023; Pan et al., 2024; Aissi et al., 2025) 更优越的任务导向描述。
我们的贡献可以总结如下:
* **动态问答 (DQA)**:DQA 紧密耦合感知和决策,并将交互反馈合成为一个紧凑的文本场景描述。关键是,**prism** 的 DQA 是完全自动化的,消除了对不切实际的手工制作或神谕标注的需求。
* **使用 prism 架构的高效训练**:通过 DQA 将感知与决策分离,使得可以使用基于文本的强化学习(RL)的成熟方案,同时通过在视觉环境中的在线交互有效地 grounding 决策。
* **广泛的实验**:在 ALFWorld (Shridhar et al., 2021) 和 Room-to-Room (R2R) (Anderson et al., 2018) 上的实验表明,**prism** 显著优于当前的基于图像的模型。我们证明了两个基准中 DQA 的一致增益,并提供了丰富的分析,验证了生成的问题、答案和描述。
**图 2:PRISM 框架:** 智能体处理目标 $g$ 和图像观测 $o^{\{t\}}$ 以执行动作 $a^{\{t\}}$。
(a) **交互式目标导向感知**:VLM 和 LLM 通过动态问答 (DQA) 协作以细化场景理解:(1) VLM 提供初始描述 $d_i^{\{t\}}$;(2) LLM 生成目标相关问题 $\mathcal{Q}^t$;(3) VLM 为每个问题 $q_i^{\{t\}} \in \mathcal{Q}^t$ 提供具体答案 $\lambda_i^{\{t\}}$;以及 (4) LLM 将这些合成为最终描述 $d_f^{\{t\}}$。
(b) **决策**:相同的 LLM,增强有用于动作生成的 LoRA 适配器,接收 $d_f^{\{t\}}$、目标 $g$ 和历史 $\mathcal{H}$ 以生成在环境中执行的动作 $a^{\{t\}}$。
## 2 相关工作
### 2.1 视觉序列决策
为了实现从视觉输入到目标,基于 VLM 的智能体已被探索。由于零样本通用 VLM 往往缺乏足够的 grounding,最近的研究转向 RL 微调,例如 RL4VLM (Zhai et al., 2024)。然而,如引言中所讨论并在我们的实验(第 4 节)中所示,这些智能体的性能显著低于提供完美文本描述的 LLM (Yang et al., 2024)。这种差异凸显了当前 VLM 的有限决策能力,以及直接将 vanilla RL——对基于文本的输入非常有效 (Carta et al., 2023; Wang et al., 2023)——应用于视觉序列决策的难度。
进一步的努力被用于设计结合 VLM 和 LLM 的架构,以利用它们的互补优势。通常,VLM 描述视觉场景,而 LLM 选择动作。此类系统在导航 (Anderson et al., 2018; Zhou et al., 2023; Pan et al., 2024; Zhang et al., 2025) 和交互环境(例如,VIPER (Aissi et al., 2025))中显示出了前景。然而,在这些方法中,感知和决策仍然 largely 解耦:VLM 独立于智能体的推理运行,经常忽略与任务相关的视觉细节(见图 1)。我们采用这种模块化架构,使用 VLM 进行感知,LLM 进行动作选择,但引入了一个动态问答(DQA)机制,该机制紧密耦合感知和决策。
### 2.2 具身智能体中的交互式问答
提问是获取缺失信息的强大机制 (Testoni and Fernández, 2024),使智能体能够细化其环境理解以进行有效的序列决策。先前的工作使智能体能够查询外部来源,如人类或神谕,如 DialFRED (Gao et al., 2022) 或 (Nguyen et al., 2022; Chen et al., 2023),但通常依赖于预定义的问题和访问准确的神谕,限制了在现实世界环境中的适应性和自主性。最近的工作如 Long et al. (2023) 和 DiscussNAV (Shen et al., 2024) 允许智能体查询基于 VLM 的感知模块。然而,这些系统仍然依赖于固定的、预定义的问题。此外,在 DiscussNAV 中,答案仅仅是与场景描述拼接,创建了长且嘈杂的提示,阻碍了决策。相比之下,**prism** 利用 LLM 将 DQA 交互合成为紧凑的、任务驱动的提示,适合微调,包括使用 RL。我们证明,**prism** 在 R2R 中优于 DiscussNAV,架构更简单,且不依赖神谕问题或答案。
## 3 方法
### 3.1 问题陈述
我们考虑一个目标条件的部分可观测马尔可夫决策过程 $M=(S, A, T, R, G, O, \gamma)$,具有状态空间 $S$,确定性转移函数 $T: S \times A \mapsto S$,目标条件奖励 $R: S \times G \mapsto \mathbb{R}$,以及折扣因子 $\gamma \in [0, 1)$。我们假设一个多模态设置,其中动作 $a^t \in A$ 和目标 $g \in G$ 是文本命令和指令。给定语言词汇 $V$ 和最大序列长度 $N$,我们有 $A$ 和 $G \in V^N$。状态观测 $o^t = O(s^t)$ 是 $\mathbb{R}^{3 \times H \times W}$ 中的 RGB 图像,其中 $H \times W$ 是图像尺寸。给定初始视觉观测 $o^0$ 和目标 $g$,我们希望找到策略 $\pi_\theta: \mathbb{R}^{3 \times H \times W} \times G \mapsto A$,以最大化沿其轨迹获得的折扣奖励总和。
### 3.2 PRISM 架构
我们提出了 **prism**(见图 2),一种将 VLM 和 LLM 集成在两个不同阶段的架构:**交互式目标导向感知** 和 **决策**。在交互式目标导向感知阶段,系统生成中间文本场景表示 $d_f^{\{t\}}$。我们设计了一个交互循环,利用预训练的 VLM 和 LLM 知识来获取 $d_f^{\{t\}}$,其中包含决策所需的信息。更具体地说,为了缓解 VLM 提供决策描述的能力有限的问题 (Zhang et al., 2025),我们引入了一种迭代通信过程,其中 LLM 识别 VLM 初始描述中相对于目标的信息差距,并向 VLM 查询特定细节。然后,LLM 综合响应以更新环境上下文,在反馈交互步骤后生成精炼的最终表示 $d_f^{\{t\}}$。对于决策,前一步骤中使用的相同 LLM 作为策略,增强有经过训练用于动作生成的 LoRA 适配器 (Hu et al., 2021)。给定描述 $d_f^{\{t\}}$、目标和交互历史,该模块生成下一个动作 $a^t \in \mathcal{A}$ 以实现目标 $g$。
**带有 VLM 和 LLM 的交互式目标导向感知:** 严格解耦感知与推理的标准模块化感知-决策方法,如 Pan et al. (2024); Aissi et al. (2025) 所提出的,通常会产生带有缺失关键信息的通用场景描述(见图 2(a))。相反,简单地为目标模块提供目标引入了幻觉的高风险,这显著恶化了下游性能,正如我们的实验所示(见第 4.4 节)。为了克服这一点,我们作为感知模块的 VLM ($\mathcal{V}_P$) 和作为推理模块的 LLM ($\mathcal{R}$) 之间引入了一个动态问答(DQA)阶段,以检索缺失的、任务关键的信息。
在每个时间步 $t$,智能体接收视觉观测 $o^{\{t\}}$。感知模块 $\mathcal{V}_p$ 首先通过提示固定的与目标无关的指令 $d_p$ 产生初始描述 $d_i^{\{t\}}$,具体为 $d_p = \textit{"Describe the scene in detail"}$:
$$
d_i^{\{t\}} = \mathcal{V}_p(d_p, o^{\{t\}}). \quad (1)
$$
推理模块 $\mathcal{R}$ 生成一组问题 $\mathcal{Q}^t$,以适应目标 $g$ 和初始描述 $d_i^{\{t\}}$ 之间的信息差距:
$$
\mathcal{Q}^t = \{q_1^t, \dots, q_n^t\} = \mathcal{R}(d_i^{\{t\}}, g). \quad (2)
$$
然后,感知模块 $\mathcal{V}_p$ 被每个问题 $q_j^t \in \mathcal{Q}^t$ 查询...相似文章
PRISM:面向共情口语对话的韵律集成多智能体推理框架
PRISM 是一个多智能体框架,通过将语音感知、响应生成和语音合成解耦,并结合韵律线索与大语言模型推理及外部知识工具,以提升共情口语对话的质量。
PRISM: 程序化时空推理基准
PRISM是一个大规模基准,包含10,372个人工校准的指令-代码对,用于评估程序化视频生成,并采用了一个漏斗式框架,包含四个指标。对七个大型语言模型的评估揭示了代码可执行性与空间一致性之间存在显著差距。
PRISM:面向企业对话式AI的基于迭代模拟与监控的提示可靠性框架
PRISM是一个闭环框架,将提示工程视为企业对话式AI的持续可靠性问题。它自动执行测试生成、模拟、评估和修复,实现了99%的可靠性,并将编写时间从几天缩短到几分钟。
PRISM:通过结构化多模态数据合成实现优先级感知的规则内化
本文介绍了PRISM,一个用于训练多模态大语言模型遵循优先级规则的四阶段数据合成框架,以及PRISM-Eval,一个无需评判者的评估套件。仅用10K样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%提升到30.1%,同时保持了通用基准性能,并且这些提升可迁移到其他开源多模态大语言模型。
PRISM:探究大语言模型幻觉中的推理、指令与源记忆
研究人员提出了 PRISM 诊断基准,该基准将大语言模型(LLM)的幻觉拆解为四个维度(知识缺失/错误、推理错误、指令遵循错误),涵盖三个生成阶段(记忆、指令、推理),并通过评估 24 款大语言模型,揭示了各类缓解策略之间存在的权衡关系。