GraphThink:面向长时程具身任务规划的图增强LLM思维

arXiv cs.AI 论文

摘要

GraphThink 是一个将任务图与场景图相结合的框架,旨在增强基于LLM的长时程具身任务规划,在ALFRED基准上取得了最先进的结果,并提升了泛化能力和闭环重规划能力。

arXiv:2608.07905v1 公告类型:新 摘要:使用基于LLM规划器的具身智能体常常面临物理幻觉、对长时程任务泛化能力差以及缺乏环境感知等问题。我们提出了GraphThink,一种新颖的框架,它集成了任务图以提供结构化知识实现稳健规划,以及场景图以维护环境记忆实现事件驱动的重规划。具体来说,任务图通过上下文提示和迭代优化引导LLM思考,有效缓解规划幻觉。此外,在GRPO框架内,任务图提供了精细的奖励设计来训练LLM规划器,增强了长时程规划能力并提高了泛化性。最后,由场景图驱动的事件驱动重规划模块实现了闭环环境感知和错误纠正。GraphThink在ALFRED基准上取得了最先进的性能。特别是,我们的高层规划器在验证集和保留的长时程任务上均超过了领先的基于API的LLM,凸显了其强大的零样本和少样本能力。额外的评估进一步证明了其对新型任务和环境具有强大的分布外泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/08/11 08:04

# GraphThink:图增强的 LLM 思考用于长时程具身任务规划  
来源:https://arxiv.org/html/2608.07905

陈立1,3,程思杰4,6,张跃林1,3,李俊熙5,黄茂植1,3,刘洋4,黄文炳🖂1,2,3  
🖂表示通讯作者:hwenbing@ruc\.edu\.cn\.  
1中国人民大学高瓴人工智能学院,中国北京。  
2北京人工智能研究院,中国北京。  
3大型模型与智能治理研究北京市重点实验室,中国北京。  
4清华大学计算机科学与技术系,中国北京 100084。  
5香港理工大学电气与电子工程系,中国香港特别行政区。  
6RayNeo\.AI,中国深圳。

###### 摘要

使用基于 LLM 的规划器的具身智能体往往面临物理幻觉、对长时程任务泛化能力差以及缺乏环境感知等问题。我们提出了*GraphThink*,这是一个新颖的框架,集成了用于提供结构化知识以支持稳健规划的*任务图*,以及用于维护环境记忆以支持事件驱动重规划的*场景图*。具体而言,任务图通过上下文提示和迭代细化引导 LLM 思考,从而有效缓解规划幻觉。此外,在 GRPO 框架内,任务图还提供了精细的奖励设计来训练 LLM 规划器,增强长时程规划能力并提升泛化性能。最后,由场景图驱动的事件驱动重规划模块实现了闭环环境感知和错误纠正。GraphThink 在 ALFRED 基准上达到了最先进的性能。特别是,我们的高层规划器在验证集和预留的长时程任务上均超越了领先的基于 API 的 LLM,凸显了其强大的零样本和少样本能力。额外的评估进一步展现了其对新颖任务和环境的强分布外泛化能力。

## I 引言

针对给定人类指令执行长时程日常任务的具身智能体,相关探索日益增多[47 (https://arxiv.org/html/2608.07905#bib.bib33),17 (https://arxiv.org/html/2608.07905#bib.bib45),20 (https://arxiv.org/html/2608.07905#bib.bib46),4 (https://arxiv.org/html/2608.07905#bib.bib34)]。在具身人工智能领域,指令跟随要求智能体执行三个关键操作:解释自然语言、使用以自我为中心的视觉观察,以及执行物理动作以在环境中导航并交互。一种直接的方法[27 (https://arxiv.org/html/2608.07905#bib.bib27),37 (https://arxiv.org/html/2608.07905#bib.bib28),8 (https://arxiv.org/html/2608.07905#bib.bib35)]是使用带有标注指令和专家低级动作序列的大规模数据集,以端到端监督方式训练智能体。然而,这种范式资源密集:它严重依赖任务特定数据,并且对未见场景的泛化能力较差。相比之下,数据高效的层次化方法[25 (https://arxiv.org/html/2608.07905#bib.bib12),2 (https://arxiv.org/html/2608.07905#bib.bib48),46 (https://arxiv.org/html/2608.07905#bib.bib2),19 (https://arxiv.org/html/2608.07905#bib.bib8)]已作为一种有前景的替代方案出现:高层规划器先将指令分解为子任务,随后低层执行器访问技能库,将这些子任务转换为环境中可执行的动作。近年来,层次化方法越来越倾向于利用大型语言模型(LLM)进行高层规划[1 (https://arxiv.org/html/2608.07905#bib.bib38),34 (https://arxiv.org/html/2608.07905#bib.bib37),30 (https://arxiv.org/html/2608.07905#bib.bib39),38 (https://arxiv.org/html/2608.07905#bib.bib40)],这得益于其强大的语言理解和推理能力。当初始规划失败时,这些模型可以通过将观察到的环境对象作为上下文提示来参与重规划[36 (https://arxiv.org/html/2608.07905#bib.bib9),5 (https://arxiv.org/html/2608.07905#bib.bib5),19 (https://arxiv.org/html/2608.07905#bib.bib8)]。尽管如此,长时程规划仍然是具身智能体面临的一大挑战,存在三个关键局限:(i) 通用 LLM 尽管推理能力强,但缺乏物理基础,导致指令误解、规划幻觉,并随着任务复杂度增加而提高失败率。(ii) 在有限领域内数据上进行监督微调会导致对未见长时程任务的泛化能力差,除非使用极其昂贵的标注。(iii) 许多现有的重规划策略主要针对低级失败触发纠正,容易产生短视决策和低效重试,因为它们缺乏环境感知来检测那些低级动作可执行但与指令不一致的计划。为解决这些挑战,我们提出了*GraphThink*,一个双图增强的闭环规划系统,如图1 (https://arxiv.org/html/2608.07905#S1.F1) 所示。该框架集成了两个核心结构化表示:一个用于提供结构化知识以支持稳健规划的*任务图*,以及一个用于维护环境记忆以支持事件驱动重规划的*场景图*。

*任务图*在高层规划中扮演三个关键角色。首先,它通过将任务图明确纳入提示中来引导 LLM 生成计划。其次,它作为外部验证器,检测规划幻觉并迭代优化子任务序列。最后,我们采用基于任务图的奖励的组相对策略优化(GRPO)[31 (https://arxiv.org/html/2608.07905#bib.bib41)]来增强 LLM 的推理能力。由于具身规划对单一目标允许多种有效解决方案,奖励设计因此变得尤为具有挑战性。任务图通过封装多样的可行路径来解决这一问题,使得奖励信号能够容纳多种有效解决方案。借助这一精细的奖励设计,我们能够促进高层动作空间与指令之间的对齐,从而带来更强的推理和泛化能力。

为了增强 LLM 的环境感知,并在闭环规划过程中纠正指令偏移,我们设计了一个由场景图驱动的事件驱动重规划模块。动态更新的*场景图*充当以任务为中心的记忆模块,将推理聚焦于与任务相关的环境线索。与通常包含大量无关物体的通用场景图[10 (https://arxiv.org/html/2608.07905#bib.bib53),39 (https://arxiv.org/html/2608.07905#bib.bib54)]不同,我们的设计保持图规模可控,过滤噪声,使 LLM 推理更加高效。当低级执行错误触发重规划,或高层子任务完成时进行主动检查时,当前场景图记忆和计划执行进度会被提供给思考中的 LLM,以支持对计划的高效跟踪和调整。为确保重规划质量,所有提议的修订都受任务图约束,以保持可行性。这些组件共同构成一个闭环系统,持续使计划执行与用户意图保持一致。

我们在 ALFRED[33 (https://arxiv.org/html/2608.07905#bib.bib3)](一个具有挑战性的视觉语言导航与交互基准)上评估了 GraphThink。我们的层次化规划框架在官方 ALFRED 排行榜上名列第一。特别地,我们评估了高层规划器的性能,并贡献了一个长时程数据集,以更好地评估长时程泛化能力。结果表明,GraphThink 在验证集和未见长时程基准上均优于多种领先的基于 API 的 LLM,展示了少样本和零样本学习能力。此外,GraphThink 在 AI2-Thor[21 (https://arxiv.org/html/2608.07905#bib.bib61)] 上对新颖动作表现出强泛化能力,并实现了到 VirtualHome[28 (https://arxiv.org/html/2608.07905#bib.bib57)] 的跨环境有效迁移。

图 1:GraphThink 包含三个核心模块:(a) 带任务图的高层规划器生成初始计划,(b) 具备记忆感知的低层策略为每个子任务执行导航和交互动作,(c) 带场景图的动态重规划在执行过程中调整计划。这里的示例展示了在子任务“put(knife, sidetable)”完成时触发的重规划,修订后的子任务变为“pickup(knife)”和“put(knife, dining table)”。

## II 相关工作

**具身智能体的任务规划。** 先前工作[33 (https://arxiv.org/html/2608.07905#bib.bib3),27 (https://arxiv.org/html/2608.07905#bib.bib27),37 (https://arxiv.org/html/2608.07905#bib.bib28),35 (https://arxiv.org/html/2608.07905#bib.bib50)]训练智能体端到端地根据语言指令直接生成低级动作,但它们在长时程任务上的表现仍然有限。近来,层次化或模块化规划[15 (https://arxiv.org/html/2608.07905#bib.bib7),32 (https://arxiv.org/html/2608.07905#bib.bib11),19 (https://arxiv.org/html/2608.07905#bib.bib8)]通过将任务分解为子任务来弥合自然指令与可执行动作之间的鸿沟,已被证明是有效的。早期基于模板的方法[25 (https://arxiv.org/html/2608.07905#bib.bib12),46 (https://arxiv.org/html/2608.07905#bib.bib2)]局限于预定义任务,难以泛化。为解决这一问题,人们开始探索将 LLM 作为高层规划器,要么通过少样本上下文提示[36 (https://arxiv.org/html/2608.07905#bib.bib9),19 (https://arxiv.org/html/2608.07905#bib.bib8)],要么通过在特定数据集上进行监督训练[49 (https://arxiv.org/html/2608.07905#bib.bib4),5 (https://arxiv.org/html/2608.07905#bib.bib5)]。一些工作[14 (https://arxiv.org/html/2608.07905#bib.bib51),36 (https://arxiv.org/html/2608.07905#bib.bib9),18 (https://arxiv.org/html/2608.07905#bib.bib47),19 (https://arxiv.org/html/2608.07905#bib.bib8)]进一步引入重规划机制,通过接受环境反馈来调整动作,对即时错误或预定义状态差异触发局部修正。因此,我们提出了一种事件驱动的动态重规划机制,以同时增强计划的可行性和指令对齐性。

**LLM 的复杂推理。** 为解决复杂的推理任务,思维链(CoT)方法[43 (https://arxiv.org/html/2608.07905#bib.bib22),6 (https://arxiv.org/html/2608.07905#bib.bib29),26 (https://arxiv.org/html/2608.07905#bib.bib23)]提示 LLM 生成中间推理步骤。然而,随着步骤数量增加,错误往往会累积。自我纠正方法[24 (https://arxiv.org/html/2608.07905#bib.bib26),11 (https://arxiv.org/html/2608.07905#bib.bib30)]利用反馈来修正不正确的推理并提高准确性。此外,检索增强生成(RAG)[45 (https://arxiv.org/html/2608.07905#bib.bib32),42 (https://arxiv.org/html/2608.07905#bib.bib24)]和知识图谱[41 (https://arxiv.org/html/2608.07905#bib.bib25),50 (https://arxiv.org/html/2608.07905#bib.bib31)]方法通过集成结构化外部知识来增强推理,提高准确性并减少幻觉。为了通过交互学习进一步提升性能,最近的工作转向了监督微调(SFT)[48 (https://arxiv.org/html/2608.07905#bib.bib20)]和强化学习(RL)[29 (https://arxiv.org/html/2608.07905#bib.bib16)]。在我们的工作中,我们进一步引入了基于任务图的强化学习框架,通过从任务图推导的奖励信号来增强模型的长时程规划能力。

## III 方法

如图1 (https://arxiv.org/html/2608.07905#S1.F1) 所示,GraphThink 主要由三个组件构成:(a) 基于任务图的高层规划;(b) 具备记忆感知的低层动作策略;(c) 带场景图记忆的动态重规划。我们在本节中详细介绍每个组件。

### III-A 基于任务图的高层规划

为了给高层规划提供物理基础,我们引入了一个任务图,用于对子任务转换上的逻辑和可执行性约束进行建模。我们不是仅仅记住训练数据中观察到的轨迹,而是设计了一条自动任务图构建流程,来实例化可行的子任务转换先验,从而为生成可执行的子任务序列提供结构化指导。任务图被集成到高层规划流程的多个阶段:它通过精心设计、包含任务图的提示来引导 LLM 规划;支持 GRPO 中奖励函数的设计;并充当外部验证器,为推理提供反馈。

#### III-A1 任务图构建

具身规划中的子任务通常由于物理前置条件而表现出顺序依赖(例如,`Slice(object)` 通常需要先 `Pickup(knife)`),因此我们将可行的子任务转换表示为一个有向任务图 \(G=(V,E)\\),即 \(\mathcal{G}=(\mathcal{V},\mathcal{E})\),其中节点 \(\mathcal{V}=\{v_i\}_{i=1}^N\) 表示子任务,每条边 \((v_i,v_j)\in\mathcal{E}\) 表示 \(v_j\) 可以在执行 \(v_i\) 之后接着执行。*规划目标*是:给定一条自然语言指令 \(\tau\),高层规划旨在生成一个子任务序列 \(S(\tau)=(s_1,s_2,\dots,s_T)\),引导智能体按指令完成任务。这里,子任务序列应在 \(\mathcal{G}\) 中形成一条可行路径 \(\Pi=(v_1,v_2,\dots,v_T)\),并且 \(s_i\) 中的每个对象都属于环境对象集合 \(\mathcal{O}_{\text{env}}\),该集合包含由预训练目标检测模块识别的所有可见对象。

**子任务作为节点。** 表示子任务的节点 \(v_i\) 记为 \(A_i(o_i)\) 或 \(A_i(o_i,o_j)\),其中 \(A_i\) 表示高层动作,\(o_i,o_j\) 指向相关对象。每个子任务都基于可用的低级技能集进行落地,从而将 LLM 的开放式文本生成映射为机器人可执行的动作。借鉴先前工作[25 (https://arxiv.org/html/2608.07905#bib.bib12),46 (https://arxiv.org/html/2608.07905#bib.bib2)],我们在 ALFRED 基准上的评估使用了 12 个子任务节点,作为高层规划到可执行低级策略的适当粒度。

鉴于子任务–对象对的组合空间巨大,我们采用元类 \(\mathcal{C}\coloneqq\{\texttt{obj},\texttt{rec},\texttt{mov},\texttt{spec}\}\) 来抽象掉具体的对象实例,其中 `obj` 表示可拾取物品,`rec` 表示固定容器,`mov` 表示可移动容器,`spec` 表示某些子任务所需的任务特定操作目标。例如,`spec` 可实例化为:对于 `ToggleObject` 是 Lamp,对于 `CoolObject` 是 Fridge,对于 `HeatObject` 是 Microwave,对于 `CleanObject` 是 SinkBasin。这将规划器的注意力转移到子任务与对象之间的功能匹配上,从而促进在不同环境中具有相似功能的多样对象之间的泛化。在计划生成期间,元类会从环境对象集合 \(\mathcal{O}_{\text{env}}\) 中实例化为具体的对象名称。在执行期间,每个高层子任务会被展开为一个序列化的低级动作策略 a

相似文章