从求解器反馈到忠实计划:基于多角色强化学习的符号规划

arXiv cs.AI 论文

摘要

本文提出了一种利用求解器反馈的多角色强化学习框架,用于将自然语言转换为PDDL规范以进行符号规划,与现有方法相比,提高了成功率和忠实度。

arXiv:2608.21897v1 公告类型:新 摘要:可靠的规划需要将自然语言指令转换为可执行的符号规范,但大型语言模型在缺乏昂贵的PDDL标注时仍然脆弱,并可能以语义上不忠实的方式利用求解器成功。我们研究如何仅使用求解器反馈来学习忠实的自然语言到PDDL形式化,无需人工编写的示范。我们提出了一种基于求解器的多角色强化学习框架,其中单一语言模型充当Actor、Judge和Editor,用于生成、验证和修复。Actor提出PDDL规范,Judge提供校准过的求解器质量信号,Editor执行有界的诊断条件化精修。在PlanBench上,我们的方法将平均成功率从LLM+P的35.5%提高到70.8%,实现了66.3%的忠实成功率,并将语义漂移降低到6.4%。这些结果表明,将求解器反馈组织为生成、验证和修复角色,能够实现更可扩展和忠实的无标注符号规划
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:29

# 从规划器反馈到忠实计划:用于符号规划的多角色强化学习  
来源:https://arxiv.org/html/2608.21897  

###### 摘要  
可靠的规划需要将自然语言指令转化为可执行的符号规范,然而大型语言模型在缺乏昂贵的 PDDL 注释时仍然表现脆弱,并且可能以语义不忠实的方式利用规划器的成功结果。我们研究如何仅利用规划器反馈来学习忠实的自然语言到 PDDL 的形式化转换,无需人工编写的示范。我们提出了一个基于规划器的多角色强化学习框架,其中单个语言模型同时扮演执行者、评判者和编辑者,分别负责生成、验证和修复。执行者提议 PDDL 规范,评判者提供与规划器校准的质量信号,编辑者在诊断条件约束下执行有限修复。在 PlanBench 基准测试中,我们的方法将平均成功率从 LLM+P 的 35.5% 提高到 70.8%,实现了 66.3% 的忠实成功率,并将语义偏移降低至 6.4%。这些结果表明,将规划器反馈组织为生成、验证和修复的角色,能够实现更具扩展性和忠实性的无注释符号规划。

††脚注:1宾夕法尼亚大学。††脚注:2无隶属机构。††脚注:3佐治亚理工学院。††脚注:4佩斯大学。

## 1 引言  
结构化规划是智能智能体的核心能力之一,它必须在约束条件下将高层指令转化为可执行的动作模型。这一能力对机器人技术、工作流自动化、物流和交互式决策至关重要,因为其成功不仅取决于生成合理的语言表述,还取决于满足明确的状态转移语义。大型语言模型(LLMs)已展现出令人印象深刻的通用推理和指令遵循能力(Brown et al. 2020 (https://arxiv.org/html/2608.21897#bib.bib1); OpenAI 2024 (https://arxiv.org/html/2608.21897#bib.bib14); Touvron et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib24); Lin et al. 2026 (https://arxiv.org/html/2608.21897#bib.bib10)),但可靠的规划仍然困难,因为有效的计划需要逻辑一致性、长期状态追踪以及对任务约束的忠实关联。近期的基准测试越来越清晰地揭示了这一局限性。PlanBench 表明,LLMs 在经典规划领域经常失败,尤其是在谓词名称被混淆且表面词汇线索被移除时(Valmeekam et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib25))。这支持了一个更广泛的观点:LLMs 通常表现为近似检索器而非系统性的状态转移规划器(Kambhampati et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib8))。即使是推理增强模型和链式思维提示在特定规划扰动下仍然脆弱,表明流畅的中间推理并不等同于可执行的规划(Stechly et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib22); Valmeekam et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib26))。NATURAL PLAN 进一步表明,随着约束复杂度增加,真实的自然语言规划难度急剧上升,且自我纠正并不能可靠地恢复有效解决方案(Zheng et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib33))。一种有前景的应对方法是将 LLMs 不直接用作规划器,而是用作形式化器,将自然语言任务转换为符号表示,例如规划领域定义语言(PDDL),然后由外部规划器执行实际的规划。LLM+P 通过将搜索委托给经典规划器,展示了这种神经-符号分解的价值(Liu et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib11)),后续工作则探索了 PDDL 目标翻译、广义规划程序以及环境辅助的 PDDL 构建(Xie et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib29); Silver et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib20); Mahdavi et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib13))。然而,这些方法仍面临一个根本性的监督瓶颈:高质量的自然语言到 PDDL 形式化通常需要精心整理的示范、固定的领域假设或有监督的初始化。像 PDDL-Instruct 这样的指令微调方法提高了符号规划的性能,但它们对注释样本的依赖限制了向新领域和语言分布的可扩展性(Verma et al. 2025 (https://arxiv.org/html/2608.21897#bib.bib27))。  

参考图表 图 1:单一大脑三角色框架。单个 LLM 扮演执行者、评判者和编辑者,共享参数,并由确定性 PDDL 规划器反馈进行关联。  

更深层次的挑战在于,仅凭规划器反馈并不能自动成为忠实的学习信号。PDDL 规划器可以验证生成的规范在语法上是否有效且可执行,但规划器的成功是针对生成的形式规范定义的,而非原始的自然语言意图。因此,仅针对规划器成功进行优化可能会奖励那些定义不足或语义偏移的形式化方案——这些方案易于求解,但不再忠实于任务。这就在无注释学习与语义忠实性之间产生了高层冲突:前者要求用环境反馈替代人工标签,而后者要求防止模型利用该反馈中的缺陷或歧义。类似的担忧也出现在更广泛的强化学习环境中,当奖励未能完全捕获预期目标时,针对代理奖励的优化可能引发奖励利用行为(Skalse et al. 2022 (https://arxiv.org/html/2608.21897#bib.bib21))。  

本文探讨的问题是:*LLM 能否仅从规划器反馈中学习可靠的符号规划,而无需任何人工注释的 PDDL 示范?* 我们通过将符号求解器视为唯一的关联预言机,同时围绕生成、验证和修复来组织学习,来解决这个问题。总体而言,模型不仅学习生成候选形式规范,还学习评估与规划器关联的正确性,并利用可执行的诊断信息修复失败的规范,从而将稀疏的规划器结果转化为更丰富的训练过程。我们提出了基于规划器的多角色强化学习,这是一个用于自然语言到 PDDL 规划的零注释框架。单个 LLM 被条件化以扮演三个协调的角色:提议形式规范的执行者、学习与规划器校准质量信号的评判者,以及根据求解器诊断进行有限修复的编辑者。这种设计既保持了仅依赖规划器监督的可扩展性,又降低了优化陷入纯粹面向规划器的捷径的风险。我们的贡献如下:  
- • 我们识别了无注释符号规划中的一个关键障碍:原始的规划器成功是必要但不充分的学习信号,因为它可能偏离对原始自然语言任务的语义忠实性。这将 NL-to-PDDL 学习重新定义为在潜在规范偏移下的基于规划器关联的优化问题。  
- • 我们引入了一个多角色强化学习框架,其中生成、验证和修复从确定性规划器反馈中联合学习,无需人工注释的 PDDL 示范。共享角色设计使得验证器协同进化和基于诊断的条件化修复成为可能,同时保持大部分模型参数在角色间耦合。  
- • 跨越 PlanBench 各领域,我们的方法取得了强劲的域内规划成功率,包括在混淆和结构性挑战设置上的显著提升。它还能零样本迁移到 ProntoQA 和 NATURAL PLAN,表明基于规划器的多角色学习不仅提升了特定基准的 PDDL 合成能力,还改善了更广泛的规划和约束满足行为。  

## 2 相关工作  
##### LLM 作为规划器。  
第一类研究探讨仅通过扩展和提示是否足以实现规划。链式思维和基于搜索的推理可以改进中间推理(Wei et al. 2022 (https://arxiv.org/html/2608.21897#bib.bib28); Yao et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib30); Hao et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib5)),但规划基准测试表明,流畅的推理并不能保证可执行的状态转移推理。PlanBench 及后续分析揭示了文本合理性与有效规划行为之间的巨大差距,尤其是在谓词混淆、更长时间跨度和推理模型变体下(Valmeekam et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib25); Kambhampati et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib8); Stechly et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib22); Valmeekam et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib26))。NATURAL PLAN 进一步表明,随着约束变得复杂,真实的语言规划性能急剧下降(Zheng et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib33))。这些工作推动了可执行关联的评估,而我们则使用规划器反馈作为训练信号,通过与符号验证器的重复交互来优化规划能力。  

##### LLM 作为形式化器与神经符号规划。  
第二类研究从直接计划生成转向诱导求解器可以处理的形式表示。LLM+P 通过将自然语言转换为 PDDL、调用经典规划器并言语化生成的计划,展示了这一范式(Liu et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib11));后续工作研究了目标翻译、广义规划程序、领域生成和文本到 PDDL 的评估(Xie et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib29); Silver et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib20); Oswald et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib15); Zuo et al. 2025 (https://arxiv.org/html/2608.21897#bib.bib35); Zhang et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib31))。近期研究表明,LLM 作为形式化器可以优于直接规划,但在语义遗漏、自然性偏移和大型形式结构上的扩展失败方面仍存在问题(Huang and Zhang 2025 (https://arxiv.org/html/2608.21897#bib.bib6); Jiang et al. 2026 (https://arxiv.org/html/2608.21897#bib.bib7))。像 PDDL-Instruct 这样的监督方法通过注释指令微调提高了性能(Verma et al. 2025 (https://arxiv.org/html/2608.21897#bib.bib27)),而环境交互方法则通过反馈优化 PDDL(Mahdavi et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib13))。相比之下,我们将 NL-to-PDDL 诱导表述为无注释的强化学习,其中执行者生成规范,评判者学习与规划器校准的评分,编辑者执行基于诊断的修复。  

##### 基于反馈的自我改进与可验证奖励。  
第三类研究探索在不依赖密集人工监督的情况下,基于反馈的 LLM 自我改进。Reflexion、Self-Refine、ISR-LLM 和 AdaPlanner 使用批评-修订或环境反馈循环(Shinn et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib19); Madaan et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib12); Zhou et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib34); Sun et al. 2023 (https://arxiv.org/html/2608.21897#bib.bib23)),而 LLM-as-a-judge 方法虽然降低了注释成本,但存在评估者偏差风险,且在缺乏外部关联时可能产生奖励黑客行为(Gu et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib3); Li et al. 2025 (https://arxiv.org/html/2608.21897#bib.bib9))。近期的 RLVR 和自博弈系统表明,可验证的反馈可以扩展推理训练(Shao et al. 2024 (https://arxiv.org/html/2608.21897#bib.bib18); Guo et al. 2025 (https://arxiv.org/html/2608.21897#bib.bib4); Zhao et al. 2025 (https://arxiv.org/html/2608.21897#bib.bib32); Chen et al. 2025 (https://arxiv.org/html/2608.21897#bib.bib2)),但它们主要针对精心设计的任务或代码/数学验证器,并未解决规划器成功与语义忠实性之间的差距。我们的工作将可验证奖励学习引入符号规划,通过将执行者、评判者和编辑者角色关联到确定性 PDDL 规划器,将稀疏的可执行性反馈转化为校准后的验证和修复信号。  

## 3 方法  
图 2:用于 NL-to-PDDL 规划的基于规划器的多角色强化学习。  
单个共享的 LLM 主干被条件化为执行者、评判者和编辑者角色。执行者生成初始 PDDL 规范。确定性 PDDL 规划器验证可执行性,成功时返回成功标签,失败时返回诊断信息。评判者预测校准后的规划器分数,编辑者利用诊断信息执行有限的局部编辑,并将结果反馈给规划器。

### 3.1 任务与基于规划器的环境  
我们研究无需人工注释的自然语言到 PDDL 规范归纳。每个任务是一个自然语言规划描述 \( x \sim \mathcal{P}_{\mathrm{data}} \)。模型输出一个 PDDL 规范 \( y = (y^{\mathrm{dom}}, y^{\mathrm{prob}}) \),由领域文件和问题文件组成。一个确定性 PDDL 环境 \( \mathcal{E} \)(使用 Fast Downward 实现)验证生成的规范并返回 \( (b, d) = \mathcal{E}(y) \),其中 \( b \in \{0, 1\} \) (1) 表示该规范在语法上有效且在时间限制内规划器可执行,\( d \) 包含结构化诊断信息,如解析错误、类型不匹配、未满足的前件、不可达目标以及失败的动作轨迹。核心挑战在于规划器成功与任务级语义忠实性并不等同。因为模型控制着生成的规范,仅优化 \( b \) 可能会奖励那些通过削弱目标、移除约束或修改谓词使实例比原始任务更简单的退化规范。我们的方法保留规划器作为唯一的外部反馈源,但将学习问题分离为生成、校准和修复角色,使稀疏的规划器结果能更有效地用于策略优化。

### 3.2 基于角色的多角色策略  
我们使用一个共享主干参数和轻量级角色特定参数的单一语言模型。令 \( \rho \in \{\mathrm{A}, \mathrm{J}, \mathrm{E}\} \) 表示执行者、评判者和编辑者的角色标识符。每个角色有一个学习的嵌入 \( e_{\rho} \),基于角色的模型定义为 \( \pi_{\theta}(\cdot \mid c, \rho) = \mathrm{LM}_{\theta}\!\left(\cdot \mid [e_{\rho}; c]\right) \) (2),其中 \( c \) 是角色特定的上下文。执行者的上下文是 \( x \),评判者的上下文是 \( (x, y) \),编辑者的上下文是 \( (x, y_t, d_t) \),其中 \( y_t \) 是当前规范,\( d_t \) 是最新的规划器诊断信息。参数划分为 \( \theta = \theta_{\mathrm{sh}} \cup \theta_{\mathrm{A}} \cup \theta_{\mathrm{J}} \cup \theta_{\mathrm{E}} \) (3)。共享主干 \( \theta_{\mathrm{sh}} \) 包含大约 95% 的参数,其余参数是轻量级角色特定头部。这种设计允许每个角色专门化,同时保持大部分表示学习在生成、验证和修复之间耦合。

### 3.3 基于规划器的训练序列  
算法 1 (https://arxiv.org/html/2608.21897#alg1) 总结了一个训练序列。执行者首先采样一个

相似文章

FBOS-RL:反馈驱动的双目标协同强化学习

arXiv cs.LG

本文提出FBOS-RL,一个反馈驱动的双目标协同强化学习框架,通过使用反馈引导的探索和两个相互增强的训练目标——面向利用的策略对齐(EPA)和面向探索的能力培养(ECC)——来提升训练效率和性能上限,优于GRPO在大语言模型对齐和推理中的表现。