基于实际的NL到PDDL问题生成评估与修复
摘要
本文提出了一种使用LLMs进行自然语言到PDDL翻译的端到端流水线,包含迭代修复和全面评估,突出了基准测试中操作成功与语义忠实性之间的差距。
arXiv:2609.09898v1 Announce Type: new
摘要:大型语言模型(LLMs)在将自然语言(NL)规划描述翻译为PDDL问题实例方面展现出潜力。然而,标准的评估标准如语法有效性或规划器成功可能会大大高估对描述任务的忠实性:生成的问题可能可解析且可解决,但同时错误地表示了预期的初始状态、目标、对象结构或优化目标。本文研究了一种端到端的NL到PDDL流水线,该流水线结合了LLM生成、基于PDDL解析、规划和验证的检查、领域一致性检查器、LLM批评者以及迭代修复。细粒度的修复反馈是从领域描述、生成的问题、自然语言问题描述和操作诊断中构建的。通过与精心策划的基准PDDL问题描述进行基于引用的比较,用于事后基准分析,这些离线检查包括重命名不变的结构匹配和语义等价性(在领域支持可用的情况下)。在Planetarium、AutoPlanBench和精心策划的PDDL~2.1问题中,结果显示操作成功和基准引用重建可能有显著差异。结果还表明结构化修复可能有用,并且PDDL~2.1在引用重建方面仍然具有挑战性,即使操作成功有所提高。
查看缓存全文
缓存时间: 2026/09/11 08:42
# 面向自然语言到PDDL问题生成的基于依据的评估与修复
来源:https://arxiv.org/html/2609.09898
Pedro Santos, Valdemar Oliveira, Romão Silva, L. Miguel Silveira, Bruno Martins
###### 摘要
大型语言模型在将自然语言规划描述翻译为PDDL问题实例方面显示出前景。然而,标准的评估标准(如语法有效性或规划器成功)可能会严重高估对描述任务的忠实度:生成的问题可能是可解析且可解决的,但却错误地表示了预期的初始状态、目标、对象结构或优化目标。本文研究了一个端到端的自然语言到PDDL生成流程,该流程结合了LLM生成、基于PDDL解析、规划和验证的检查、领域一致性检查器、LLM评审器以及迭代修复。根据领域描述、生成的问题、自然语言问题描述和运行时诊断构建了细粒度的修复反馈。使用精心策划的基准PDDL问题描述进行基于参考的比较,用于事后基准分析,这些离线检查包括与重命名无关的结构匹配和语义等价性(在领域支持的情况下)。在Planetarium、AutoPlanBench和精心策划的PDDL 2.1问题上的结果表明,操作成功度和基准参考重建之间可能存在显著差异。结果还显示,结构化修复是有用的,并且即使操作成功度提高,PDDL 2.1对于参考重建仍然具有挑战性。
1INESC INOV, 里斯本,葡萄牙
2INESC ID, 里斯本,葡萄牙
3里斯本大学高等技术学院, 里斯本,葡萄牙
4Motamineral Minerais Industriais S.A.
{joana.rosa, pedro.santos}@inov.pt
{bruno.g.martins, lms}@tecnico.ulisboa.pt
{valdemar.oliveira, romao.silva}@mota-sc.com
## 1 引言
大型语言模型正越来越多地被用于将自然语言任务描述翻译成可以由符号规划器解决的形式化规划表示。在这一背景下,自然语言到PDDL的生成已成为一个核心问题。规划领域定义语言是符号规划的标准形式化语言,受到许多经典和时态规划器的支持。然而,编写PDDL规范需要大量的专业知识。将自然语言任务描述翻译成PDDL为非专业用户和符号规划系统之间提供了自然的接口,但同时也要求很高:对象声明、初始谓词、目标、优化度量或数值流中的微小错误,都可能显著改变生成的规划问题。
该领域的一个主要难点在于评估。生成的实例可能是可解析甚至可解决的,但却编码了错误的初始状态、遗漏了必需的谓词、指定了微妙不正确的目标或优化了错误的度量。因此,除了可解析性和规划器成功外,还需要更强的结果验证协议,尽管强大的语义评估具有挑战性,并且可能仅对有限的规划领域子集可用。
考虑到上述挑战,本文报告了一项由三个主要问题引导的详细分析:如何在考虑少样本示例和迭代修复的部署现实场景中评估自然语言到PDDL的生成;操作接受与更严格的基于参考的基准重建度量之间差距有多大;以及操作评估和修复过程在包含时态和数值构造的PDDL 2.1基准测试中的表现如何。
通过实验,我们展示了少样本提示和迭代修复在几种设置下提高了操作性能,尽管重建精心策划的基准参考仍然困难,尤其是在PDDL 2.1的情况下。
反馈引导的修复是LLM辅助规划模型生成中的一种既定策略,先前的工作使用了形式化、符号、验证器和环境反馈来优化生成的模型。本文在更狭窄的、针对问题描述的自然语言到PDDL生成的背景下,研究了同样的通用修复哲学,假设领域模型已经给出。具体来说,我们将解析器、领域一致性、规划器、使用VAL的验证以及自然语言评审器反馈结合在一个统一的问题生成循环中。我们还区分了操作接受和基准参考重建,并经验性地检查了这些信号在Planetarium、AutoPlanBench和精心策划的PDDL 2.1设置中的差异。
## 2 背景
连接LLM和自动规划的研究沿着两个广泛的方向发展。一个研究方向研究语言模型是否可以直接充当规划器,通常是从自然语言任务描述中生成或选择规划。另一个方向则使用语言模型作为规划形式化器,将用户描述翻译成可以由符号规划系统处理的结构化表示。
第二个方向变得越来越重要,因为它分离了两个难题:解释自然语言,以及在获得正确的形式化模型后解决由此产生的规划问题。规划形式化确实越来越多地被视为一项语言生成任务。一些研究侧重于形式化的受限形式,例如将自然语言目标翻译成结构化的规划目标,而其他研究则考虑更丰富的场景,其中必须从文本中恢复完整的规划表示。
最近的数据集将问题从封闭的基准描述推向了开放域的过程文本,表明一旦输入变得不那么模板化且更具语义要求,性能会显著下降。一个相关的工作方向也开始处理领域生成,从问题实例规范转向从自然语言获取完整的规划模型。
一些密切相关的系统使用反馈来优化生成的规划模型。关等人使用PDDL验证器和人类纠正反馈来改进生成的世界/领域模型。马达维等人则使用环境交互反馈进行自动PDDL翻译和规划,而奥斯瓦尔德等人研究了符号反馈驱动的规划领域模型空间搜索,包括验证器输出。最近的调查将这系列工作定位为从直接使用LLM作为规划器,转向使用它们作为规划形式化器来为下游规划器构建或优化符号规划模型这一更广泛转变的一部分。
这些研究共同表明,形式化、符号化和基于交互的反馈对于LLM辅助的规划形式化越来越核心。相关工作进一步表明,语言模型可以与形式化验证或基于可满足性的推理工具结合,比单独直接生成规划更可靠地处理规划问题。
## 3 方法
我们定义了一个流水线,输入是一个自然语言问题描述和一个PDDL领域文件,生成一个候选的problem.pddl。整体工作流程结合了初始生成、操作评估、反馈构建和迭代修复。如图1所示,在整个循环中复用了相同的生成步骤:生成一个候选实例,检查其操作可接受性,然后要么接受,要么通过结构化反馈进行修改。相同的架构用于经典PDDL和PDDL 2.1,后者额外需要度量敏感的检查和规划器选择,以区分纯时态问题和数值流问题。
参考标题图1:提出的自然语言到PDDL生成、评估和修复流程概览。
### 3.1 初始生成
给定一个自然语言问题描述和一个PDDL领域文件,提示语言模型生成一个完整的problem.pddl实例,包括对象、初始状态、目标,以及在适用时的优化度量和数值初始化。输出必须与PDDL问题领域规范中定义的谓词词汇和动作模式保持一致。在选定的设置中,提示会使用少量同领域的少样本示例进行增强。每个示例将自然语言规划描述与其对应的参考problem.pddl配对,从而演示该领域中的描述如何映射到对象声明、初始事实和目标条件。这些示例与目标实例不同,仅用作预期翻译模式的演示。模型必须推断正确的对象清单,确定哪些关系属于初始状态,识别预期的目标,恢复存在的预期优化目标,并保持与形式领域定义的一致性。
### 3.2 在线操作评估与离线基准分析
该流程区分了决定修复循环是否应停止的*在线操作评估*,以及用于基准测试和当存在参考problem.pddl时计算的*离线基准分析*。这种区分是本文采用的实验方法的核心。
#### 在线操作评估。
每个生成的问题首先经过一系列检查。
1. 解析:生成的problem.pddl描述必须是可解析的。
2. 领域一致性:静态检查器验证所有引用的对象是否已声明、谓词名称是否属于领域词汇、谓词元数是否被遵守以及类型约束是否未被违反。该检查器是有意设计为局部和保守的,即它检测的是对给定领域的违反,而非证明与自然语言描述的完全语义忠实性。
3. 规划与验证:如果解析和静态检查成功,则执行规划器,任何返回的规划都用VAL进行验证。对于经典领域,我们使用Fast Downward规划器。对于PDDL 2.1,时间简单领域使用TFD处理,数值流领域使用ENHSP处理。
4. LLM评审器:额外的LLM评审器将自然语言描述与生成的problem.pddl进行比较,同时考虑领域文件和自动诊断。当它拒绝一个输入实例时,它会返回一个结构化的判断,标识每个检测到的问题、其位置和类型。一个候选方案只有在可解析、领域一致、可解决、VAL有效且被LLM评审器接受时才会被接受。我们将这些条件的合取称为*操作成功*。这个标准比单纯的解析器/规划器成功更严格,但它不依赖于访问精心策划的参考问题文件。
LLM评审器被指示采取保守态度。特别是,它必须将其主张锚定在自然语言描述、领域或生成的PDDL中的明确证据上。它还必须区分对象存在问题和状态级别问题,并优先报告模糊性而非编造不支持的不匹配。解析成功、领域一致性、规划器成功、VAL有效性和评审器接受共同构成了流水线的操作基础。
#### 停止标准。
修复循环在以下任一条件下停止:
- •操作成功:所有上述在线检查均成功。
- •生成未更改:当前的problem.pddl与上一次尝试相同,表明模型在当前反馈下没有进展。
- •无可行反馈:即使未达到操作成功,评估器也无法提供具体的修复指导。
- •达到最大尝试次数:达到配置的最大尝试次数值。
在实践中,“生成未更改”和“无可行反馈”条件很重要,因为它们可以防止循环在停滞或诊断信息不明确时浪费尝试次数。
#### 语义评估:
当领域有语义支持时,可以通过语义等价性过程将生成的问题与参考实例进行评估。在本工作中,对于由Planetarium基准支持的领域是可能的,该基准将PDDL问题表示为对象和命题上的图,并在完成部分指定的目标后检查等价性。这种支持是特定于领域的,因为语义评估仅对已实现所需预言和图构建函数的领域可用。注意,语义等价性仅用作*离线基准分析信号*。此信号对于基于参考的分析极具信息量,但它不在修复循环内使用,因为此时没有参考问题实例可用。
#### 结构评估:
在所有运行中,可以在生成的问题和参考实例之间计算与重命名无关的结构比较。该比较明确检查四个组件:
- •:objects 中的类型化对象声明,
- •:init 中的原子事实,
- •:goal 中的原子事实,
- •:metric 中的优化目标。
对于PDDL 2.1,相同的比较还通过规范形式检查相应的赋值和数值初始值,来评估数值流的结构。度量子句被严格评估:优化方向(例如,最小化 vs. 最大化)和优化后的表达式本身在规范化后都必须匹配。该比较不依赖于对象名称的字面一致性,而是抽象掉命名,搜索生成对象和参考对象之间的一致双射映射。为了减少不必要的计算,结构比较首先检查当对象名称相同时,恒等映射是否已经产生匹配。只有当该快速路径失败时,才搜索替代的双射映射。在所选映射下对齐对象后,它比较结果的对象声明、初始事实、目标事实和度量子句。该比较不考虑顺序,并基于规范化的PDDL问题表示(例如,在提取事实前忽略行注释,以避免注释引入虚假的不匹配)。当语义支持可用时,相似文章
使用开放权重模型的纯LLM PDDL领域修复
本文评估了开放权重大型语言模型在AI规划中PDDL领域修复的能力,表明它们优于符号基线,但在可靠测试约束满足方面存在困难。
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
迈向可靠且鲁棒的LLM规划:符号反馈驱动的迭代自我改进框架
本文提出了一种符号反馈驱动的迭代自我改进框架,以提高大语言模型在长周期规划任务中的鲁棒性和可靠性。该方法利用自然语言提示、符号验证器和计划识别器来增强可行性与正确性。
PDDL规划中的实例生成器生成
本文介绍了一种新方法,利用大语言模型自动生成PDDL规划域的实例生成程序,确保其正确性和多样性。
通过形式化抽象改进资源受限语言模型中的自然语言组合优化精度
本文介绍了SDDL,一个神经符号框架,通过将自然语言问题转化为形式化表示,提高了资源受限语言模型中的组合优化精度,与直接生成和求解器代码基线相比,实现了更高的可行性率。