使用开放权重模型的纯LLM PDDL领域修复
摘要
本文评估了开放权重大型语言模型在AI规划中PDDL领域修复的能力,表明它们优于符号基线,但在可靠测试约束满足方面存在困难。
arXiv:2608.17341v1 公告类型:新
摘要:AI规划关注于找到实现特定目标的行动序列。它依赖于世界的显式模型,通常以规划领域定义语言(PDDL)表示。一个活跃的研究方向探究如何检测和修复此类模型中的错误。例如,用户可能提供作为解决方案的正面测试计划,以及在执行过程中失败的负面测试计划。然后,自动修复方法修改PDDL模型以满足这些约束。在本文中,我们评估了最近的开放权重大型语言模型使用纯LLM方法执行此修复任务的能力。我们的实验表明,符号基线达到了$F_1$分数为$.49$,而表现最佳的LLM在高推理努力下达到$.87$,绝对改进为$.38$。然而,该设置的平均测试通过率仅为$.82$,在Thoughtful领域降至$.06$;即使包括测试跟踪的最佳设置也仅达到$.92$。因此,当前的开放权重模型无法保证满足可靠自动模型修复所需的测试约束。
查看缓存全文
缓存时间: 2026/08/19 10:00
# 使用开源模型的大语言模型专用PDDL领域修复
来源:https://arxiv.org/html/2608.17341
###### 摘要
人工智能规划关注寻找实现特定目标的动作序列。它依赖对世界状态的显式建模,通常以规划领域定义语言(PDDL)表示。当前研究热点之一聚焦于如何检测并修复此类模型中的错误。例如,用户可能提供作为解决方案的正例测试轨迹,以及在执行过程中失败的反例测试轨迹。自动化修复方法通过修改PDDL模型以满足这些约束。本文评估了近期开源大语言模型采用纯大语言模型方法执行此类修复任务的能力。实验表明,符号化基线方法的F1分数为0.49,而表现最佳的大语言模型在高推理强度下达到0.87,绝对提升0.38。然而,该设置的平均测试通过率仅为0.82,在Thoughtful领域降至0.06;即使包含测试轨迹的最佳设置也仅达0.92。因此,当前开源模型无法保证可靠自动化模型修复所需的测试约束满足度。
## 引言
可解释性是人工智能系统与人类协同决策的核心需求。在人工智能规划领域,这一需求通过动作、状态和目标的显式表示自然满足:规划器基于对世界的结构化模型进行推理以生成解决方案。相较于黑箱机器学习技术,这种显式推理过程使规划过程具有固有的透明性和可解释性。然而,规划实际部署的主要挑战之一在于构建规划模型本身(16 (https://arxiv.org/html/2608.17341#bib.bib4))。
大语言模型(LLM)的最新进展推动了其在人工智能规划任务中的应用研究(5 (https://arxiv.org/html/2608.17341#bib.bib10); 15 (https://arxiv.org/html/2608.17341#bib.bib9); 7 (https://arxiv.org/html/2608.17341#bib.bib6); 9 (https://arxiv.org/html/2608.17341#bib.bib7); 6 (https://arxiv.org/html/2608.17341#bib.bib8))。近期综述(16 (https://arxiv.org/html/2608.17341#bib.bib4))指出,大语言模型在支持规划模型构建与优化方面具有潜力。虽然可验证的规划模块仍是系统可靠性、鲁棒性和可解释性的基石,但大语言模型可作为辅助工具减轻定义领域模型的人工负担。我们认为*领域修复*是一条富有前景的路径,其目标是通过对领域进行特定修改,使正例轨迹可执行而反例轨迹不可执行。
修复本身可被视为一种解释。参照14 (https://arxiv.org/html/2608.17341#bib.bib5)(14 (https://arxiv.org/html/2608.17341#bib.bib5))对社会科学中对比性解释的论述,修复回答了“给定轨迹为何在当前领域失败”的问题,并提供了领域行为可如何不同的反事实论证。因此,每次修复不仅是技术修正,更是面向人类领域建模者的可解释反馈。
部分符号化方法通过自动修改PDDL模型来强制执行可执行性约束(1 (https://arxiv.org/html/2608.17341#bib.bib13); 4 (https://arxiv.org/html/2608.17341#bib.bib14); 3 (https://arxiv.org/html/2608.17341#bib.bib12); 2 (https://arxiv.org/html/2608.17341#bib.bib15)),而其他研究则探索此类修复的计算复杂度(10 (https://arxiv.org/html/2608.17341#bib.bib16))。我们基于11 (https://arxiv.org/html/2608.17341#bib.bib2) 和13 (https://arxiv.org/html/2608.17341#bib.bib3)提出的设定展开研究,其中规划领域通过必须为有效计划的正例(白名单)轨迹和必须被设为不可执行的反例(黑名单)轨迹进行修复。他们提供了符号算法,可找到满足黑名单与白名单约束的基数最小解。该算法通过与通过随机添加或删除动作前置条件及效果而损坏的PDDL模型的基准修正进行比较,采用精确率和召回率进行评估。
本文研究不同规模的近期开源大语言模型解决PDDL领域修复问题的能力,并将其性能与上述符号优化器进行对比。我们在13 (https://arxiv.org/html/2608.17341#bib.bib3)引入的基准测试套件上评估所有模型,以便与符号方法进行直接比较。实验设置遵循我们早期工作(8 (https://arxiv.org/html/2608.17341#bib.bib11))中同名提出的纯大语言模型修复方案,但通过评估更广泛、更新近的开源模型扩展了该研究,使我们得以评估基于大语言模型的PDDL模型修复的当前技术水平。除先前使用的仅领域(NoTrace)提示外,我们还研究了同时向大语言模型提供白名单与黑名单轨迹的WithTrace提示是否能带来进一步性能提升。
## 规划形式化
鉴于我们的重点是修复提升型PDDL领域,现引入提升型规划形式化定义。提升型规划问题定义为元组Π=(P,A,α,O,sI,sg)\\Pi=(\\mathcal{P},\\mathcal{A},\\alpha,\\mathcal{O},s^{I},s^{g}),其中领域为D=(P,A,α)\\mathcal{D}=(\\mathcal{P},\\mathcal{A},\\alpha),任务为T=(O,sI,sg)\\mathcal{T}=(\\mathcal{O},s^{I},s^{g})。
#### 对象、类型与变量
设O\\mathcal{O}为规划任务中的对象集合。我们考虑一组变量V\\mathcal{V},每个变量作为对象的占位符。变量v∈Vv\\in\\mathcal{V}的类型记为v|tv|t,其中t∈Θt\\in\\Theta。每个类型t∈Θt\\in\\Theta关联对象集合O⟦t⟧⊆O\\mathcal{O}\\llbracket t\\rrbracket\\subseteq\\mathcal{O}。若O⟦t⟧⊆O⟦t'⟧\\mathcal{O}\\llbracket t\\rrbracket\\subseteq\\mathcal{O}\\llbracket t'\\rrbracket,则称t∈Θt\\in\\Theta是t'∈Θt'\\in\\Theta的*子类型*。
#### 谓词
谓词p=P(v1|t1,...,vk|tk)\\mathbf{p}=P(v_{1}|t_{1},\\ldots,v_{k}|t_{k})由唯一名称P和包含k∈N0k\\in\\mathbb{N}_{0}个类型化变量的元组定义,记为par(p):=(v1|t1,...,vk|tk)\\operatorname{par}(\\mathbf{p}):=(v_{1}|t_{1},\\ldots,v_{k}|t_{k})。若k=0k=0则谓词不含变量。记P\\mathcal{P}为Π\\Pi中所有谓词的集合。
#### 变量替换
变量替换函数ρ:V→O\\varrho:\\mathcal{V}\\rightarrow\\mathcal{O}将每个类型化变量v|tv|t映射到同类型t的对象ρ(v|t)∈O⟦t⟧\\varrho(v|t)\\in\\mathcal{O}\\llbracket t\\rrbracket。
#### 事实
给定谓词p∈P\\mathbf{p}\\in\\mathcal{P}和替换函数ρ\\varrho,通过对p\\mathbf{p}进行实例化——即用ρ\\varrho给出的对应对象替换每个参数(v1,...,vk)(v_{1},\\ldots,v_{k})——获得*事实*:f=ρ(p)=P(ρ(v1),...,ρ(vk))f=\\varrho(\\mathbf{p})=P(\\varrho(v_{1}),\\ldots,\\varrho(v_{k}))。所有实例化谓词的集合记为F\\mathcal{F},任何事实集合构成*状态*。
#### 动作模式
记A\\mathcal{A}为动作模式集合。动作模式a=A(v1|t1,...,vk|tk)\\mathbf{a}=A(v_{1}|t_{1},\\ldots,v_{k}|t_{k})由唯一名称A和包含k个变量的元组定义,记为par(a):=(v1|t1,...,vk|tk)\\operatorname{par}(\\mathbf{a}):=(v_{1}|t_{1},\\ldots,v_{k}|t_{k})。每个模式关联映射:
α(a)=(prec+(a),prec-(a),eff+(a),eff-(a))\\alpha(\\mathbf{a})=(\\mathit{prec}^{+}(\\mathbf{a}),\\mathit{prec}^{-}(\\mathbf{a}),\\mathit{eff}^{+}(\\mathbf{a}),\\mathit{eff}^{-}(\\mathbf{a}))
表示四个兼容谓词集合的元组,具体定义如下:
###### 定义1(兼容谓词)
对于动作模式a\\mathbf{a},*兼容谓词*集Pa\\mathcal{P}^{\\mathbf{a}}包含所有参数集是a\\mathbf{a}参数子集的谓词:
Pa:={p∈P∣s-par(p)⊆s-par(a)},\\mathcal{P}^{\\mathbf{a}}:=\\{\\mathbf{p}\\in\\mathcal{P}\\mid\\operatorname{s\\text{-}par}(\\mathbf{p})\\subseteq\\operatorname{s\\text{-}par}(\\mathbf{a})\\},
其中s-par\\operatorname{s\\text{-}par}将参数转换为集合。
#### 动作
给定动作模式a\\mathbf{a}和替换函数ρ\\varrho,通过按ρ\\varrho替换a\\mathbf{a}的每个参数获得对应*动作*,记为a=a[ρ]a=\\mathbf{a}[\\varrho]。动作描述状态空间的转换。若prec+(a)⊆s\\mathit{prec}^{+}(a)\\subseteq s且prec-(a)∩s=∅\\mathit{prec}^{-}(a)\\cap s=\\emptyset,则动作a在状态s中*可执行*。在状态s中执行可执行动作a产生后继状态:
s'=(s∖eff-(a))∪eff+(a),s'=(s\\setminus\\mathit{eff}^{-}(a))\\cup\\mathit{eff}^{+}(a),
记为s→as's\\to_{a}s'。
本文中,粗体(如p\\mathbf{p},a\\mathbf{a})表示谓词和动作模式,常规字体(如f,af,a)表示事实和动作。
#### 解
设γ=⟨a1,...,ak⟩\\gamma=\\langle a_{1},\\ldots,a_{k}\\rangle为动作序列。记s→∗γs's\\rightarrow^{*}_{\\gamma}s'表示s'是通过对状态轨迹⟨s0,...,sk⟩\\langle s_{0},\\ldots,s_{k}\\rangle应用γ\\gamma得到的结果,其中s0=ss_{0}=s, sk=s's_{k}=s',且每个动作在其前驱状态中可执行。规划问题的解是动作序列γ=⟨a1,...,ak⟩\\gamma=\\langle a_{1},\\ldots,a_{k}\\rangle,使得sI→∗γs's_{I}\\rightarrow^{*}_{\\gamma}s'对某个满足sg⊆s's^{g}\\subseteq s'的s'成立,且每个aia_{i}是某个动作模式a∈A\\mathbf{a}\\in\\mathcal{A}的实例化。
## 修复问题
我们首先引入定义给定规划领域可能修复操作的符号和语法。接着描述如何应用一组此类修复来生成修改后的领域。基于这些概念,我们根据定义的修复操作以及正例与反例计划集合,形式化领域修复问题。我们的公式尽可能贴近13 (https://arxiv.org/html/2608.17341#bib.bib3)引入的设定,同时明确强调为整合大语言模型以优先选择具有语义意义的修复集所需的修改。
变体1:NoTrace(仅领域)
1. 推断有缺陷PDDL领域中每个动作的预期语义。
2. 提出合理的单编辑修复:添加或删除正/反例前置条件或效果。
3. 返回简洁的动作概览、按动作分组的推荐修复方案及每次修复的论证。
约束条件:
•使用动作和谓词名称的语义线索。
•不引入新谓词、变量或常量;添加的原子使用动作可用的参数。
输入:有缺陷的PDDL领域。
变体2:WithTrace(领域及测试轨迹)
•遵循所有NoTrace步骤与约束。
•同时使用测试轨迹作为行为证据。
•正例(白名单)计划必须可执行并达到目标。
•对于失败索引为n的反例(黑名单)计划,其前缀必须可执行,且第n个动作必须不可执行。
输入:有缺陷的PDDL领域及正例/反例测试轨迹。
图1:评估中使用的NoTrace和WithTrace纯大语言模型提示抽象。在规划领域D=(P,A,α)\\mathcal{D}=(\\mathcal{P},\\mathcal{A},\\alpha)中,*原子修复*是形如r⟦a,p,c,op⟧r\\llbracket\\mathbf{a},\\mathbf{p},c,op\\rrbracket的修改。其中a∈A\\mathbf{a}\\in\\mathcal{A}为动作模式,p∈P\\mathbf{p}\\in\\mathcal{P}为与a\\mathbf{a}兼容的谓词,c∈{prec+,prec-,eff+,eff-}c\\in\\{\\mathrm{prec}^{+},\\mathrm{prec}^{-},\\mathrm{eff}^{+},\\mathrm{eff}^{-}\\}表示修改涉及正/反例前置条件或效果,op∈{+,−}op\\in\\{+,\\-\\}指定组件是添加还是删除。记D⇒rD'\\mathcal{D}\\Rightarrow_{r}\\mathcal{D}'表示将r应用于D\\mathcal{D}得到D'=(P,A,α')\\mathcal{D}'=(\\mathcal{P},\\mathcal{A},\\alpha'),其中α'\\alpha'是r应用于α\\alpha}的结果。
领域的*修复集*δ\\delta是零个或多个原子修复的有限集合。当且仅当δ\\delta不包含两个修复r,r'∈δr,r'\\in\\delta使得其中一个逆转另一个的效果时,我们称δ\\delta是*有效*的。具体而言,若a=a'\\mathbf{a}=\\mathbf{a}', p=p'\\mathbf{p}=\\mathbf{p}', c=c'c=c'且op≠op'op\\neq op',则修复r=r⟦a,p,c,op⟧r=r\\llbracket\\mathbf{a},\\mathbf{p},c,op\\rrbracket与r'=r'[a',p',c',op']r'=r'\\llbracket\\mathbf{a}',\\mathbf{p}',c',op'\\rrbracket被视为相互抵消。
设D\\mathcal{D}为领域,δ\\delta为D\\mathcal{D}的有效修复集。按任意顺序应用δ\\delta中的修复将产生相同的修改后领域D'\\mathcal{D}'。记D⇒δ∗D'\\mathcal{D}\\Rightarrow_{\\delta}^{*}\\mathcal{D}'表示D'\\mathcal{D}'是通过对D\\mathcal{D}应用有效修复集δ\\delta获得。
###### 定义2(领域修复问题)
领域修复问题定义为元对R=(D,T)\\mathcal{R}=(\\mathcal{D},\\mathbb{T}),其中D\\mathcal{D}表示规划领域,T={T1,...,Tn}\\mathbb{T}=\\{\\mathbf{T}_{1},\\dots,\\mathbf{T}_{n}\\}(n∈Nn\\in\\mathbb{N})。每个元素Ti\\mathbf{T}_{i}是三元组(Πi,Pi,Ei)(\\Pi_{i},\\mathbb{P}_{i},\\mathbb{E}_{i})。此处Πi=(D,Ti)\\Pi_{i}=(\\mathcal{D},\\mathcal{T}_{i})表示规划问题;Pi\\mathbb{P}_{i}是Πi\\Pi_{i}的有限非空正例计划集πk+\\pi^{+}_{k};Ei\\mathbb{E}_{i}是与Πi\\Pi_{i}关联的有限非空二元组集(πk−,ik)(\\pi_{k}^{-},i_{k})。每个πk−\\pi^{-}_{k}表示Πi\\Pi_{i}的反例计划(被视为不良的动作序列),且iki_{k}不超过该计划的长度。
###### 定义3(修复问题的解)
R\\mathcal{R}的*解*是将原始领域D\\mathcal{D}通过修复操作序列D⇒δ∗D'\\mathcal{D}\\Rightarrow_{\\delta}^{*}\\mathcal{D}'转换为修改后领域D'\\mathcal{D}'的有效修复集δ\\delta。该修复必须满足以下条件:对于所有1≤i≤n1\\leq i\\leq n的索引ii,所有正例计划π+∈Pi\\pi^{+}\\in\\mathbb{P}_{i}必须是更新后规划问题Πi'=(D',Ti)\\Pi_{i}'=(\\mathcal{D}',\\mathcal{T}_{i})的有效解,即它们可执行相似文章
RLearner-LLM:通过混合直接偏好优化平衡大语言模型的逻辑基础与流畅性
本文介绍了RLearner-LLM,一个使用混合直接偏好优化(Hybrid-DPO)的框架,旨在平衡LLM生成解释的逻辑正确性和流畅性。该框架在多个领域和基础模型上实现了显著的NLI蕴含改进,同时减轻了标准偏好信号中的冗长偏差。
当前的开放权重大语言模型长期可行吗?
分析当前开放权重大语言模型的长期可行性,讨论其挑战与可持续性。
基于大语言模型的零样本目标识别
本文首次系统性地对前沿大语言模型在经典PDDL规划基准上的零样本目标识别能力进行评估,发现部分模型能随证据积累而扩展性能,而另一些模型则始终依赖世界知识先验,不受观测累积影响。
大型语言模型有多像人类?一个关注语域的语言评估框架
本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。
大型语言模型中的类人回指消解
本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。