PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型
摘要
PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。
查看缓存全文
缓存时间: 2026/05/22 08:49
# PlanningBench:生成可扩展且可验证的规划数据,用于评估和训练大语言模型 来源:https://arxiv.org/abs/2605.20873 查看PDF(https://arxiv.org/pdf/2605.20873) > 摘要:规划是大语言模型(LLM)的一项基础能力,因为此类复杂任务要求模型将目标、约束、资源和长期后果协调为可执行、可验证的解决方案。然而,现有的规划基准通常将规划数据视为固定的实例集合,而非可控制的生成目标。这限制了场景覆盖范围,将难度与表层代理指标而非结构性来源挂钩,并且对可扩展生成、自动验证或面向规划的训练支持有限。我们提出PlanningBench,一个用于生成可扩展、多样且可验证的规划数据(兼顾评估与训练)的框架。PlanningBench从真实规划场景出发,将实际工作流程抽象为结构化的分类体系,涵盖30多种任务类型、子任务、约束族和难度因素。在该分类体系指导下,一个基于约束驱动的合成流水线会实例化自包含的规划问题,并具备自适应难度控制、质量过滤和实例级验证检查表。这使规划数据构建从固定基准集合转向可控生成,同时保留真实的任务基础。我们使用PlanningBench评估开源和闭源前沿大语言模型,发现当前模型在耦合约束下仍难以生成完整解决方案。除了评估之外,基于已验证的PlanningBecnch数据进行强化学习,能够提升模型在未见过的规划基准以及更广泛的指令遵循任务上的表现。进一步的分析表明,确定性的或充分指定的最优解能提供更清晰的奖励信号和更稳定的训练动态。总体而言,PlanningBench为诊断和提升大语言模型的可泛化规划能力提供了可控的规划数据来源。 ## 提交历史 来自:Zhao Wang \[查看邮箱(https://arxiv.org/show-email/ff3706ed/2605.20873)\] **\[v1\]** 2026年5月20日星期三 08:10:15 UTC(1,614 KB)
相似文章
AdaPlanBench:在世界和用户约束下评估大型语言模型智能体的自适应规划能力
AdaPlanBench是一个动态基准测试,用于评估LLM智能体在多轮交互中根据逐步显现的世界和用户约束进行自适应规划的能力。实验表明,当前模型尤其难以应对用户约束。
PlanBench-XL:评估大规模工具生态系统中LLM工具使用代理的长期规划能力
PlanBench-XL是一个新的基准测试,用于评估LLM代理在能见度有限且存在动态干扰的大规模工具生态系统中进行规划和适应的能力。实验显示,GPT-5.4在无阻断设置下仅达到51.9%的准确率,而在严重阻断条件下骤降至11.36%,凸显了长期规划中的重大挑战。
PlanBench-V: 面向视觉语言模型的空间规划地图基准
本文介绍了PlanBench-V,这是首个用于评估视觉语言模型在空间规划地图解读方面能力的综合性基准,包括一个专家标注的数据集和一个四维度评估框架。实验显示取得了显著进展,但也突显了在面向实施的任务中持续存在的挑战。
AdvPlan-Bench:结构化规划生成智能体的对抗性评估
AdvPlan-Bench 是一个离线基准,用于对抗性评估结构化规划生成智能体,在 150 个合成场景中使用 BLUE-vs-RED 优势和诊断指标比较计划,以研究响应预算敏感性和多智能体批判。
AI能否像城市规划师一样推理?基于专业判断对大型语言模型进行基准测试
本文介绍了UPBench,这是一个基准测试,用于评估大型语言模型在城市规划知识方面的表现,涵盖四个知识支柱和五个认知层次。研究发现,模型在高阶分析任务上表现优于事实回忆,并识别出如监管幻觉和实践智慧缺失等认知局限。