AdaPlanBench:在世界和用户约束下评估大型语言模型智能体的自适应规划能力
摘要
AdaPlanBench是一个动态基准测试,用于评估LLM智能体在多轮交互中根据逐步显现的世界和用户约束进行自适应规划的能力。实验表明,当前模型尤其难以应对用户约束。
查看缓存全文
缓存时间: 2026/06/05 06:06
论文页面 - AdaPlanBench:评估大语言模型智能体在世界与用户约束下的自适应规划能力
来源:https://huggingface.co/papers/2606.05622
摘要
AdaPlanBench 是一个动态交互式基准,用于评估大语言模型智能体在多轮交互过程中,面对逐步揭示的世界约束和用户约束时进行自适应规划的能力。
语言模型在现实世界问题中的规划通常同时涉及世界约束和用户约束,而这些约束可能不会在初始阶段完全明确,而是通过交互逐步披露。然而,现有基准对在逐步揭示的双重约束条件下的自适应规划探索仍然不足。为填补这一空白,我们提出了 AdaPlanBench——一个动态交互式基准,用于评估大语言模型 (LLM) 智能体能否在逐步揭示的世界约束和用户约束下进行自适应规划与重新规划。AdaPlanBench 基于 307 个家庭任务构建,并采用可扩展的约束构建流水线,为每个任务添加双重约束。在运行时,智能体通过多轮协议与环境交互,只有当智能体提出违反隐藏约束的计划时,这些约束才会被揭示,从而要求智能体在累积反馈下进行迭代的计划修订。这使得规划任务极具挑战性,因为智能体必须从反馈中推断并跟踪约束,同时进行有效的重新规划。对十个领先 LLM 的实验表明,在双重约束下进行自适应规划仍然困难,最佳模型仅达到 67.75% 的准确率。我们进一步观察到,随着约束累积,性能下降,其中用户约束构成特别大的挑战,而失败往往源于较弱的物理基础和效果降低。这些结果使 AdaPlanBench 成为双重约束交互式规划的测试平台,并凸显了 LLM 智能体在面对动态揭示的约束时实现可靠适应的挑战。
查看 arXiv 页面 (https://arxiv.org/abs/2606.05622)
查看 PDF (https://arxiv.org/pdf/2606.05622)
GitHub (https://github.com/JiayuJeff/AdaPlanBench)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.05622)
在您的智能体中获取此论文:
hf papers read 2606\.05622
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.05622 以从此页面链接。
引用此论文的数据集1
JiayuJeff/AdaPlanBench 更新于约 3 小时前 • 6 • 1 (https://huggingface.co/datasets/JiayuJeff/AdaPlanBench)
引用此论文的 Space0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.05622 以从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型
PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。
PlanBench-XL:评估大规模工具生态系统中LLM工具使用代理的长期规划能力
PlanBench-XL是一个新的基准测试,用于评估LLM代理在能见度有限且存在动态干扰的大规模工具生态系统中进行规划和适应的能力。实验显示,GPT-5.4在无阻断设置下仅达到51.9%的准确率,而在严重阻断条件下骤降至11.36%,凸显了长期规划中的重大挑战。
AdvPlan-Bench:结构化规划生成智能体的对抗性评估
AdvPlan-Bench 是一个离线基准,用于对抗性评估结构化规划生成智能体,在 150 个合成场景中使用 BLUE-vs-RED 优势和诊断指标比较计划,以研究响应预算敏感性和多智能体批判。
APeB:大型语言模型智能体个性化能力的基准测试
提出了APeB,一个用于评估LLM智能体个性化能力的基准,专注于从原始查询和交互历史中推断用户意图和偏好。发现当前模型在初期查询上表现不佳,而历史感知的细化方法可以改善这一情况。
超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析
本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。