PlanBench-XL:评估大规模工具生态系统中LLM工具使用代理的长期规划能力
摘要
PlanBench-XL是一个新的基准测试,用于评估LLM代理在能见度有限且存在动态干扰的大规模工具生态系统中进行规划和适应的能力。实验显示,GPT-5.4在无阻断设置下仅达到51.9%的准确率,而在严重阻断条件下骤降至11.36%,凸显了长期规划中的重大挑战。
查看缓存全文
缓存时间: 2026/06/23 05:41
论文页面 - PlanBench-XL:评估大规模工具生态系统中LLM工具使用代理的长时域规划
来源:https://huggingface.co/papers/2606.22388
摘要
PlanBench-XL 评估了大型语言模型代理在复杂工具丰富环境中的规划与适应能力,该环境具有有限可见性和动态干扰。
LLM 代理(https://huggingface.co/papers?q=LLM%20agents)越来越多地运行在庞大的工具生态系统(https://huggingface.co/papers?q=tool%20ecosystems)中,现实世界任务需要发现相关工具、推断隐性的子目标(https://huggingface.co/papers?q=implicit%20sub-goals),并在长时域(https://huggingface.co/papers?q=long%20horizons)内适应动态环境(https://huggingface.co/papers?q=dynamic%20environments)。然而,现有基准很少在受检索限制的工具可见性(https://huggingface.co/papers?q=retrieval-limited%20tool%20visibility)下评估规划(https://huggingface.co/papers?q=planning)能力。为弥补这一空白,我们提出 PlanBench-XL,一个包含 327 个零售任务、覆盖 1655 个工具的交互式基准(https://huggingface.co/papers?q=interactive%20benchmark),用于测试代理能否迭代检索可用工具、调用工具以揭示达成最终目标所需的中间证据。PlanBench-XL 还引入了可选的阻塞机制(https://huggingface.co/papers?q=blocking%20mechanism),通过缺失、失效或干扰的工具功能模拟现实世界中的不可预测性,迫使代理在运行时检测中断路径并适应。对十个领先 LLM 的实验表明,大规模工具的规划(https://huggingface.co/papers?q=planning)仍具挑战性:GPT-5.4 在无阻塞设置下准确率达 51.90%,但在最严重阻塞条件下骤降至 11.36%。进一步分析显示,当故障缺乏明确错误信号或恢复需要更长的替代工具使用路径(https://huggingface.co/papers?q=tool-use%20paths)时,代理尤其脆弱。这些结果确立了 PlanBench-XL 作为诊断代理规划(https://huggingface.co/papers?q=agentic%20planning)失败的测试平台,凸显了在大型且不完美的工具环境中进行长时域任务时,鲁棒自适应规划(https://huggingface.co/papers?q=planning)的必要性。
查看 arXiv 页面(https://arxiv.org/abs/2606.22388)查看 PDF(https://arxiv.org/pdf/2606.22388)项目页面(https://planbench-xl.github.io/)GitHub2(https://github.com/JiayuJeff/PlanBench-XL)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.22388)
将本论文放入您的代理中:
hf papers read 2606.22388
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型0
暂无模型引用本论文
在模型 README.md 中引用 arxiv.org/abs/2606.22388 即可从本页链接。
引用本论文的数据集0
暂无数据集引用本论文
在数据集 README.md 中引用 arxiv.org/abs/2606.22388 即可从本页链接。
引用本论文的 Spaces0
暂无 Space 引用本论文
在 Space README.md 中引用 arxiv.org/abs/2606.22388 即可从本页链接。
包含本论文的收藏集0
暂无收藏集包含本论文
将本论文添加到收藏集(https://huggingface.co/new-collection)即可从本页链接。
相似文章
AdaPlanBench:在世界和用户约束下评估大型语言模型智能体的自适应规划能力
AdaPlanBench是一个动态基准测试,用于评估LLM智能体在多轮交互中根据逐步显现的世界和用户约束进行自适应规划的能力。实验表明,当前模型尤其难以应对用户约束。
PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型
PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。
超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析
本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。
当工具失灵:LLM智能体动态重新规划与异常恢复的基准测试
ToolMaze基准测试评估了LLM智能体处理真实世界工具故障的能力,揭示了隐式语义故障导致的性能下降最为显著,而动态重新规划仍是模型扩展或提示工程无法解决的关键瓶颈。
AdvPlan-Bench:结构化规划生成智能体的对抗性评估
AdvPlan-Bench 是一个离线基准,用于对抗性评估结构化规划生成智能体,在 150 个合成场景中使用 BLUE-vs-RED 优势和诊断指标比较计划,以研究响应预算敏感性和多智能体批判。