PlanBench-XL:评估大规模工具生态系统中LLM工具使用代理的长期规划能力

Hugging Face Daily Papers 论文

摘要

PlanBench-XL是一个新的基准测试,用于评估LLM代理在能见度有限且存在动态干扰的大规模工具生态系统中进行规划和适应的能力。实验显示,GPT-5.4在无阻断设置下仅达到51.9%的准确率,而在严重阻断条件下骤降至11.36%,凸显了长期规划中的重大挑战。

LLM代理越来越多地在大规模工具生态系统中运行,现实世界的任务需要发现相关工具、推断隐式子目标,并在长时间范围内适应动态环境。然而,现有的基准测试很少评估在检索受限的工具可见性下的规划能力。为了解决这一差距,我们引入了PlanBench-XL,这是一个交互式基准测试,包含327个零售任务和1,665个工具,用于测试代理是否能够迭代检索可用工具,调用它们以揭示中间证据,从而为最终目标进行后续调用。PlanBench-XL还具有一个可选的阻断机制,通过缺失、故障或干扰的工具函数模拟现实世界的不确定性,迫使代理在运行时检测中断的路径并进行适应。对十个领先LLM的实验表明,大规模工具规划仍然具有挑战性:GPT-5.4在无阻断设置下达到51.90%的准确率,但在最严重的阻断条件下骤降至11.36%。进一步分析表明,当故障缺乏明确的错误信号,或者恢复需要更长的替代工具使用路径时,代理特别容易受到攻击。这些结果将PlanBench-XL确立为诊断代理规划失败的测试平台,并突显了在拥有大型且不完善工具环境的长期任务中,需要强大的自适应规划能力。
查看原文
查看缓存全文

缓存时间: 2026/06/23 05:41

论文页面 - PlanBench-XL:评估大规模工具生态系统中LLM工具使用代理的长时域规划

来源:https://huggingface.co/papers/2606.22388

摘要

PlanBench-XL 评估了大型语言模型代理在复杂工具丰富环境中的规划与适应能力,该环境具有有限可见性和动态干扰。

LLM 代理(https://huggingface.co/papers?q=LLM%20agents)越来越多地运行在庞大的工具生态系统(https://huggingface.co/papers?q=tool%20ecosystems)中,现实世界任务需要发现相关工具、推断隐性的子目标(https://huggingface.co/papers?q=implicit%20sub-goals),并在长时域(https://huggingface.co/papers?q=long%20horizons)内适应动态环境(https://huggingface.co/papers?q=dynamic%20environments)。然而,现有基准很少在受检索限制的工具可见性(https://huggingface.co/papers?q=retrieval-limited%20tool%20visibility)下评估规划(https://huggingface.co/papers?q=planning)能力。为弥补这一空白,我们提出 PlanBench-XL,一个包含 327 个零售任务、覆盖 1655 个工具的交互式基准(https://huggingface.co/papers?q=interactive%20benchmark),用于测试代理能否迭代检索可用工具、调用工具以揭示达成最终目标所需的中间证据。PlanBench-XL 还引入了可选的阻塞机制(https://huggingface.co/papers?q=blocking%20mechanism),通过缺失、失效或干扰的工具功能模拟现实世界中的不可预测性,迫使代理在运行时检测中断路径并适应。对十个领先 LLM 的实验表明,大规模工具的规划(https://huggingface.co/papers?q=planning)仍具挑战性:GPT-5.4 在无阻塞设置下准确率达 51.90%,但在最严重阻塞条件下骤降至 11.36%。进一步分析显示,当故障缺乏明确错误信号或恢复需要更长的替代工具使用路径(https://huggingface.co/papers?q=tool-use%20paths)时,代理尤其脆弱。这些结果确立了 PlanBench-XL 作为诊断代理规划(https://huggingface.co/papers?q=agentic%20planning)失败的测试平台,凸显了在大型且不完美的工具环境中进行长时域任务时,鲁棒自适应规划(https://huggingface.co/papers?q=planning)的必要性。

查看 arXiv 页面(https://arxiv.org/abs/2606.22388)查看 PDF(https://arxiv.org/pdf/2606.22388)项目页面(https://planbench-xl.github.io/)GitHub2(https://github.com/JiayuJeff/PlanBench-XL)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.22388)

将本论文放入您的代理中:

hf papers read 2606.22388

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型0

暂无模型引用本论文

在模型 README.md 中引用 arxiv.org/abs/2606.22388 即可从本页链接。

引用本论文的数据集0

暂无数据集引用本论文

在数据集 README.md 中引用 arxiv.org/abs/2606.22388 即可从本页链接。

引用本论文的 Spaces0

暂无 Space 引用本论文

在 Space README.md 中引用 arxiv.org/abs/2606.22388 即可从本页链接。

包含本论文的收藏集0

暂无收藏集包含本论文

将本论文添加到收藏集(https://huggingface.co/new-collection)即可从本页链接。

相似文章

PlanningBench: 生成可扩展且可验证的规划数据,用于评估和训练大型语言模型

arXiv cs.AI

PlanningBench 是一个用于生成可扩展、多样且可验证的规划数据的框架,以评估和训练大型语言模型。该框架采用约束驱动的合成流程,具备自适应难度控制和质量过滤功能。实验表明,前沿大语言模型在处理耦合约束时仍存在困难,而基于 PlanningBench 数据的强化学习能够提升模型在未见过的规划任务上的表现。