当工具失灵:LLM智能体动态重新规划与异常恢复的基准测试
摘要
ToolMaze基准测试评估了LLM智能体处理真实世界工具故障的能力,揭示了隐式语义故障导致的性能下降最为显著,而动态重新规划仍是模型扩展或提示工程无法解决的关键瓶颈。
查看缓存全文
缓存时间: 2026/06/08 03:29
论文页面 - 当工具失效时:大语言模型智能体中的动态重规划与异常恢复基准测试
来源:https://huggingface.co/papers/2606.05806
摘要
ToolMaze 基准测试揭示,现实世界中的工具故障会显著降低工具集成推理(TIR)性能,其中隐式语义故障造成的性能下降最为严重,而动态重规划成为关键瓶颈。
现有基准测试(https://huggingface.co/papers?q=benchmark)评估大语言模型在工具集成推理(https://huggingface.co/papers?q=Tool-Integrated%20Reasoning)(TIR(https://huggingface.co/papers?q=TIR))中的表现时,通常只关注理想化的“快乐路径”,极大忽视了现实世界中的工具故障。我们推出 ToolMaze,这是一个针对 TIR(https://huggingface.co/papers?q=TIR)智能体中动态路径发现(https://huggingface.co/papers?q=dynamic%20path%20discovery)和错误恢复(https://huggingface.co/papers?q=error%20recovery)的基准测试(https://huggingface.co/papers?q=benchmark)。为了将系统性重规划与盲目试错区分开来,ToolMaze 采用了二维设计:基于 DAG 的拓扑复杂度(https://huggingface.co/papers?q=DAG-based%20topological%20complexity)和工具扰动(https://huggingface.co/papers?q=tool%20perturbations)的 2×2 分类法(显式/隐式,瞬态/永久)。评估结果表明,扰动几乎在所有模型上都会导致性能下降,其中隐式语义故障(https://huggingface.co/papers?q=implicit%20semantic%20failures)下的下降幅度最大。由于系统性地过度信任被破坏的输出,扰动恢复率(https://huggingface.co/papers?q=Perturbation%20Recovery%20Rate)(PRR(https://huggingface.co/papers?q=PRR))在这些场景中骤降约 37%,而复杂拓扑则将智能体困在徒劳的试错循环中。关键的是,智能体容错性(https://huggingface.co/papers?q=agentic%20fault-tolerance)随模型规模(https://huggingface.co/papers?q=model%20scale)提升的速度比基本任务执行慢 3.66 倍,这凸显了动态重规划(https://huggingface.co/papers?q=dynamic%20replanning)是一个独特的瓶颈,无法单纯通过模型缩放或提示工程来解决。数据和代码可在 https://github.com/Zhudongsheng75/ToolMaze 获取。
查看 arXiv 页面(https://arxiv.org/abs/2606.05806)查看 PDF(https://arxiv.org/pdf/2606.05806)GitHub2(https://github.com/Zhudongsheng75/ToolMaze)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05806)
在你的智能体中获取这篇论文:
hf papers read 2606.05806
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2606.05806 即可从此页面链接。
引用此论文的数据集 1
dongsheng/ToolMaze 更新于3天前 • 1.14k • 4(https://huggingface.co/datasets/dongsheng/ToolMaze)
引用此论文的 Space 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2606.05806 即可从此页面链接。
包含此论文的集合 0
没有包含此论文的集合
将此论文添加到集合(https://huggingface.co/new-collection)中即可从此页面链接。
相似文章
超越排行榜:大型语言模型代理中工具使用、规划与推理失败的综合分析
本文综合了2023-2026年间27篇基准测试、分类学和审计论文,形成了一个统一的LLM代理局限性分类体系,识别出六大失败集群,包括工具调用错误、规划失败、长期退化、多代理协调问题、安全性问题以及测量有效性问题。
PlanBench-XL:评估大规模工具生态系统中LLM工具使用代理的长期规划能力
PlanBench-XL是一个新的基准测试,用于评估LLM代理在能见度有限且存在动态干扰的大规模工具生态系统中进行规划和适应的能力。实验显示,GPT-5.4在无阻断设置下仅达到51.9%的准确率,而在严重阻断条件下骤降至11.36%,凸显了长期规划中的重大挑战。
低延迟系统中工具制作与自进化LLM代理
本文提出了一种方法,将重复的标准操作流程步骤编译为经过验证、有版本管理的工具,在部署前完成,替代推理时的代码生成。在一个配送中心的报警分类系统中,该方法将p50延迟降低了42%,端到端错误率降低了最多53%。
超越函数调用:在工具环境不可靠性下对工具使用代理进行基准测试
介绍ToolBench-X,这是一个基准测试,用于评估各种工具环境可靠性隐患下的大语言模型代理,揭示了与干净环境相比性能上的显著差距。
受控智能体的集合切换行为测试
本文介绍了一个基准测试,用于评估当可靠工具在会话中悄然发生变化时,LLM智能体如何调整其工具选择,借鉴了认知心理学中的集合切换概念。该测试对开放权重LLM进行了评估,并根据工具集合的框架识别出不同的失败模式。