当工具失灵:LLM智能体动态重新规划与异常恢复的基准测试

Hugging Face Daily Papers 论文

摘要

ToolMaze基准测试评估了LLM智能体处理真实世界工具故障的能力,揭示了隐式语义故障导致的性能下降最为显著,而动态重新规划仍是模型扩展或提示工程无法解决的关键瓶颈。

现有基准测试在理想化的“快乐路径”上评估LLM的工具集成推理(TIR),很大程度上忽略了真实世界的工具故障。我们引入了ToolMaze,这是一个针对TIR智能体动态路径发现和错误恢复的基准测试。为了将系统性重新规划与盲目试错区分开来,ToolMaze采用了二维设计:基于DAG的拓扑复杂度和一个2×2的工具扰动分类法(显式/隐式、瞬时/永久)。评估表明,扰动几乎降低了所有模型的性能,其中隐式语义故障导致的下降最为剧烈。由于系统性地过度信任被破坏的输出,在这些场景中,扰动恢复率(PRR)下降了约37%,而复杂拓扑结构则将智能体困入徒劳的试错循环中。关键在于,智能体的容错能力随模型规模提升的速度比基本任务执行慢3.66倍,凸显了动态重新规划是一个独立的瓶颈,模型扩展或提示工程均无法解决。数据和代码可在https://github.com/Zhudongsheng75/ToolMaze获取。
查看原文
查看缓存全文

缓存时间: 2026/06/08 03:29

论文页面 - 当工具失效时:大语言模型智能体中的动态重规划与异常恢复基准测试

来源:https://huggingface.co/papers/2606.05806

摘要

ToolMaze 基准测试揭示,现实世界中的工具故障会显著降低工具集成推理(TIR)性能,其中隐式语义故障造成的性能下降最为严重,而动态重规划成为关键瓶颈。

现有基准测试(https://huggingface.co/papers?q=benchmark)评估大语言模型在工具集成推理(https://huggingface.co/papers?q=Tool-Integrated%20Reasoning)(TIR(https://huggingface.co/papers?q=TIR))中的表现时,通常只关注理想化的“快乐路径”,极大忽视了现实世界中的工具故障。我们推出 ToolMaze,这是一个针对 TIR(https://huggingface.co/papers?q=TIR)智能体中动态路径发现(https://huggingface.co/papers?q=dynamic%20path%20discovery)和错误恢复(https://huggingface.co/papers?q=error%20recovery)的基准测试(https://huggingface.co/papers?q=benchmark)。为了将系统性重规划与盲目试错区分开来,ToolMaze 采用了二维设计:基于 DAG 的拓扑复杂度(https://huggingface.co/papers?q=DAG-based%20topological%20complexity)和工具扰动(https://huggingface.co/papers?q=tool%20perturbations)的 2×2 分类法(显式/隐式,瞬态/永久)。评估结果表明,扰动几乎在所有模型上都会导致性能下降,其中隐式语义故障(https://huggingface.co/papers?q=implicit%20semantic%20failures)下的下降幅度最大。由于系统性地过度信任被破坏的输出,扰动恢复率(https://huggingface.co/papers?q=Perturbation%20Recovery%20Rate)(PRR(https://huggingface.co/papers?q=PRR))在这些场景中骤降约 37%,而复杂拓扑则将智能体困在徒劳的试错循环中。关键的是,智能体容错性(https://huggingface.co/papers?q=agentic%20fault-tolerance)随模型规模(https://huggingface.co/papers?q=model%20scale)提升的速度比基本任务执行慢 3.66 倍,这凸显了动态重规划(https://huggingface.co/papers?q=dynamic%20replanning)是一个独特的瓶颈,无法单纯通过模型缩放或提示工程来解决。数据和代码可在 https://github.com/Zhudongsheng75/ToolMaze 获取。

查看 arXiv 页面(https://arxiv.org/abs/2606.05806)查看 PDF(https://arxiv.org/pdf/2606.05806)GitHub2(https://github.com/Zhudongsheng75/ToolMaze)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.05806)

在你的智能体中获取这篇论文:

hf papers read 2606.05806

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2606.05806 即可从此页面链接。

引用此论文的数据集 1

dongsheng/ToolMaze 更新于3天前 • 1.14k • 4(https://huggingface.co/datasets/dongsheng/ToolMaze)

引用此论文的 Space 0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2606.05806 即可从此页面链接。

包含此论文的集合 0

没有包含此论文的集合

将此论文添加到集合(https://huggingface.co/new-collection)中即可从此页面链接。

相似文章

低延迟系统中工具制作与自进化LLM代理

arXiv cs.CL

本文提出了一种方法,将重复的标准操作流程步骤编译为经过验证、有版本管理的工具,在部署前完成,替代推理时的代码生成。在一个配送中心的报警分类系统中,该方法将p50延迟降低了42%,端到端错误率降低了最多53%。

受控智能体的集合切换行为测试

arXiv cs.AI

本文介绍了一个基准测试,用于评估当可靠工具在会话中悄然发生变化时,LLM智能体如何调整其工具选择,借鉴了认知心理学中的集合切换概念。该测试对开放权重LLM进行了评估,并根据工具集合的框架识别出不同的失败模式。