Lomekwi: LLM智能体中的资源受限工具发现
摘要
本文区分了LLM智能体中的工具使用与工具发现,将发现分解为好奇心、识别和效率。介绍了Lomekwi框架,并在组合游戏中展示了识别能力随模型大小的逆缩放。
arXiv:2607.16961v1 公告类型:新
摘要:现有的工具使用基准报告了复杂多步任务的单一成功率。受认知科学思想的启发,我们区分了工具使用与工具发现,并将后者分解为好奇心(模型发现构建工具所需部件的能力)、识别(模型发现创建工具过程的能力)和效率(模型在创建后使用工具的能力)。我们展示了这一框架可应用于现有的发现任务,如Voyager。此外,我们提供了识别能力随模型大小逆缩放的证据,并引入和分析了一类展示该现象的组合游戏。我们还在一个模拟现实世界任务的独立环境中观察到了逆缩放。
查看缓存全文
缓存时间: 2026/07/21 06:41
# Lomekwi:LLM代理中的资源有限工具发现
来源:https://arxiv.org/html/2607.16961
Roshan Klein\-Seetharaman Daniel Wang¹¹footnotemark:1 Andrew Xu¹¹footnotemark:1
Sea12 Technologies Yale University
roshan\.klein\-seetharaman@yale\.edu
¹These authors contributed equally to this paper.
代码、环境和原始Episode日志可在以下地址获取:
https://github.com/DragonWrangler25/lomekwi-tool-discovery.
###### 摘要
现有的工具使用基准测试在复杂、多步骤任务上仅报告单一成功率。受认知科学思想的启发,我们将工具使用与工具发现区分开来,并将后者分解为好奇心(模型发现构建工具所需部件的能力)、识别能力(模型发现创建工具过程的能力)和效率(模型创建后使用工具的能力)三个方面。我们展示了该框架可应用于现有发现任务,如Voyager。此外,我们提供了证据表明识别能力与模型规模呈反比缩放,并介绍和分析了一类展示该现象的组合游戏。我们还在一个旨在模拟真实世界任务的独立环境中观察到了逆缩放现象。
## 1 引言
工具创造被认为是自然智能和人工智能的重要特征:更智能的代理通过构建可重复使用的抽象来利用其环境。毫不意外,为大型语言模型(LLM)配备工具使其能够解决更广泛的问题。例如,LLM可以使用公开的网络搜索工具从网络查询信息,或使用Python执行工具进行计算,而不必依赖已有的预训练知识。虽然LLM工具使用现已无处不在,但该领域的现有工作总是向模型提供工具[Yuet al., 2026 (https://arxiv.org/html/2607.16961#bib.bib4)]或关于如何创建工具的说明[Caiet al., 2024 (https://arxiv.org/html/2607.16961#bib.bib1)]。因此,现有的工具使用基准只能显示模型在被提示时构建工具的能力,但不能显示模型是否在没有被告知的情况下决定构建工具。我们的工作针对这一缺失行为。
对认知科学家来说,工具发明与工具使用是分开的。经验上,这些行为是相分离的;并非所有有效的工具使用者都是能力强的工具发明者,并且可能以多种方式在工具创造上失败。例如,儿童在开始发明新工具之前已经成为有效的工具使用者[Neldneret al., 2020 (https://arxiv.org/html/2607.16961#bib.bib12)]。某些脑损伤患者可能失去使用工具的能力,但仍然理解其用途[Goldenberg and Spatt, 2009 (https://arxiv.org/html/2607.16961#bib.bib14)]。在本文中,我们将这一范式具体应用于LLM代理。在制造和使用工具时,我们认为代理必须表现出三种可分离的行为:它必须收集组成工具的组件,然后意识到并承诺构建工具,最后在有限的环境下有效部署工具。我们分别称之为好奇心、识别能力和效率。在第3节中,我们将形式化这些组成部分,并将代理解决问题的概率分解为好奇心、识别能力、效率的乘积,再加上一个额外的“蛮力”概率(即代理采用暴力方法的可能性)。
为了研究这种分解,我们需要一个环境,允许我们在Episode过程中观察工具发现的每个方面的进展。标准基准只记录最终成功以及是否创建了工具。此外,工具创造往往是强制性的,关键的是未能对模型作为工具构建者的倾向进行基准测试。类似地,经典的工具使用基准常将工具发现与记忆混淆,尤其是在预训练中频繁出现的领域(如数学、游戏、API或代码)的任务上。我们开发了一个小型参数化的无污染环境家族,能够测量分解后的工具发现。我们将这个环境类命名为Lomekwi,以第一个有记载的人类工具使用的地点命名。通过使工具创建变得可选,我们的环境测量的是模型创建工具的倾向,而不仅仅是它们在被明确指示时的能力。
我们的实验证实,好奇心、识别能力和效率在实践中是分离的。有些代理在一个方面表现异常出色,而在其他方面则表现不佳。人们可能会期待相反的情况:更强的模型应该在工具的每个方面都表现得更好。然而,我们的结果表明,特别是识别能力遵循一种逆缩放趋势——较大的模型往往较少发现工具机会。我们的贡献如下:
1. 将工具发现分解为可单独测量的部分(好奇心、识别能力和效率)
2. 一个受控的、先验知识被抑制的环境家族,在此环境中可以比较LLM行为与最优策略
3. 一个逆缩放结果,表明识别能力随着模型规模的增大而变差
4. 在更接近现实世界任务的环境中进行消融验证,证实识别能力的逆缩放现象
在第2节中,我们介绍了工具使用和创造基准测试方面的先前工作,并讨论了其潜在局限性。在第3节中,我们描述了LLM工具发现的三部分分解,包括可测量的组成部分。在第4节中,我们介绍了整体方法,包括组合游戏和模拟的MCP工具环境、评估的模型以及我们的统计分析。在第5节中,我们展示了在Lomekwi环境中的主要实验结果,在第6节中则展示了在MCP环境中的结果,该环境进一步评估了LLM代理的工具识别能力。我们在第7节中讨论了结论。
## 2 相关工作
LLM工具使用已成为近年来的一个关键研究领域[Quet al., 2025 (https://arxiv.org/html/2607.16961#bib.bib6)]。现有工作主要沿两个相关方向展开:(1) 评估代理有效使用和创造工具的基准测试,以及 (2) 分析代理何时、如何以及为何在工具使用任务中成功(和失败)的方法。这些方向共同为构建更好的工具使用和创造代理铺平了道路。我们的框架也与认知科学文献相呼应,将工具使用和工具创新视为两个独立的能力。
流行的工具使用基准主要旨在评估LLM在自然出现的工具使用任务上的表现。这些包括APIBench[Patilet al., 2024 (https://arxiv.org/html/2607.16961#bib.bib7)]、Creation Challenge[Qianet al., 2023 (https://arxiv.org/html/2607.16961#bib.bib2)]、ToolBench[Qinet al., 2024 (https://arxiv.org/html/2607.16961#bib.bib8)]、Ultratool[Huanget al., 2024 (https://arxiv.org/html/2607.16961#bib.bib5)]和WildToolBench[Yuet al., 2026 (https://arxiv.org/html/2607.16961#bib.bib4)]。在这些研究中,LLM代理被赋予工具(如API或脚本函数)的访问权限,并被要求解决与手头工具明确相关的任务。值得注意的是,模型总是通过预训练或文档知道如何构建和操作工具。最近的基准测试还测试模型是否能够从现有工具库中规划和选择工具[Wanget al., 2024 (https://arxiv.org/html/2607.16961#bib.bib3), Huanget al., 2024 (https://arxiv.org/html/2607.16961#bib.bib5)]。尽管这些基准测试变得越来越复杂并反映了真实世界的LLM工具使用任务,但候选工具及其接口总是由测试框架提供,即使工具使用是可选的。从这个意义上说,现有的工具使用基准通常评估的是在强烈鼓励(甚至要求)使用工具的设置下的性能。在模型必须自主发明自己工具的背景下评估模型性能仍是一个未被充分探索的领域。
除了仅报告工具相关任务的成功率外,最近的方法已经识别出成功使用工具的中间步骤。Creation Challenge[Qianet al., 2023 (https://arxiv.org/html/2607.16961#bib.bib2)]将工具创造与随后的决策和执行分离;Ultratool[Huanget al., 2024 (https://arxiv.org/html/2607.16961#bib.bib5)]区分了规划、创造和使用。最终,研究LLM工具使用中的失败有助于指导如何开发更好的工具使用代理。例如,ToolLLM的检索与训练流程、LATM中工具制造与工具使用角色的分离,以及Voyager的可重用可执行技能库[Qinet al., 2024 (https://arxiv.org/html/2607.16961#bib.bib8), Caiet al., 2024 (https://arxiv.org/html/2607.16961#bib.bib1), Wanget al., 2024 (https://arxiv.org/html/2607.16961#bib.bib3)]都提供了提升工具能力的框架。这些方法全面描述了代理如何决定、构建和操作工具。然而,它们主要是在工具或工具创造目标已经被提供之后才存在的。相比之下,我们的框架测量的是更早期的过程,即代理必须识别出构建工具的模糊机会。
Huang et al.[Huanget al., 2024 (https://arxiv.org/html/2607.16961#bib.bib5)]发现工具利用能力与模型规模正相关。在我们的工作中,我们反直觉地发现存在一个识别能力与模型规模反相关的区域。由于识别能力被定义为与构建率成正比,这可能导致较小模型比较大数据模型发现更多工具。逆缩放的例子自逆缩放奖竞赛[McKenzieet al., 2023 (https://arxiv.org/html/2607.16961#bib.bib9)]以来就已为人所知,该竞赛识别了十一类问题,其中性能随着参数数量的增加而下降。然而,后来Wei等人的工作[Weiet al., 2023 (https://arxiv.org/html/2607.16961#bib.bib10)]表明,这些家族中的大多数表现出U形缩放,即极大模型开始再次表现更好。我们推测识别能力正是这种非单调缩放的例子。我们提供了经验证据并给出了这一结果的启发式论证。
我们的工作还源于认知科学,其中工具使用和工具发明一贯被视为不同的技能。在发展心理学中,儿童能够可靠地使用演示工具多年后才能自发发明出等效的工具[Neldneret al., 2020 (https://arxiv.org/html/2607.16961#bib.bib12)]。在鸟类中观察到相反的现象:在野外没有工具使用的物种,有时会在圈养条件下自发发展出工具发明能力[Bird and Emery, 2009 (https://arxiv.org/html/2607.16961#bib.bib13)]。识别出工具可以组装并随后成功使用之间的区别也在黑猩猩[Köhler, 1925 (https://arxiv.org/html/2607.16961#bib.bib15)]和患有神经系统疾病的患者[Osiurak and Badets, 2016 (https://arxiv.org/html/2607.16961#bib.bib16), Osiuraket al., 2020 (https://arxiv.org/html/2607.16961#bib.bib17)]中被提出。然而,目前尚无针对LLM的类似研究。
## 3 分解工具发现
### 3.1 框架
在任何研究工具使用的环境中,一个代理成功构建并使用工具的Episode会暴露三个事件:代理同时持有工具所需的成分(\( \mathrm{hold} \));它构建了工具(\( \mathrm{build} \));并且在动作预算内解决了任务(\( \mathrm{win} \))。构建需要首先持有成分,因此 \( \mathrm{build} \Rightarrow \mathrm{hold} \)。我们跟踪四个量:
\[
C = \Pr(\mathrm{hold}), \quad R = \Pr(\mathrm{build} \mid \mathrm{hold}), \quad E = \Pr(\mathrm{win} \mid \mathrm{build}), \quad S = \Pr(\mathrm{win}),
\]
我们分别将其称为*好奇心*、*识别能力*、*效率*和*成功*。根据是否构建了工具来拆分成功得到:
\[
S = \Pr(\mathrm{win} \cap \mathrm{build}) + \Pr(\mathrm{win} \cap \neg \mathrm{build}),
\]
并且由于 \( \mathrm{build} \Rightarrow \mathrm{hold} \),第一项可以分解为 \( \Pr(\mathrm{build} \mid \mathrm{hold}) \Pr(\mathrm{win} \mid \mathrm{build}) \Pr(\mathrm{hold}) \)。令 \( G = \Pr(\mathrm{win} \cap \neg \mathrm{build}) \) 表示没有工具时获得的成功,则:
\[
S = C R E + G.
\]
这一等式是精确的。当 \( G = 0 \) 时,即构建是通向成功的唯一可行途径时,它简化为 \( S = CRE \);我们保持蛮力路径可行,从而 \( G > 0 \),使识别能力成为真正的选择而非强制步骤。
### 3.2 案例研究:Voyager
Wang et al. [Wanget al., 2024 (https://arxiv.org/html/2607.16961#bib.bib3)] 在一个非常特殊的背景下研究了LLM发现,他们提出了在Minecraft中进行持续探索的Voyager代理。在他们的工作中,一个LLM控制器基于当前游戏状态提出目标,编写代码来实现这些目标,并将成功的脚本存储在一个技能库中以便重用。Voyager代理为我们的分解提供了一个具体的例子。在此背景下,我们考虑一个任意的Minecraft任务——例如,获取腐肉,这通常通过击败僵尸获得。我们可以根据我们的框架将该技能分解如下:
- • 成功:\( S = \Pr(\text{获取腐肉}) \)
- • 好奇心:\( C = \Pr(\text{看见僵尸}) \)
- • 识别能力:\( R = \Pr(\text{识别僵尸掉落腐肉} \mid \text{看见僵尸}) \)
- • 效率:\( E = \Pr(\text{杀死僵尸} \mid \text{识别僵尸掉落腐肉}) \)
值得注意的是,Voyager受益于LLM控制器(GPT-4实例)通过预训练掌握了Minecraft的基本知识[Wanget al., 2024 (https://arxiv.org/html/2607.16961#bib.bib3)]。这使得识别能力项变得微不足道,因为控制器立即知道僵尸会掉落腐肉。在几乎所有现有的工具使用研究中都出现了类似的效果[Patilet al., 2024 (https://arxiv.org/html/2607.16961#bib.bib7), Qinet al., 2024 (https://arxiv.org/html/2607.16961#bib.bib8), Huanget al., 2024 (https://arxiv.org/html/2607.16961#bib.bib5), Yuet al., 2026 (https://arxiv.org/html/2607.16961#bib.bib4)]。然而,在真实的发现案例中,就像人类玩家面对新游戏状态时自然发生的那样,代理不会有这样的知识。这一差距并非我们分解的人为产物;在第5节和第6节中,我们提供了证据表明这种缺失的识别能力项与模型能力成反比,表明当前观察到的工具使用缩放可能无法推广到新的发现任务。
## 4 方法
### 4.1 实验设置
我们在两个环境中测试我们的好奇心(\( C \))、识别能力(\( R \))和效率(\( E \))框架。*Lomekwi*(第5节)是一种组合保险库游戏,其中所有三项均可测量:代理收集成分,发现工具配方,并使用工具解决任务。相似文章
@omarsar0: 关于工具使用智能体的有趣可解释性论文。作者探测隐藏状态,发现模型经常识别到应调用工具,但…
本文提出了一个模型自适应的工具必要性定义,并发现 LLM 内部识别需要工具与实际调用工具之间存在 26% 到 54% 的不匹配,集中体现在认知到行动的转换阶段。它揭示了一个“知行差距”(knowing-doing gap),即模型通常知道应该调用工具,但由于后期层几何结构将信号旋转至几乎与行动正交,导致调用失败。
LLM代理已经知道何时调用工具——甚至无需推理
本文介绍了When2Tool,一个研究LLM代理实际何时需要调用工具的基准,并揭示模型已从隐藏状态知道工具的必要性但未能采取行动。提出的Probe&Prefill方法将不必要的工具调用减少了48%,且精度损失极小。
使用金丝雀工具诊断LLM智能体中的工具选择推理
本文引入“金丝雀工具”作为诊断探针,用于识别LLM智能体中特定的工具选择推理失败,提出了一个六类型分类法,并在8,640次任务运行中评估了八个模型,以展示能力层级差异和鲁棒性。
工具总是有益的吗?学会自适应调用工具以实现双模式多模态大语言模型推理
介绍 AutoTool,一种自适应决定是否调用工具进行多模态大语言模型推理的模型,通过强化学习和双模式推理实现了显著的准确率和效率提升。
Contract2Tool:学习前提与效果以实现可靠的工具增强型LLM代理
本文介绍了Contract2Tool,一个从工具元数据、文档和执行轨迹中自动推断轻量级工具契约(前提条件、效果、风险)的框架,为LLM代理实现可靠的因果工具过滤。实验表明,学习到的契约在下游多步骤代理任务中达到了接近黄金契约的性能,同时显著减少了token使用量。