LLM智能体系统中技能的规模化定律
摘要
本文识别了LLM智能体系统中技能库的两个耦合规模化定律:路由准确率随库大小呈对数衰减,执行动态表现出救援效应。这些定律在15个模型和超过百万次决策中得到验证,且定律指导的优化显著提升了性能。
arXiv:2605.16508v1 公告类型:新
摘要:随着智能体系统的扩展,技能积累成大型可复用库,但其规模化定律尚不清楚。通过对15个前沿LLM、1141个真实世界技能以及超过300万次路由或执行决策的分析,我们识别出两个耦合定律。路由定律:单步路由准确率随库大小呈对数衰减(所有模型的$R^2>0.97$),错误从局部技能竞争发展为跨家族漂移,并被过于通用的“黑洞技能”捕获。执行定律:在状态实现之前,联合路由近似乘法效应,而正确执行可将困难的下游决策提升约$4\times$。单个参数——路由对数衰减斜率$b$——将两个定律耦合:路由侧拟合预测了跨模型的执行侧救援,表明相同的库属性同时控制执行前崩溃和下游可恢复性。这些定律具有可操作性:定律指导的优化将保留路由准确率从71.3%提升至91.7%,将劫持率从22.4%降至4.1%,并方向性地迁移到下游ClawBench和ClawMark执行设置中,在ClawBench上将平均通过率从49.3%提升至61.6%,在ClawMark上从28.4%提升至34.5%。这些结果表明,智能体性能不仅取决于模型能力,还取决于技能库的结构、粒度和暴露策略。
查看缓存全文
缓存时间: 2026/05/19 06:34
# LLM Agent系统中技能的缩放定律 来源:https://arxiv.org/html/2605.16508 \\papertags\\evolventtag LLM Agent\\evolventtag技能库\\evolventtag缩放定律 ###### 摘要 随着Agent系统的规模扩展,技能逐渐积累成大型可复用库,然而其缩放定律仍未被充分理解。通过对15个前沿LLM、1141个真实世界技能以及超过300万次路由或执行决策的研究,我们识别出两个耦合的定律。
**路由定律**:单步路由准确率随库大小呈对数衰减(所有模型\(R^2>0.97\)),错误从局部技能竞争逐步演变为跨簇漂移,最终被过于通用的“黑洞技能”捕获。
**执行定律**:在状态实现前,联合路由近似为乘法关系,而正确执行可将困难下游决策的准确率提升约4倍。一个单一参数——路由对数衰减斜率\(b\)——将两定律耦合:跨模型的路由侧拟合可预测执行侧修复,表明同一库属性同时控制着执行前崩溃和下游可恢复性。
这些定律具有可操作性:定律引导的优化将留存路由准确率从71.3%提升至91.7%,劫持率从22.4%降至4.1%,并方向性迁移至下游ClawBench和ClawMark执行场景,在ClawBench上平均通过率从49.3%提升至61.6%,在ClawMark上从28.4%提升至34.5%。这些结果表明,Agent性能不仅取决于模型能力,还取决于技能库的结构、粒度和暴露策略。
![[未添加标题的图片]](https://arxiv.org/html/2605.16508v1/x1.png)
## 1 引言
随着Agent系统的发展,技能逐渐积累成可复用的库[wang2024survey, xu2025llm, yehudai2025survey]。早期的动作选择系统[schick2023toolformer, qin2023toolllm, patil2023gorilla]和基准[li2023apibank, shen2023taskbench]表明,语言模型可从大型可调用接口集中进行选择。近期更多以技能为中心的工作[li2026skillsbench, zheng2026skillrouter]进一步将可复用技能视为构建强大Agent的核心抽象[chen2025towards, chen2025ai4research, gao2025survey, xu2026agent]。这些系统共同暗示了一个自然的缩放前提:扩展技能库应能扩大Agent可用的行为空间,而剩余失败可归因于模型能力有限或路由不完美。这使核心问题从“模型能否使用技能?”转变为“不断增长的技能库如何重塑Agent的路由和执行动态?”
现有基准通常改变任务、模型或动作格式,但将库视作背景基础设施。我们则把库的大小和结构作为研究对象。由此产生的失败模式并非普通的幻觉。在我们的纯文本路由协议中,模糊提示可能导致0%的幻觉技能名称,而任务级路由准确率却降至18.3%,库内劫持率超过80%。模型仍留在库内,但落入了库的错误部分。
引用图标题
图1:技能库缩放定律及优化启示。
(a) 可复用技能积累成更大的暴露库。路由准确率随\(\log N\)近似线性衰减,斜率\(b\)因模型而异。
(b) 错误从局部竞争演变为跨簇漂移,最终被过于通用的“黑洞”技能捕获。
(c) 执行将状态前复合与状态后修复分开。
(d) 同一库属性连接了路由崩溃和执行修复:\(b\)可跨模型预测修复而无须重新拟合。
(e) 这些定律暗示具体的优化措施:审计邻居、重写混淆对、强化提示以及应用额外的管理器动作。
为解决此问题,我们通过技能库的经验定律来表征这一行为。通过对15个前沿LLM、1141个现实世界技能以及超过300万次路由或执行决策的研究,我们发现两个耦合的经验定律。**路由定律**支配执行前状态:单步准确率遵循\(Acc(N)=a - b \ln N\),每个模型\(R^2>0.97\),而错误从相邻技能间的局部竞争,演变为跨簇漂移,最终被过于通用的“黑洞”技能捕获。**执行定律**在状态实现后开始发挥作用。在任何工件存在之前,多技能路由组合近似为乘法关系;正确执行后,具体状态可挽救困难的下游决策,在困难对上产生约4倍的增益。因此,执行不仅仅增加了另一次失败的机会。它既可以传播不良状态,也可以提供证据来消除下一个路由的歧义。
这两条定律通过一个单一可解释参数连接:路由衰减斜率\(b\)。\(b\)越大,意味着随着库的增长,准确率崩溃得越快,从而减少了可供下游修复的正确上游状态存在的概率。相反,当路由侧拟合与独立测量的修复系数结合时,\(b\)可跨模型预测执行侧修复而无须重新拟合(\(\rho = 0.74\),\(p < 0.001\))。这种耦合是本文的核心结果:控制执行前路由崩溃的同一库属性,也决定着执行是否能提供有用的下游状态。这将定律从回顾性描述转变为设计约束:减少局部竞争、明确技能边界、移除抽象吸引子,并在可能有助于修复时暴露执行状态。
在这些定律的指导下,我们在中位\(b\) Agent的定律预测过渡点上实例化了一个定律引导的自动技能管理器。管理器应用四种库侧操作:最近邻审计、描述边界重写、抽象技能移除和提示锚定。在1600个留存任务上,它将路由准确率从71.3%提升至91.7%,并将劫持率从22.4%降至4.1%。因子消融实验表明,边界重写(+12.8%)和抽象技能移除(+4.9%)是主要贡献者,与预测的故障阶段一致。相同的设计方向性迁移至下游ClawBench/ClawMark执行设置:在ClawBench上平均通过率从49.3%提升至61.6%,在ClawMark上从28.4%提升至34.5%。
我们的贡献是:
- 技能库两阶段定律。我们建立了耦合的路由和执行定律,描述大型技能库如何在状态实现前失败,以及在正确执行后如何恢复。
- 技能库的统一定律结构。我们表明,路由衰减斜率\(b\)将库规模的路由崩溃与跨模型的执行侧修复联系起来,而无须重新拟合。
- 优化基于技能的Agent系统的指导。我们将定律转化为库优化方法,涉及暴露控制、边界重写、吸引子移除和执行状态使用,并在下游得到验证。
## 2 相关工作
我们的工作处于技能路由、执行感知Agent系统和缩放定律的交叉点。现有工作研究代理如何选择或使用外部能力,但并未涉及技能库本身缩放时出现的耦合路由和执行定律。
路由外部能力的研究通过可调用接口系统、Agent基准和以技能为中心的Agent进行。Toolformer[schick2023toolformer]、ToolLLM[qin2023toolllm]、ToolAlpaca[tang2023toolalpaca]、Gorilla[patil2023gorilla]、API-Bank[li2023apibank]、TaskBench[shen2023taskbench]、OpenAgents[xie2023openagents]、AgentBench[liu2023agentbench]以及最近的综述和技能聚焦工作[wang2024survey, xu2025llm, yehudai2025survey, xu2026agent, jiang2026agenticskills, li2026skillsbench, zheng2026skillrouter]将大型外部动作空间确立为核心Agent接口。与我们路由设置最接近的是ComplexFuncBench[zhong2025complexfuncbench]研究多步函数选择,BiasBusters[blankenstein2025biasbusters]研究系统性选择偏差,而xRouter、EvoRoute、AutoTool和MetaToolAgent优化路由或工具选择[qian2025xrouter, zhang2026evoroute, jia2025autotool, fang2026metatoolagent]。这些工作通常改变任务难度、路由器策略或基准领域,而不是将技能库大小和几何结构作为缩放轴。
执行感知Agent系统研究中间状态、反馈和多步交互如何改变下游行为。ReAct[yao2023react]、Plan-and-Solve[wang-etal-2023-plan]、Reflexion[shinn2023reflexion]、HuggingGPT[shen2023hugginggpt]、MetaGPT[hong2023metagpt]和Voyager[wang2023voyager]表明,轨迹、工件、反馈和编排可以改善端到端完成度[qiao2023taskweaver, wang2023mint, du2024anytool, yehudai2025survey, shen2025evaluationbenchmarkingllmagents]。我们的执行定律隔离了一个更狭窄的机制:在具体状态出现之前,多技能路由接近于乘法组合;正确执行后,已实现的工件可以挽救困难的下游路由。我们的贡献是通过技能库缩放的实证定律将这些线索连接起来。
先前的缩放定律研究计算量、数据、模型大小或训练分配[kaplan2020scaling, hoffmann2022chinchilla, wei2022emergent, roberts2025compute, wu2026educational];检索与表示工作解释了密集候选邻域[karpukhin2020dpr, lewis2020rag, reimers2019sbert, muennighoff2023mteb];Hick-Hyman定律给出了能力有限选择的对数模拟[hick1952rate, hyman1953stimulus]。我们则缩放推理时的技能库,并表明路由衰减、错误级联、黑洞捕获和执行侧修复由统一参数耦合。
## 3 问题形式化与实验设置
##### 问题形式化。
设 \(\mathcal{S}_N = \{s_1, \ldots, s_N\}\) 为暴露的技能库,其中每个技能具有可选择的名称、自然语言描述和执行接口。每个任务 \(q\) 有一个金牌技能 \(s^\star(q) \in \mathcal{S}_N\);即所需技能通过构造已存在于暴露库中。因此,我们研究的是可用性保持的失败:模型可以访问必要的技能,但可能选择错误的库内替代项。
我们研究两个阶段。在**路由试验**中,模型仅看到 \(q\) 和技能描述,路由器 \(\mathcal{R}_\theta\)(LLM \(\theta\))提出:
\[
\hat{s} = \mathcal{R}_\theta(q, \mathcal{S}_N), \qquad (1)
\]
其中 \(\hat{s}\) 可能是正确的、错误的但在库内、库外或弃权。在**执行试验**中,路由和执行在管道中的 \(K\) 步或子任务间交替进行。在第 \(k\) 步,模型根据上下文 \(c_k\) 进行路由,然后执行所选技能:
\[
\hat{s}_k = \mathcal{R}_\theta(q_k, \mathcal{S}_N, c_k), \qquad y_k = \mathcal{E}_\theta(q_k, \hat{s}_k, c_k),
\]
其中 \(y_k\) 是已实现的工件,\(c_k\) 包含任务、技能描述,以及执行开始后的上游工件 \(y_{0.95}\)),所得技能组织成14个软件自动化领域。人类标注者根据预定义的技能组合构建了4075个任务,仅使用GPT-5.4辅助任务合成;我们仅保留具有一致金牌技能标注的任务(\(\kappa = 0.91\),约9%被排除)。此外,我们整合了来自Terminal-Bench[merrill2026terminal]、\(\tau\)-Bench[yao2024tau]、\(\tau^2\)-Bench[barres2025tau]、FlowBench[xiao-etal-2024-flowbench]、PinchBench[team2026pinchbench]及相关来源的查询,进一步扩展并添加工具标注。
对于大小为 \(N\) 的路由条件,我们为每个任务包含金牌技能,并用无放回采样的领域分层干扰项填充剩余的 \(N-1\) 个槽位;这使目标分布固定而只改变库暴露。我们使用提供API允许的确定性解码,解析模型返回的第一个技能名称跨度,并将不匹配的名称计为幻觉而不是强制最近匹配。除非另有说明,每个案例平均评估四次。主要路由曲线扫描 \(N \in \{10, 20, 50, 100, 200, 500\}\) 和 \(K \in \{1, 2, 3, 5, 10\}\),每个条件使用 \(n=500\) 个领域分层任务。我们通过普通最小二乘法在扫描规模上拟合 \(Acc(N) = a - b \ln N\),并报告二项率Wilson区间;跨模型相关性使用Spearman \(\rho\) 及百分位自助法置信区间。附录C.1 (https://arxiv.org/html/2605.16508#A3.SS1) 报告了每个模型的拟合结果,附录C.3 (https://arxiv.org/html/2605.16508#A3.SS3) 给出了检索/路由器基线和任务难度控制。
我们评估了15个LLM:GPT-4o-mini[openai2024gpt4omini]、GPT-5-mini[openai2025gpt5]、GPT-5.4-mini[openai2026gpt54mini]、GPT-5.4[openai2026gpt54]、Claude Sonnet 4.6[anthropic2026sonnet]、Claude Opus 4.6[anthropic2026api]、Gemini 3.1 Pro、Gemini 3.1 Flash Lite[gemini2025gemini3]、GLM-5[zai2026glm]、GLM-4.7[zai2026glm47]、Kimi K2.5[moonshot2026k25]、Kimi K2.6[moonshot2026k26]、Doubao Seed 2.0 Pro[bytedance2026seed20]、DeepSeek-V4 Pro[deepseek2025v4]和Qwen3-235B[qwen2025qwen3235b]。路由使用纯文本单技能选择,除非另有说明,因此幻觉是可测量的。约束路由仅用于执行侧隔离和需要强制执行有效库内选择的条件;它不被纳入纯文本幻觉或劫持分析。提示见附录B (https://arxiv.org/html/2605.16508#A2)。优化实验使用与诊断研究相同的留存路由协议。
本节在执行前分析路由定律:模型观察任务和技能描述,选择 \(\hat{s}\),并且上下文中没有执行工件 \(y_k\)。核心效应不仅仅是更大的库包含更多候选;它们还创造了更密集的 plausible 替代项邻域,因此规模既改变了路由错误率,也改变了其几何结构。
引用图标题
图2:库规模导致对数单步衰减、超独立的管道损失以及链中路由低谷。
我们首先问:增加 \(N\) 是否仅仅增加了独立选择,还是改变了路由问题的结构?对于每个 \(N\),每次试验暴露金牌技能加上从相同领域混合中采样的干扰项;对于仅路由的管道,\(K\) 个金牌技能是固定的,仅暴露的干扰集发生变化。首先,单步路由准确率几乎随 \(\ln N\) 线性下降(图2(a))。其次,三步路由计划低于由独立重复单步选择器预测的准确率(图2(b))。因此,库规模削弱了单个决策,也使计划序列更容易出错。这些结果共同构成了路由定律的第一部分。对数衰减表明存在有限的辨别预算:随着 \(N\) 增长,目标技能面临更多邻近竞争者(第5节)。复合结果解释了为什么这种单步损失在计划序列中变得更糟(图2(c))。早期错误的路由将计划带入错误的语义空间。相似文章
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。
SkillLearnBench:面向真实任务代理技能生成的持续学习方法基准
SkillLearnBench 推出首个评估 LLM 代理持续技能学习的基准,覆盖 20 项真实任务,结果显示尚无方法全面领先,单纯扩大模型规模也无法保证技能提升。
SkillAdaptor: 基于轨迹的LLM智能体自适应技能
SkillAdaptor是一种无需训练的步骤级技能自适应框架,具有显式的失败归因能力,适用于LLM智能体,在WebShop、PinchBench和Claw-Eval上提升了性能。
SkillLens:面向成本高效型大模型智能体的自适应多粒度技能复用
本文提出了 SkillLens,这是一种用于大模型智能体自适应多粒度技能复用的分层框架,在基准任务中展示了更高的准确性和成本效益。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。