LLM智能体的最优技能选择与可证明的双标准保证
摘要
本文介绍了最佳前缀选择(BPS),这是一种用于LLM智能体最优技能选择的算法,它提供了可证明的双标准保证,并在任务成功率上优于现有方法,同时减少了令牌使用量。
arXiv:2608.19993v1 公告类型:新
摘要:将可重用的技能文档加载到有限的上下文窗口中,现在是LLM智能体获取特定任务能力的主要方式,这使得技能选择成为任务性能和令牌成本的首要决定因素。然而,当前的智能体通过语义相关性独立评分技能,并通过前$k$个或贪心打包组装技能集,对所选技能集没有质量保证或成本意识。因此,冗余或选择不当的技能浪费了稀缺的上下文令牌,甚至可能降低性能。我们给出了首个关于所选技能集如何影响执行结果的模型,并将技能选择转化为一个优化问题:在硬令牌预算下选择一个技能集,以最大化单调子模效益减去上下文惩罚。针对这个问题,我们开发了最佳前缀选择(BPS),一种多项式时间算法,并据我们所知,证明了技能选择的首个性能保证:一个双标准$(1-1/e,1)$近似,其效益系数在多项式时间内是最优的。在受污染控制的BigCodeBench变体上,BPS优于所有基线,达到了$0.73$的实测任务成功率,而发布的技能路由器、文本检索器和执行器自身选择的分别为$0.20$--$0.52$,并且比最强发布的路由器少使用$28\%$的令牌。
查看缓存全文
缓存时间: 2026/08/21 10:13
# 具备可证双标准保证的大语言模型代理最优技能选择 来源:https://arxiv.org/html/2608.19993 Ruishuo Chen† Xun Wang† Zhuoran Li Longbo Huang †平等贡献,按随机顺序列出 跨学科信息科学研究院 清华大学 通信作者:[email protected] arXiv预印本,2026年8月20日 ## 摘要 将可复用技能文档加载到有界上下文窗口是大语言模型(LLM)代理获取任务特定能力的主要方式,这使得技能选择成为决定任务性能与令牌成本的首要因素。然而当前代理仅通过语义相关性对技能进行独立评分,并采用top-k或贪婪组合方式构建技能集,对所选集合既无质量保证也无成本意识。因此,冗余或选择不当的技能会浪费宝贵的上下文令牌,甚至可能降低性能。我们首次构建了技能集如何影响执行结果的模型,并将技能选择形式化为一个优化问题:在硬性令牌预算约束下选择技能集,以最大化单调子模效益减去上下文惩罚。针对该问题,我们开发了最佳前缀选择(BPS)多项式时间算法,并首次证明了(据我们所知)技能选择的性能保证:一个双标准(1−1/e, 1)近似解,其效益系数在多项式时间内最优。在受控污染的BigCodeBench变体测试中,BPS性能超越所有基线,测量任务成功率达到0.73,而发布的技能路由器、文本检索器及执行器自身选择的成功率仅为0.20–0.52,且BPS使用的令牌比最强发布路由器少28%。 ## 1. 引言 大语言模型(LLM)代理日益依赖可复用技能文档来获取超越其参数知识的任务特定能力[48],公共技能注册表已列出数万个可安装技能[4, 5, 11]。现代生产级代理如Codex[34]和Claude Code[2]采用*选择*与*执行*两阶段机制部署技能:LLM审查每个已安装技能的元数据(名称和描述),并根据查询选择技能,然后仅将所选技能文档加载到其上下文窗口以解决任务。然而,两个阶段都受限于模型的有限上下文窗口:选择阶段的上下文成本随已安装技能库规模增长,而执行阶段则消耗所选技能文档和任务输入的额外上下文。随着技能库增长至数百或数千条目[4, 5, 57],仅元数据就可能超出可用上下文预算,使得基于LLM的详尽选择变得不可行[10]。此外,不良的技能选择会对下游执行产生可衡量的影响:实证证据表明,随着库规模增长,选择错误技能会使通过率下降高达21%[40],且经过筛选的技能在87个基准任务中的13个任务上甚至使成功率低于无技能基线[28]。 现代代理架构的这些局限性推动了人们对专用技能选择机制日益增长的兴趣,涵盖从单技能检索与路由到集合感知打包与上下文构建[9, 10, 29, 56, 57]。然而,缺乏原则性公式指导选择时,这些方法大多遵循共同的启发式模板:每个技能根据语义相关性或学习到的偏好独立评分,然后使用top-k[27, 38]、截断[31]或贪婪打包[56]等规则组装所选集合,忽略了加载所选技能文档在执行时带来的上下文成本,且未对技能间的能力重叠与互补性进行建模。但能力关系对有效技能选择至关重要。 图1展示了编程代理的常见技能选择范式[2, 34]:给定任务,系统从技能库中选择技能并提供给冻结的LLM执行器。遵循此范式,我们在任务所需私有API和语义仅通过所选技能可访问的任务上评估Qwen3-32B[47],使执行性能直接依赖于选择质量。我们发现仅覆盖单一能力的技能成功率为零,而覆盖两者的能力互补技能则达到93%的成功率。在覆盖所有能力后,添加冗余的pk64_snip技能消耗额外225个令牌,成功率仅提升1个百分点;而添加语义相关但任务无关的pk64_extra技能则使成功率降低23个百分点。这些结果共同表明技能选择是有预算约束的集合级决策,而非单个技能的排序。 基于这些观察,我们对如何形式化并优化技能选择阶段进行了原则性研究:给定任务查询和有界令牌预算,决定将哪些技能文档注入执行上下文,使稀缺预算分配给任务所需能力(第3节)。我们的模型从能力视角审视技能如何提升性能:每个技能文档提供与任务相关的能力,查询则需要其中部分能力。凹函数响应聚合技能集S在每个能力维度上的供给,捕获重复覆盖同一能力的收益递减,而独立维度则奖励覆盖所有所需能力。由此产生的总效益G(S)是单调子模函数。为建模过长上下文导致的性能退化,所选技能集需支付与其令牌长度ℓ(S)成比例的线性上下文惩罚,且总长度不得超过可用预算B。因此技能选择转化为在硬性令牌预算约束下最大化该结构化目标,形式如下: maxS:ℓ(S)≤B F(S):=G(S)−κℓ(S)。(1) 该问题在第3节形式化,是背包约束下正则化子模最大化的实例。然而,求解具有可证保证的优化问题面临根本障碍:无惩罚时,该问题包含单调子模背包最大化,除非P=NP,否则不存在优于1−1/e的近似[6]。有惩罚时,目标可能为负,排除了常数乘性近似,推动了双标准保证的产生[18, 33]。现有求解硬预算约束下正则化子模最大化的结果,获得的近似系数较弱[15, 16, 53]或引入与精度相关的加性损失[35]。 我们的结果在子模效益上达到了最优系数1−1/e,同时保留了完整惩罚,通过新颖的预算对齐插值技术(将密度链上的分数点转换为其记录的整数前缀,利用约束与惩罚的对齐形式)实现了技能选择问题的双标准(1−1/e, 1)近似保证。据我们所知,本工作首次提供了技能集如何影响执行结果的结构化模型,以及首个具备可证性能保证的技能选择算法。我们总结主要贡献如下: - **新形式化**:在第3节将技能选择形式化为令牌预算约束下的正则化子模最大化问题。结构化目标显式捕获冗余性、互补性和上下文成本,其参数可从执行结果拟合,且拟合误差可证明转移为有界选择遗憾。我们在第5.2节通过真实执行验证了该模型。 - **最优双标准保证**:我们开发了最佳前缀选择(BPS,算法1),一种针对技能选择问题的多项式时间算法,并证明了紧致的(1−1/e, 1)双标准保证(定理1),实现了效益近似系数的最优性。在分析中,我们提出了预算对齐插值技术,该技术利用预算约束与上下文惩罚共享相同长度坐标的事实,得出紧致的效益系数1−1/e(第4.3节)。 - **真实场景实验**:我们构建了一个受控污染基准,其任务被设置为:除非注入的技能提供所需的所有能力,否则无法解决。在此基准上,仅从通过/失败记录拟合的目标函数(1)能准确预测未见技能集并恢复其隐藏的能力覆盖;BPS在每个选择实例上达到精确最优;其选择的技能集在测量任务成功率上比所有可运行的已部署选择器高出0.22–0.53,且使用的令牌比最强发布路由器少28%(第3.3节和第5节)。 ## 2. 相关工作 ### 2.1. LLM代理的技能选择 技能检索与路由[4, 41, 44, 45, 57]将大型技能库缩减为下游选择的候选池,遵循源自工具使用的流程[37, 38]。SkillsInjector[29]学习注入技能数量并联合呈现;SkillSelect-Serve[56]在令牌和部署约束下贪婪打包项级分数;Graph-of-Skills[31]在上下文上限下扩展依赖感知的包,但其有预算目标尚未解决;GoSkills[52]和SkillComposer[55]组装有界技能组和自回归子集。据我们所知,这些启发式方法均未对注入集声明可证保证。 具备保证的相关研究针对不同对象:PACMS[13]在令牌背包约束下对累积会话内容应用设施位置覆盖;[50]的背包组合器在线接纳代理组件并具备竞争比。相反,我们将固定执行器的技能选择表述为硬性背包令牌预算下的正则化子模最大化,显式建模集合级冗余与互补性。 ### 2.2. 正则化子模最大化 背包预算下的子模最大化是在受限资源上放置内容和服务的经典范式[14, 36]。技能选择以该范式为基础,但将约束替换为上下文窗口。对于纯效益目标,具有三元种子枚举的密度贪婪算法能达到紧致的1−1/e[42],改进分析将枚举种子缩小至二元[7, 24]。ParetoGreedy[43]通过记录每个贪婪链的每个前缀扩展该范式以处理效益-成本权衡,并证明了帕累托前沿的实例依赖保证,但未对固定κ下的正则化目标G−κℓ给出保证。 然而,最大化此正则化目标改变了问题特性:目标可能为负,排除了任何常数乘性近似[33]。Distorted greedy[18]仅在基数约束下达到(1−1/e, 1)双标准保证。在硬背包约束下,正则化目标的保证源自两个关联稀疏的领域。将[35]的背包Ψ-贪婪专用于我们的对齐目标,在O(B/ε)预算级别下给出(1−1/e, 1)(直至加性κε)。预算利润工作分别达到(1/4, 1)[15]和(1−1/e)/2, 1/2[16](近线性时间),以及1/8−ε, 1[53](单遍流处理)。 我们的结果精确达到(1−1/e, 1),无需这些妥协,且效益系数1−1/e对多项式时间算法是最优的(第4节)。 ## 3. 模型与优化问题 本节形式化现代LLM代理中的两阶段技能交互模型。设L={s1,⋯,sL}表示技能库,其中si是第i个技能文档。给定查询q,选择阶段为下游固定执行器E选择一个技能子集,记为S⊆[L]。将所选技能文档注入其上下文窗口后,E执行查询q并产生可观察结果YE(q,S)。我们定义技能集S的执行效果...
相似文章
SkillSelect-Serve: 预算可控且QoS感知的小型LLM智能体技能服务推荐与组合
介绍了SkillSelect-Serve,一个用于小型LLM智能体的预算可控且QoS感知的技能服务推荐与组合框架,在大型注册表上评估,并展示了相比Top-K检索更高的召回率和效用。
SkillLearnBench:面向真实任务代理技能生成的持续学习方法基准
SkillLearnBench 推出首个评估 LLM 代理持续技能学习的基准,覆盖 20 项真实任务,结果显示尚无方法全面领先,单纯扩大模型规模也无法保证技能提升。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。
Bayesian-Agent:后验引导的LLM代理技能进化框架
Bayesian-Agent 提出了一种框架,将可重复使用的技能和SOP视为假设,通过贝叶斯推理指导代理行为,并利用后验引导的框架优化提升任务性能。使用deepseek-v4-flash在多个基准上取得了显著改进。