超越Top-$k$技能检索:面向LLM代理的多样性感知技能路由

arXiv cs.AI 论文

摘要

本文提出了多样性感知技能路由(DSR),一种使用行列式点过程来平衡LLM代理技能选择中的相关性和非冗余性的重排序框架,从而在基准测试中提升召回率和覆盖率。

arXiv:2609.05824v1 公告类型:新 摘要:大语言模型(LLM)代理越来越多地依赖外部技能,但在大型技能注册表中路由用户请求是困难的,因为许多技能在功能上是冗余的,而复杂任务通常需要互补的技能集。现有的技能路由器通常根据查询相关性独立排序候选技能,这可能在冗余技能上浪费上下文预算。我们提出了多样性感知技能路由(DSR),一种使用行列式点过程来平衡相关性和非冗余性的多样性感知重排序框架。DSR引入了一个查询残差多样性内核,惩罚冗余技能重叠,同时减少仅由共享查询相关性引起的惩罚。在SkillRouter基准测试上,DSR相比强单点重排序基线,在召回率和全覆盖方面有所改进,在多技能查询上收益更大。这些结果表明,技能路由不仅应被视为相关性排序,还应被视为互补集选择。
查看原文
查看缓存全文

缓存时间: 2026/09/10 08:43

# LLM智能体的多样性感知技能路由
来源: https://arxiv.org/html/2609.05824
## 超越Top-k技能检索:面向LLM智能体的多样性感知技能路由

田凯杨¹, 桑亚迪普·巴苏², 陈洪杰³, 赵越¹, 涂铮忠⁴, 胡锡阳⁵, 弗朗克·德农库尔², 瑞安·A·罗西², 霍达·达德里¹*  
¹南加州大学, ²Adobe研究院, ³杜比实验室, ⁴德克萨斯A&M大学, ⁵亚利桑那州立大学
*通讯作者: 弗吉尼亚理工大学

###### 摘要

大型语言模型(LLM)智能体日益依赖外部技能,但由于许多技能功能重复且复杂任务常需互补技能集,在大型技能注册表中进行用户请求路由极具挑战。现有技能路由器通常独立地按查询相关性排序候选技能,这会在冗余技能上浪费上下文预算。我们提出多样性技能路由(DSR),一种多样性感知重排序框架,利用确定性点过程平衡相关性与非冗余性。DSR引入查询残差多样性核,惩罚冗余技能重叠,同时减少仅由共享查询相关性引起的惩罚。在SkillRouter基准测试中,与强大的逐点重排序基线相比,DSR提升了召回率和完全覆盖率,在多技能查询上提升尤为显著。这些结果表明,技能路由不应仅视为相关性排序,更应视为互补集合选择。

## 1引言

大型语言模型(LLM)智能体日益依赖外部工具和技能来解决超出直接文本生成能力的任务。早期工具使用系统表明,语言模型能够学习何时及如何调用外部API(Schick等人,2023),后续智能体框架则利用LLM分解用户请求、选择外部模型或工具并聚合其输出(Shen等人,2023;Qin等人,2023)。近期,基于技能的智能体将程序性知识组织为可复用模块,如指令、脚本、示例和参考文档,可在推理时加载到上下文中(Wang等人,2023;Xu和Yan,2026)。这种设计使智能体更具可扩展性,因为新功能可通过外部技能库添加,而非模型重训练。

然而,技能库的增长带来了新的路由瓶颈。当有数千或数万技能可用时,将所有技能暴露给智能体并不可行,因为上下文窗口有限,且不相关技能可能干扰执行。近期技能路由研究直接解决此问题,从大型注册表中检索任务相关技能。例如,SkillRouter在约80K技能池上评估技能选择,显示完整技能实现包含超越名称和描述的重要路由信号(Zheng等人,2026)。SkillsBench进一步强调精心策划的技能可提升智能体性能,但其益处很大程度上取决于任务和技能质量(Li等人,2026)。这些发现表明,技能选择正成为实际LLM智能体系统的核心组件。

现有技能路由器通常将选择表述为逐点检索或重排序问题:每个候选技能独立根据查询评分,返回排名靠前的技能。这对于单技能任务很自然,其成功取决于找到一个正确技能。然而,许多现实智能体任务是组合式的。用户请求可能需要多个互补技能,如文档解析、信息提取、数据转换和可视化。在此类情况下,独立top-k检索可能返回冗余候选列表:若干技能可能具有相似描述或实现,因此获得高相关性分数,而其他必要但不同的技能则被遗漏。这浪费了有限的上下文预算,并削弱了智能体覆盖多步骤工作流所有部分的能力。

我们认为,大规模技能路由不应仅视为相关性排序,更应视为互补集合选择。此视角与多样性感知检索相关,其目标是选择既各自有用又相互非冗余的项目。确定性点过程(DPP)通过偏好高质量且高多样性的集合为此类子集选择问题提供了合理的概率模型(Kulesza和Taskar,2012)。DPP已广泛用于选择多样化的高质量子集,但将其直接应用于技能路由并非易事。在技能路由中,两个技能可能相似因为它们是冗余的,但也可能相似因为两者都与同一查询相关,同时覆盖任务的不同步骤。统一惩罚所有相似性可能会移除有用的互补技能。

为解决此问题,我们提出多样性技能路由(DSR),一种面向大规模技能选择的多样性感知重排序框架。DSR基于标准的检索-重排序流程:检索器首先生成候选技能,质量模型分配查询相关性分数。然后,DSR应用基于DPP的选择构建平衡相关性与非冗余性的技能集。关键组件是查询残差多样性核,它在移除每个技能表示中与查询对齐的成分后,测量技能间冗余性。此设计减少了对与查询共同相关的技能的惩罚,同时仍抑制近乎重复的候选。最终按质量分数排序所选技能以生成排名列表。

我们在SkillRouter基准(Zheng等人,2026)上评估DSR,该基准包含约80K候选技能,涵盖单技能和多技能查询。与强大的逐点SkillRouter基线相比,DSR提升了召回率和完全覆盖率,在多技能查询和较大截断值上提升更显著。消融研究表明查询残差核至关重要:用标准技能间相似性核替代它会显著降低多技能完全覆盖率。这些结果表明,随着技能注册表持续增长,有效路由应同时考虑与用户请求的相关性和所选技能集的多样性。

我们的贡献如下:
- 我们将大规模技能路由表述为多样性感知子集选择问题,动机来自大型技能库的冗余性以及多技能智能体任务的组合结构。
- 我们提出DSR,一种基于DPP的重排序框架,平衡查询相关性与技能间非冗余性。
- 我们引入查询残差多样性核,区分冗余重叠与共享查询相关性引起的相似性。
- 我们证明DSR相比强大的逐点SkillRouter基线提升了召回率和完全覆盖率,在多技能查询上提升更大。

## 2相关工作

#### 工具使用与技能增强智能体
日益增多的研究探索LLM如何使用外部工具和程序性知识解决超出直接文本生成能力的任务。Toolformer表明语言模型可通过自监督训练信号学习何时及如何调用外部API(Schick等人,2023)。HuggingGPT使用LLM作为控制器分解用户请求、从Hugging Face选择专家模型、执行子任务并聚合结果(Shen等人,2023)。ToolLLM通过构建ToolBench并训练工具使用决策模型,将工具学习扩展至数千现实API(Qin等人,2023)。Voyager研究一种具身环境,其中LLM驱动的智能体随时间构建可执行技能库,并为新任务检索相关技能(Wang等人,2023)。这些工作展示了外部工具和技能的价值,但未直接解决如何从超大技能注册表中选择非冗余技能集的问题。

#### 技能路由与技能评估
近期研究开始将技能视为LLM智能体的一等抽象。Xu和Yan(2026)将智能体技能描述为可组合的指令、代码和资源包,可按需加载。SkillRouter直接研究大规模技能选择,表明对数万技能进行路由具有挑战性,且完整技能实现提供超越名称和描述的重要路由信号(Zheng等人,2026)。SkillsBench评估精心策划的技能是否提升下游智能体性能,发现技能可能有益,但其效果因任务和领域而异(Li等人,2026)。我们的工作与这些研究互补。我们不引入新技能基准或技能表示,而是聚焦选择目标:给定候选池和相关性分数,路由器应如何为多技能任务构建非冗余候选列表?

#### LLM路由
跨LLM路由已成为在异构模型能力和推理成本下提升性能的实用方法。成本感知系统如FrugalGPT使用级联路由降低推理成本同时保持任务性能(Chen等人,2023)。其他方法学习查询相关模型选择策略或模型表示。EmbedLLM学习LLM的紧凑表示,支持模型路由等下游应用(Zhuang等人,2025),而RouterDC使用双重对比学习将查询路由至合适LLM(Chen等人,2024)。近期研究还包括路由基准和学习设置,如RouterBench(Hu等人,2024)、RouterEval(Huang等人,2025)、RouteLLM(Ong等人,2025)和BaRP(Wang等人,2025)。这些方法激励路由作为高效LLM部署的实用机制。然而,LLM路由通常选择一个模型、级联或小模型集,而技能路由常需同时向智能体暴露多个互补技能。这使得所选项目间的冗余性成为技能路由的核心关切。

#### 多样性感知子集选择
多样性长期在检索、推荐和摘要中被研究。最大边际相关性(Maximal Marginal Relevance)平衡查询相关性与新颖性以减少重排序文档列表的冗余(Carbonell和Goldstein,1998),后续多样化方法显式建模多查询方面(Santos等人,2010)。DPP为需要平衡项目质量和多样性的子集选择问题提供了概率框架(Kulesza和Taskar,2012)。它们已用于文档摘要(Cho等人,2019)、推荐(Wilhelm等人,2018)和信息检索(Affandi等人,2014;Deng等人,2020)等场景。DPP MAP推断通常具有挑战性,大规模场景常使用高效贪心变体(Han等人,2017)。我们的工作将此多样性感知视角引入技能路由,其中冗余性源于重叠的程序功能。不同于标准应用惩罚原始项目间相似性,DSR在为查询条件化技能选择量身定制的查询残差空间中计算多样性。

## 3方法
我们现在描述如何从大型技能注册表中为查询选择紧凑的技能集。给定用户查询x和技能池S={s₁,...,sₙ},目标是返回一个包含k个技能的排名列表,这些技能既与查询相关又相互非冗余。标准top-k检索仅满足第一项要求:它独立按相关性排序每个技能,而忽略所选技能是否覆盖任务的不同部分。

我们提出的DSR通过结合查询相关质量分数与多样性感知子集选择来解决此局限。它首先检索少量候选集,为每个候选分配质量分数,然后应用基于DPP的贪心MAP选择构建非冗余候选列表。

我们使用两类评分模型。第一种是编码器检索器,独立嵌入查询和每个技能,并用余弦相似度对配对评分。编码器检索器用于从完整注册表中高效检索候选。第二种是逐点质量模型或重排序器,接受查询-技能对作为输入,输出相关性logit。重排序器更具表达力,但为效率仅应用于检索到的候选集。在我们的主要实验中,DSR使用重排序器分数作为质量信号;我们稍后在第4.3节中通过将重排序器质量替换为基于嵌入的质量来消融此选择。

### 3.1候选技能检索
令eₓ表示查询x的嵌入,eᵢ表示技能sᵢ的嵌入。所有嵌入经L2归一化。我们定义检索分数为aᵢ(x)=eₓᵀeᵢ,并检索得分最高的M个技能:
Cₓ=argmax_{C⊆S, |C|=M} Σ_{sᵢ∈C} aᵢ(x),(1)
其中M≪N。DSR仅在Cₓ内应用多样性感知选择,这使得对大型技能注册表的重排序可行。

### 3.2质量感知DPP选择
对于每个候选技能sᵢ∈Cₓ,DSR需要一个非负质量分数qᵢ(x)衡量其与查询的相关性。在我们的实验中,此分数由SkillRouter使用的已学习逐点重排序器提供。令hᵢ(x)表示查询x和技能sᵢ的原始重排序器logit。我们定义:
qᵢ(x)=σ(hᵢ(x))。(2)
此变换将重排序器logit映射为非负质量分数,其确定DPP核中的项目质量项。

DSR构建DPP核L(x)...

相似文章

SkillRet:面向 LLM 智能体技能检索的大规模基准

arXiv cs.AI

本文提出了 SkillRet,这是一个用于评估 LLM 智能体技能检索的大规模基准,旨在解决从大型技能库中选择相关技能的挑战。该基准提供了包含超过 17,000 项技能的 dataset,并证明针对特定任务的微调能显著提升检索性能。

推理还是记忆?LLM强化学习中的方向感知多样性探索

arXiv cs.AI

本文介绍了DiRL,一种方向感知的强化学习框架,能够在LLM探索中区分推理驱动的多样性和记忆驱动的多样性。它从模型表示中提取内在的推理-记忆方向,并塑造奖励以优先考虑与推理一致的探索,在数学和通用推理基准上表现出改进。