任务分解引导的重排序实现自适应智能体技能检索
摘要
提出SkillReranker,一个推理时重排序框架,通过分解任务和技能来构建有向无环执行图,并使用交叉编码器进行评分,从而提升智能体技能选择的任务性能和效率。
arXiv:2607.06283v1 公告类型:新
摘要:技能使用能显著增强现代智能体系统完成复杂任务的能力。然而,技能库规模的不断增长使得准确技能选择的挑战日益加剧。在现实场景中,特定任务需求与多个通用但语义相似的候选技能之间常出现模糊的语义匹配。此外,现有方法在选择最优目标技能集时,往往忽略了任务难度和技能适用性的动态影响。为解决这些问题,我们提出SkillReranker,一种用于自适应技能选择的推理时重排序框架。具体而言,我们首先在任务和技能两侧进行语义分解,得到信息丰富的子任务描述、执行状态描述以及刻画各技能功能的过渡状态描述。然后利用这些描述构建有向无环执行图,其中中间任务状态建模为节点,候选技能建模为边,从而建立结构化的任务-技能对应关系。在此基础上,SkillReranker判断每个状态节点是否满足分裂条件以识别子任务区间。对于每个任务区间,我们使用交叉编码器对候选技能进行综合评分,并选出最合适的技能组成最终目标技能集。在ALFWorld和ScienceWorld上使用三种骨干大语言模型的实验表明,与现有技能选择基线相比,SkillReranker有效提升了任务性能,减少了环境交互步数并降低了令牌消耗。
查看缓存全文
缓存时间: 2026/07/08 04:39
# 任务分解引导的自适应智能体技能检索重排序框架
来源:https://arxiv.org/html/2607.06283
###### 摘要
技能的使用可以显著增强现代智能体系统完成复杂任务的能力。然而,技能库规模的不断扩大使得精确的技能选择变得越来越具挑战性。在现实场景中,特定任务需求与多个语义相似但实际用途不同的候选技能之间常常出现模糊的语义匹配。此外,现有方法在选择最优目标技能集时,往往忽略了任务难度和技能适用性的动态影响。为了解决这些问题,我们提出 SkillReranker,一种用于自适应技能选择的推理时重排序框架。具体来说,我们首先在任务和技能两侧进行语义分解,生成信息丰富的子任务和执行状态描述,以及表征每个技能功能的转换状态描述。然后利用这些描述构建一个有向无环执行图,其中中间任务状态建模为节点,候选技能建模为边,从而建立结构化的任务-技能对应关系。在此基础上,SkillReranker 判断每个状态节点是否满足划分条件以确定子任务区间。对于每个任务区间,我们使用交叉编码器对候选技能进行全面评分,并选择最合适的技能形成最终的目标技能集。在 ALFWorld 和 ScienceWorld 上使用三种骨干大语言模型的实验表明,与现有的技能选择基线相比,SkillReranker 能有效提升任务性能,减少环境交互步数,并降低 token 消耗。
## 1 引言
技能已成为增强大语言模型(LLM)智能体解决复杂任务能力的有效机制(Liu et al. 2025 (https://arxiv.org/html/2607.06283#bib.bib28); Wang et al. 2026b (https://arxiv.org/html/2607.06283#bib.bib29); Li et al. 2026c (https://arxiv.org/html/2607.06283#bib.bib13))。技能库不需要智能体完全依赖底层 LLM 的隐式推理和动作生成,而是显式组织领域知识和过程性指导,从而提供更稳定的执行支持(Xu and Yan 2026 (https://arxiv.org/html/2607.06283#bib.bib30); Jiang et al. 2026 (https://arxiv.org/html/2607.06283#bib.bib22))。然而,随着技能库规模不断增长(Li et al. 2026b (https://arxiv.org/html/2607.06283#bib.bib27)),技能之间的功能边界变得越来越模糊。如何从大量候选技能中精确选择最匹配给定任务需求的技能,仍然是基于 LLM 的智能体面临的关键挑战(Su et al. 2026 (https://arxiv.org/html/2607.06283#bib.bib18); Cho et al. 2026 (https://arxiv.org/html/2607.06283#bib.bib34))。这一挑战首先源于任务需求与技能描述之间的粒度差异。在现实场景中,任务需求通常是具体且简洁的,而技能描述则往往更加通用,通常针对一类相似任务或可复用的操作模式(Liang et al. 2026a (https://arxiv.org/html/2607.06283#bib.bib24); Zheng et al. 2026 (https://arxiv.org/html/2607.06283#bib.bib17))。因此,一个特定任务可能与多个候选技能匹配,这些技能在语义上看似相似,但在实际效用上却存在显著差异,如图1(https://arxiv.org/html/2607.06283#S1.F1)所示,两个与加热相关的技能具有不同的前提条件和执行流程。仅依赖整体文本相似性的选择方法容易出现语义歧义,将表面层面的语义相关性误认为真正的功能适用性,从而损害技能选择的准确性。
<figure>
<figcaption>图1:技能间语义相似性导致的任务匹配困难。该任务选自 ALFWorld 数据集。</figcaption>
</figure>
与此同时,任务在执行难度和复杂度上各不相同,这反过来导致对所需技能数量和适用范围的不同要求(Qian et al. 2025 (https://arxiv.org/html/2607.06283#bib.bib33))。选择过少的技能可能不足以支持复杂任务的完成,而选择过多的技能则可能引入冗余信息,增加智能体的决策负担,甚至干扰后续执行(Liu et al. 2024 (https://arxiv.org/html/2607.06283#bib.bib32); Han et al. 2026 (https://arxiv.org/html/2607.06283#bib.bib31))。因此,技能选择不应仅仅被视为对固定数量候选技能进行排序的过程。相反,最终的目标技能集应根据任务需求和候选技能之间的功能差异动态确定。
为了解决这些问题,我们提出 SkillReranker,一种用于自适应技能选择的推理时重排序框架。具体来说,首先对任务描述和技能文本进行语义分解。在任务侧,每个任务被表示为由子任务和中间状态组成的执行过程;在技能侧,提取状态描述以表征每个技能的适用条件和预期效果。基于这些状态表示,SkillReranker 构建一个有向无环执行图,其中中间任务状态作为节点,技能作为边,从而对任务-技能关系进行细粒度建模。该框架然后判断每个状态节点是否能定义技能选择的局部边界,动态地将任务划分为子任务区间,并在每个区间内使用交叉编码器对候选技能进行全面评分,从而选择最终的目标技能集。通过这种结构建模后接区间级重排序的两阶段设计,SkillReranker 提高了技能匹配的判别性,同时根据任务难度和技能适用性自适应地确定所选技能的数量和组成。我们在两个基准数据集 ALFWorld 和 ScienceWorld 上,使用三种不同模型配置进行实验,并分析我们的方法对技能选择质量和任务完成性能的影响。结果表明,SkillReranker 能更有效地识别与任务执行不同阶段相匹配的技能,并根据任务复杂性动态调整目标技能集,从而提升智能体解决复杂任务的能力。我们的主要贡献如下:
- • 我们提出 SkillReranker,一种推理时自适应技能重排序框架,根据任务需求动态选择目标技能集,克服了固定 Top-k 检索的局限。
- • 我们设计了一种任务执行过程与技能状态信息之间的结构化对齐机制,通过有向执行图实现对候选技能的细粒度建模和选择。
- • 我们在 ALFWorld 和 ScienceWorld 上进行系统性实验,证明了 SkillReranker 在技能选择质量和任务完成性能方面的有效性。
## 2 相关工作
**技能检索与选择。** 技能库为智能体提供可复用的过程性知识(Wang et al. 2023 (https://arxiv.org/html/2607.06283#bib.bib12))。然而基准测试表明,更多技能并不一定更好:过大的上下文会稀释注意力,且智能体难以判断哪些技能值得加载(Li et al. 2026c (https://arxiv.org/html/2607.06283#bib.bib13); Liu et al. 2026b (https://arxiv.org/html/2607.06283#bib.bib14); Wang et al. 2026c (https://arxiv.org/html/2607.06283#bib.bib15))。为了解决这个问题,检索-重排序流水线通过密集检索和交叉编码器评分缩小候选范围(Li et al. 2026a (https://arxiv.org/html/2607.06283#bib.bib16); Zheng et al. 2026 (https://arxiv.org/html/2607.06283#bib.bib17)),后者发现技能主体比其元数据更具决定性;另一些工作则将其视为按需增强,其瓶颈在于决定是否加载以及加载哪个技能(Su et al. 2026 (https://arxiv.org/html/2607.06283#bib.bib18))。在呈现和预算方面,有工作为每个任务调整预算(Li et al. 2026d (https://arxiv.org/html/2607.06283#bib.bib19)),通过压缩和渐进式披露来削减冗余(Gao et al. 2026 (https://arxiv.org/html/2607.06283#bib.bib20)),或在性能-成本权衡下推断技能需求(Wang et al. 2026a (https://arxiv.org/html/2607.06283#bib.bib21))。这些方法将扁平候选集作为一个匹配目标进行评分;而我们则将选择与任务的中间执行状态对齐。
**结构化技能建模。** 与传统工具调用不同,技能是自包含的过程性知识包,因此管理和使用它们需要对接口、执行结构和动作证据进行推理(Jiang et al. 2026 (https://arxiv.org/html/2607.06283#bib.bib22))。为了抑制纯文本表示的歧义,一条研究路线将这些信号解耦为关系本体或分层模式(Liang et al. 2026b (https://arxiv.org/html/2607.06283#bib.bib23), a (https://arxiv.org/html/2607.06283#bib.bib24)),而另一条路线则构建可执行的技能图或能力树,用于依赖感知检索和基于 DAG 的编排(Liu et al. 2026a (https://arxiv.org/html/2607.06283#bib.bib25); Xia et al. 2026 (https://arxiv.org/html/2607.06283#bib.bib26); Li et al. 2026b (https://arxiv.org/html/2607.06283#bib.bib27))。然而,这些图将技能置于节点,捕捉技能侧的依赖关系,并未与任务自身的执行过程对齐。我们则构建一个有向无环执行图,其中节点是任务中间状态,边是技能,将每个技能的前提条件和效果与任务状态对齐,并在动态划分的子任务区间内进行重排序。
<figure>
<figcaption>图2:所提框架概览。(1) 结构解析:将任务分解为子任务和状态(在线),并将每个技能解析为前提/完成状态(离线)。(2) 执行图构建:召回 Top-KK 候选技能,将其前提/完成状态与任务状态匹配,将每个技能转化为状态匹配图中的边。(3) 自适应技能选择:检测划分点将任务分割成片段,在每个片段内通过全局和局部分数对技能进行重排序,并对每个片段的胜出者去重,形成大小自适应的最终技能集。</figcaption>
</figure>
## 3 问题形式化
给定一个用自然语言描述的任务 qq,我们的目标是选择一个技能集,能够支持智能体完成该任务。令 S=s1,...,sN\\mathcal{S}=\{s_{1},\dots,s_{N}\} 表示从开源平台 skillsmp.com 收集的技能库,其中包含 N=67,884N=67{,}884 个技能。每个技能 sis_{i} 包含元数据 mim_{i}(包括其名称和简短描述)以及完整的技能文本 cic_{i}。由于本工作聚焦于重排序阶段的自适应技能选择,我们首先为每个任务检索一个大小为 KK 的候选集。我们使用嵌入模型 E(⋅)E(·)(实例化为 Qwen3-Embedding-0.6B (Zhang et al. 2025 (https://arxiv.org/html/2607.06283#bib.bib35)))对任务 qq 和每个技能元数据 mim_{i} 进行编码,并选择余弦相似度最大的 KK 个技能:
CK(q)=Top-Ksi∈S[cos(E(q),E(mi))].\mathcal{C}_{K}(q)=\operatorname*{Top\text{-}K}_{s_{i}\in\mathcal{S}}\left[\cos\bigl(E(q),E(m_{i})\bigr)\right]. (1)
在我们的实验中 K=30K=30。这一步为重排序定义了一个紧凑的候选空间,但并未限制最终选择集必须恰好包含 KK 个技能。给定候选集 CK(q)\mathcal{C}_{K}(q),自适应技能选择被形式化为根据任务描述和每个候选技能的完整文本选择候选子集:
S⋆(q)=f(q,{si∣si∈CK(q)})⊆CK(q).\mathcal{S}^{\star}(q)=f\bigl(q,\,\{s_{i}\mid s_{i}\in\mathcal{C}_{K}(q)\}\bigr)\subseteq\mathcal{C}_{K}(q). (2)
其中 ff 表示由 SkillReranker 实现的重排序和选择函数。S⋆(q)\mathcal{S}^{\star}(q) 的成员和大小根据任务需求和候选技能之间的功能差异自适应确定。
## 4 方法
本节介绍所提框架的具体实现。该框架包括三个主要组件,如图2(https://arxiv.org/html/2607.06283#S2.F2)所示。首先,我们分别对任务和技能进行结构化解析。基于解析得到的表示,构建一个执行图,其中任务子状态表示为节点,技能建模为边。最后,在图结构的引导下,框架自适应地确定阶段划分并为每个阶段选择技能。
### 4.1 任务与技能的结构化解析
我们首先将自由形式的任务指令和技能文档转化为带有状态语义的结构化表示,以便后续能够在统一的状态空间中进行对齐。
#### 任务解析。
给定一个任务指令,我们使用专家 LLM 首先将其按逻辑执行顺序分解为一个有序的高层子任务序列 T=(t0,...,tm−1)T=(t_{0},\dots,t_{m-1})。基于这些子任务,LLM 进一步推导出一个关键子状态序列 S=(s0,...,sm)S=(s_{0},\dots,s_{m}),其中 s0s_{0} 表示初始任务状态,后续每个状态 si+1s_{i+1} 描述完成子任务 tit_{i} 后的任务进度。这样,每个子任务自然对应两个连续子状态之间的转换。任务解析使用的提示模板见附录 B.1。为了使解析后的表示更具体,下面给出一个提取的任务字段示例。
<details>
<summary>解析的任务字段示例</summary>
(此处展示示例内容,原文示例未提供具体文本,故保留占位)
</details>
#### 技能解析。
对于技能库中的每个技能 kk,我们也使用专家 LLM 将其技能文档解析为两个状态描述:前提状态 pkp_{k} 和完成状态 eke_{k}。前提状态指定了调用该技能之前所需的任务或环境条件,而完成状态描述了技能成功执行后的预期状态。如果某个技能不需要任何特定前提,则其前提状态设为 None。此解析过程将每个技能表征为由 pkp_{k} 到 eke_{k} 的状态转换。技能解析在预处理阶段离线执行,解析结果与原始技能元数据一起缓存。技能解析使用的提示模板见附录 B.2。以下示例展示了如何将技能文档转换为结构化的前提状态和完成状态。
<details>
<summary>解析的技能字段示例</summary>
(此处展示示例内容,原文示例未提供具体文本,故保留占位)
</details>
### 4.2 执行图构建
对于给定任务,我们首先使用句子编码器对技能库进行粗粒度召回,选取与任务相似度最高的 Top-KK 技能,得到候选技能集 C\mathcal{C}。然后以任务子状态为节点,将每个候选技能映射为图中的一条有向边,从而构建该任务的执行图,其节点集为 {s0,...,sn−1}\{s_{0},\dots,s_{n-1}\}。具体地,我们使用交叉编码器重排序器 r(⋅,⋅)r(·,·) 来度量两段文本之间的相关性。对于每个候选技能 kk,我们首先将其前提状态与每个子状态对标...(原文后续内容未完整提供,但根据结构,后续应为详细映射和区间划分步骤。此处按已有文本翻译至此处。)
(注意:原文 4.2 节后续内容被截断,但根据已给文本,需要完整翻译至节尾。由于用户提供的原文中 4.2 节之后还有部分内容,但未出现在消息中。我假设用户希望翻译所给的完整内容。检查用户消息:从“# Task Decomposition-Guided Reranking ...”到“For each candidate skill kk, we first align its precondition state with each su”结束。所以最后一句不完整。但作为翻译,我应忠实于给定的文本。最后不完整的句子按字面翻译。)
对于每个候选技能 kk,我们首先将其前提状态与每个子状态对齐...相似文章
Skill-RM: 通过智能体技能统一异构评估标准
Skill-RM 提出了一种统一的奖励建模框架,将奖励计算视为结构化的智能体任务,实现了动态证据聚合和跨多种应用的一致评估,优于传统的评判基线。
SkillEval:将智能体技能质量分解为可解释的信号
SkillEval 提出了一种可解释框架,通过将技能文档表示投影到固定的评分方向上,将智能体技能质量分解为不同的语义属性,从而支持对技能文档的诊断和有针对性的修订。
超越Top-$k$技能检索:面向LLM代理的多样性感知技能路由
本文提出了多样性感知技能路由(DSR),一种使用行列式点过程来平衡LLM代理技能选择中的相关性和非冗余性的重排序框架,从而在基准测试中提升召回率和覆盖率。
RESOURCE2SKILL:从人类创建的多模态资源中提炼可执行智能体技能
RESOURCE2SKILL是一个框架,它将教程视频、代码仓库、文章和工件等多模态资源提炼为层次化的SkillWiki中的可执行智能体技能,相比无技能智能体,将智能体性能提升了11.9个百分点。
SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time
This paper introduces SkillAligner, a training-free framework that treats retrieved skills as adaptable drafts, jointly adapting them to task requirements, execution environments, and other skills to mitigate skill-execution misfit and improve agent performance.