SkillSeek:在市场规模下重新审视智能体技能检索

Hugging Face Daily Papers 论文

摘要

AACL-IJCNLP 2026 Findings 论文表明,经典词法检索(BM25 加上一个小型交叉编码器)在 4 种场景中的 3 种上与智能体式技能检索持平甚至更优,而成本仅约为后者的一半,因此作者主张智能体式检索应作为备选方案而非默认方案。

Anthropic 的 Agent Skills 将 LLM 智能体可复用的程序性知识封装进 SKILL.md 目录,开源聚合库已收录超过 23 万个技能,因此瓶颈已从技能编写转向技能选择。文献中一贯的做法是把选择外包给智能体本身:一个由 LLM 驱动的检索循环,在智能体的决策流程中重写查询、细化候选,每个任务都要消耗 LLM token。我们提出 SkillSeek,一个基于标准信息检索方案构建的开源两阶段技能检索器(BGE-base 双编码器 + 小型交叉编码器,通过 MCP 提供服务)。在 89 个任务的 SkillsBench 基准上,围绕技能池、基座模型和方法构建 4×11 的实验矩阵,SkillSeek 几乎以零额外成本达到了与 Liu et al. 的 LLM 驱动循环相当的表现:仅使用朴素 BM25,在 4 种场景中的 3 种上通过率就已不低于他们的精炼循环,剩下的第四种场景则由一个小型交叉编码器补足差距。第一阶段召回率上限可以解释这一模式,且每次试验的总花费从 51.30 美元降至 27.54 美元(与无技能基线仅相差 50 美分)。在我们测试的 SkillsBench 任务与 OpenHands 框架下,这表明标准信息检索方案是智能体技能检索的有力默认选择,而 LLM 驱动的替代方案更适合确定性方法无法胜任的场景。
查看原文
查看缓存全文

缓存时间: 2026/10/01 04:20

论文速览 - SkillSeek:在技能市场规模下重新审视 Agent 技能检索

来源:https://huggingface.co/papers/2609.38822 已被 AACL-IJCNLP 2026 Findings 接收。

Agent Skill(智能体技能)是一个包含指令的文件夹,用于教 AI 智能体完成某项特定任务。智能体在启动时只阅读每个技能的简短摘要,仅在任务看起来相关时才打开全文。

这类技能的公开集合增长迅猛。最近一次爬取在各大分发平台上共统计到 238,180 个技能。

因此,任何人都可以编写技能,难点在于选择加载哪些技能。

❌ 全部加载并不可行。即使在一个仅包含 192 个技能的池中,全部加载会让智能体的得分与不使用任何技能时完全相同,而 token 消耗却增加了 59%。

❌ 宽泛地加载同样不行。一个相关技能能将智能体提升 17.8 分;两个或三个能提升 18.6 分;四个及以上反而会跌回 5.9 分。

因此,检索器必须精准命中,而不仅仅是“差不多“。

该领域得出的结论是让智能体自行检索:改写查询、浏览候选技能,并将它们组合成一个面向该任务的新技能。

这一答案有其真正优势。在一项关于跨 GPU 切分张量的任务中,智能体找到了两个部分相关的技能,并将它们合并成一个两者都不包含的新方案。固定的检索器无法做到这一点。

🔍 于是我们想探究:这种优势在多大程度上会决定最终结果。

我们使用 11 种检索方法,在 4 种设定(两种技能池规模 × 两种语言模型)下进行了实验,基于一个包含 89 个任务的基准测试,由测试套件判定智能体是否成功。

📊 结果。通过率是指 89 个任务中被成功解决的比例,越高越好。

✅ 仅用 BM25——一种源自 1990 年代的关键词匹配方法——在 4 种设定中的 3 种上与智能体式循环(agentic loop)持平或胜出 ✅ 一个小型交叉编码器在第四种设定上追平差距,达到相同的 0.442 通过率 ✅ 单次运行成本:不使用技能为 27.41 美元,使用我们的检索器为 27.54 美元,使用智能体式循环为 51.30 美元 ✅ 我们的检索器在 CPU 上运行,不消耗任何语言模型 token

我们并不是说智能体式检索是错的。我们想说的是,它应当作为兜底方案,而标准的检索方法才是你首先应该尝试的。

⚠️ 论文中报告的一个局限:在大型技能池上,第一阶段的召回率限制了任何重排序器的上限,而智能体式循环的成本优势正是体现在这一上限处。

🙏 与 Wenlong Zhang、Tian Shi 和 Ping Wang 的合作成果。

相似文章

SkillRet:面向 LLM 智能体技能检索的大规模基准

arXiv cs.AI

本文提出了 SkillRet,这是一个用于评估 LLM 智能体技能检索的大规模基准,旨在解决从大型技能库中选择相关技能的挑战。该基准提供了包含超过 17,000 项技能的 dataset,并证明针对特定任务的微调能显著提升检索性能。

从词法基线到智能体检索增强生成:基于SFIA框架的结构化技能与责任级别抽取

arXiv cs.CL

本文将基于SFIA的自由文本技能与责任级别抽取工作形式化,评估了五种策略:词法基线、结合大语言模型重排序的稠密检索、零样本模式约束的大语言模型、单智能体智能体式检索增强生成(RAG),以及由检索器、匹配器与验证器组成的三智能体协作团队。研究发现,显式的级别预测是关键因素,而多智能体团队虽增加了延迟,却并未带来准确率提升。