SkillSeek:在市场规模下重新审视智能体技能检索
摘要
AACL-IJCNLP 2026 Findings 论文表明,经典词法检索(BM25 加上一个小型交叉编码器)在 4 种场景中的 3 种上与智能体式技能检索持平甚至更优,而成本仅约为后者的一半,因此作者主张智能体式检索应作为备选方案而非默认方案。
查看缓存全文
缓存时间: 2026/10/01 04:20
论文速览 - SkillSeek:在技能市场规模下重新审视 Agent 技能检索
来源:https://huggingface.co/papers/2609.38822 已被 AACL-IJCNLP 2026 Findings 接收。
Agent Skill(智能体技能)是一个包含指令的文件夹,用于教 AI 智能体完成某项特定任务。智能体在启动时只阅读每个技能的简短摘要,仅在任务看起来相关时才打开全文。
这类技能的公开集合增长迅猛。最近一次爬取在各大分发平台上共统计到 238,180 个技能。
因此,任何人都可以编写技能,难点在于选择加载哪些技能。
❌ 全部加载并不可行。即使在一个仅包含 192 个技能的池中,全部加载会让智能体的得分与不使用任何技能时完全相同,而 token 消耗却增加了 59%。
❌ 宽泛地加载同样不行。一个相关技能能将智能体提升 17.8 分;两个或三个能提升 18.6 分;四个及以上反而会跌回 5.9 分。
因此,检索器必须精准命中,而不仅仅是“差不多“。
该领域得出的结论是让智能体自行检索:改写查询、浏览候选技能,并将它们组合成一个面向该任务的新技能。
这一答案有其真正优势。在一项关于跨 GPU 切分张量的任务中,智能体找到了两个部分相关的技能,并将它们合并成一个两者都不包含的新方案。固定的检索器无法做到这一点。
🔍 于是我们想探究:这种优势在多大程度上会决定最终结果。
我们使用 11 种检索方法,在 4 种设定(两种技能池规模 × 两种语言模型)下进行了实验,基于一个包含 89 个任务的基准测试,由测试套件判定智能体是否成功。
📊 结果。通过率是指 89 个任务中被成功解决的比例,越高越好。
✅ 仅用 BM25——一种源自 1990 年代的关键词匹配方法——在 4 种设定中的 3 种上与智能体式循环(agentic loop)持平或胜出 ✅ 一个小型交叉编码器在第四种设定上追平差距,达到相同的 0.442 通过率 ✅ 单次运行成本:不使用技能为 27.41 美元,使用我们的检索器为 27.54 美元,使用智能体式循环为 51.30 美元 ✅ 我们的检索器在 CPU 上运行,不消耗任何语言模型 token
我们并不是说智能体式检索是错的。我们想说的是,它应当作为兜底方案,而标准的检索方法才是你首先应该尝试的。
⚠️ 论文中报告的一个局限:在大型技能池上,第一阶段的召回率限制了任何重排序器的上限,而智能体式循环的成本优势正是体现在这一上限处。
🙏 与 Wenlong Zhang、Tian Shi 和 Ping Wang 的合作成果。
相似文章
SkillRet:面向 LLM 智能体技能检索的大规模基准
本文提出了 SkillRet,这是一个用于评估 LLM 智能体技能检索的大规模基准,旨在解决从大型技能库中选择相关技能的挑战。该基准提供了包含超过 17,000 项技能的 dataset,并证明针对特定任务的微调能显著提升检索性能。
表示方式影响检索:多模态代理框架中技能发现与路由的案例研究
本文介绍了一个关于多模态代理框架中技能发现与路由的案例研究,表明在提示中部分暴露技能可能会产生词汇竞争,从而阻碍正确选择,将小规模的上下文检索与大规模方法联系起来。
Skill Following: 评估检索增强LLM代理中的实际技能使用
本文介绍了Skill Following和检索调用实际使用效应(RAE),用于评估LLM代理中的技能检索是否真正提升任务性能,揭示了聚合指标可能具有误导性。
从词法基线到智能体检索增强生成:基于SFIA框架的结构化技能与责任级别抽取
本文将基于SFIA的自由文本技能与责任级别抽取工作形式化,评估了五种策略:词法基线、结合大语言模型重排序的稠密检索、零样本模式约束的大语言模型、单智能体智能体式检索增强生成(RAG),以及由检索器、匹配器与验证器组成的三智能体协作团队。研究发现,显式的级别预测是关键因素,而多智能体团队虽增加了延迟,却并未带来准确率提升。
@dair_ai: 关于检索到的智能体技能是否真正有帮助的良好测量工作。他们报告说,提升聚合得分的智能体技能可能会伤害……
论文引入了检索调用实际使用效果(RAE)来评估检索到的技能是否真正帮助LLM智能体,显示聚合指标可能会通过隐藏对特定任务的负面影响而产生误导。