表示方式影响检索:多模态代理框架中技能发现与路由的案例研究
摘要
本文介绍了一个关于多模态代理框架中技能发现与路由的案例研究,表明在提示中部分暴露技能可能会产生词汇竞争,从而阻碍正确选择,将小规模的上下文检索与大规模方法联系起来。
arXiv:2608.20389v1 Announce Type: new
摘要:一个生产级代理框架必须从不断增长的技能库中发现并排序最适合用户任务的技能。在小规模下,这种选择在上下文中发生:LLM规划器在其系统提示中暴露的技能表示中进行选择,无需显式的基于嵌入的检索步骤。我们将这种上下文内选择视为大规模基于嵌入的技能检索的小规模对应部分,并以Tinyclaw这一生产级多模态视频代理框架为例,介绍其如何为规划器表示技能。该框架以两种常见表示方式提供技能:包装单个外部API或系统工具并作为基本词汇的工具技能,以及协调工具技能调用并加上模板渲染以生成一个命名交付物的工作流技能。框架通过系统提示中的两个界面暴露技能:用于自动加载技能的内联体界面(完整说明、脚本、模板),以及用于按需技能的单行列表。一项跨越三种暴露机制(全开、默认、全关)的六任务选择消融研究表明,全自动加载在每个任务上都选择了最佳技能;全关模式减慢执行并导致难以发现的故障;而生产默认模式错误路由了一个任务,因为其词汇信号与自动加载的工具技能冲突,将规划器注意力从列出的工作流技能上移开。主要发现是,在提示中暴露技能并非单调有益:部分暴露可能产生词汇竞争,从而抑制正确选择。我们将这一小规模观察与最近的大规模基于检索的技能路由工作联系起来,并将这一贡献定位为案例研究而非基准测试。
查看缓存全文
缓存时间: 2026/08/24 04:06
# 多模态智能体框架中的技能发现与路由案例研究 来源:https://arxiv.org/html/2608.20389 ## 表征影响检索:多模态智能体框架中的技能发现与路由案例研究(2026) ###### 摘要。 生产级智能体框架必须从不断增长的技能库中发现并排序最适合用户任务的技能。在小规模场景下,这种选择是*上下文内*进行的:LLM 规划器在系统提示中呈现的技能表征间进行选择,无需显式的基于嵌入的检索步骤。我们将这种上下文内选择视为大规模基于嵌入的技能检索的小规模对应方案,并以 Tinycloud(一个生产级多模态视频智能体框架)为例,研究其如何为规划器表征技能。框架以两种常见的表征形式部署技能:*工具技能*(封装单个外部 API 或系统工具,作为基础词汇)和*工作流技能*(编排工具技能调用及模板渲染,生成特定交付物)。框架通过系统提示中的两种界面暴露这些技能:用于自动加载技能的内联主体界面(完整指令、脚本、模板),以及用于按需技能的单行列表界面。针对三种暴露模式(全开、默认、全关)的六项任务选择消融研究表明:全自动加载在所有任务中均选中了标准技能;全关模式会减慢执行速度并导致严重的发现失败;而生产默认模式错误路由了一个任务,因为其词汇信号与自动加载的工具技能冲突,导致规划器注意力从已列出的工作流技能上转移。核心发现是:技能在提示中的暴露并非单调有益——部分暴露可能引发词汇竞争,从而抑制正确选择。我们将这一小规模观察与近期大规模基于检索的技能路由研究相联系,并将本文定位为案例研究而非基准测试。 智能体搜索、技能检索、上下文内选择、智能体表征、工具选择、多模态智能体、智能体框架、技能路由 ††版权:保留所有权利††期刊年份:2026††会议:首届 AI 智能体索引、检索与排名研讨会;2026 年 7 月 24 日;澳大利亚墨尔本 ## 1. 引言 随着智能体框架部署更多技能,每个框架都成为了一个小型技能搜索引擎。当用户要求“指导本次会议中的代表”时,规划器必须从众多候选技能中查找、排序并选择能力与任务匹配的技能。同期研究(Zheng 等, 2026 [链接])将基于检索的技能路由定位为约 8 万技能规模下的一级问题,通过技能描述训练学习型检索器,并报告隐藏技能主体会导致路由准确率下降 31–44 个百分点。我们在规模的另一端探讨同一问题:在拥有十多个异构技能的生产级框架内,技能选择是怎样的?此时设计选择不是训练哪种检索器,而是将每种技能暴露于哪个界面? 我们广义地使用*检索*一词表示从候选集中选择。在我们的规模(13 个技能暴露于系统提示)下,不存在显式的基于嵌入的检索步骤;LLM 规划器通过上下文内选择执行操作,关注提示中已有的技能表征。我们将此视为基于嵌入的技能检索的小规模对应方案:相同问题(为任务选择正确的能力),不同机制(上下文注意力 vs. 学习排序),且影响双向流动。 我们研究 Tinycloud [111https://tinycloud.sh/],这是一个免费可用的多模态视频智能体框架(Dela Rosa 等, 2025 [链接];Dela Rosa, 2025a [链接]),它通过系统提示中的两种界面向规划器暴露技能:用于自动加载技能的内联主体界面(完整的 SKILL.md 主体、脚本、模板),以及用于按需技能的单行列表界面(名称 + 简短描述,仅在调用时注入完整指令)。SKILL.md 格式(Anthropic, 2025 [链接])已成为社区通用惯例;Xu 和 Yan(2026 [链接])提供了近期综述。 界面选择传统上被视为上下文预算决策;我们将其视为上下文内选择的表征选择。 两个观察构成了本案例研究的框架。首先,Tinycloud 的技能清晰地聚类为两个常见类别,与两种暴露界面直接对应: - •工具技能封装单个外部 API 或系统工具,作为基础词汇;它们是自动加载的(内联主体),因此规划器始终可使用。 - •工作流技能编排多个工具技能调用及模板渲染,以生成用户明确要求的特定交付物;它们是按需加载的(仅列表),仅在用户请求其特定交付物时注入完整主体。 其次,这种表征选择对选择有可测量的影响。我们针对三种暴露模式(全开、默认、全关)运行了六项任务选择消融,测量工具选择正确性、时钟时间和每单元格工具调用次数。消融揭示了一种非单调性:部分暴露(生产默认模式)可能比完全暴露或完全不暴露路由*更差*,因为自动加载的工具技能可能在表面形式同时匹配两者的提示中,在词汇上主导已列出的工作流技能。 #### 贡献。 本文是智能体搜索谱系小规模端的案例研究: - •生产级多模态智能体中技能作为表征的分类法(第 3 节 [链接]),模板计数作为有用的结构标记(第 4 节 [链接],表 1 [链接])。 - •六项任务选择消融(第 5 节 [链接]),测量暴露界面如何影响上下文内选择准确率、延迟和工具调用成本。 - •观察到提示中的暴露并非单调有益(第 6 节 [链接]):我们描述了词汇竞争失败模式,提出了最小的证伪尝试,并将发现与大规模基于检索的技能路由研究相联系(Zheng 等, 2026 [链接];Dela Rosa, 2025b [链接])。 我们将此定位为案例研究,而非基准测试或规模研究;经验证据仅来自一个拥有 13 个技能和六个固定任务的框架。框架源代码和分类技能可在 https://tinycloud.sh/ 获取。 ## 2. 背景 #### 智能体与工具检索。 技能与工具检索是最接近的同期研究方向。SkillRouter(Zheng 等, 2026 [链接])学习在约 8 万技能上进行基于检索的路由,并报告了与我们在框架内规模观察到的主体 vs. 列表不对称性相同的现象。ToolLLM(Qin 等, 2024 [链接])编目了超过 1.6 万个真实世界 API 作为智能体工具,并论证了大规模工具选择的必要性;Toolformer(Schick 等, 2023 [链接])奠定了基础工具使用模式;ReAct(Yao 等, 2023 [链接])提供了经典的交错推理与行动循环。SkillsBench(Li 等, 2026 [链接])跨领域评估技能有效性。更广泛的多模态检索路由研究见 Dela Rosa(2025b [链接])。 #### 技能格式、组成与记忆。 SKILL.md 惯例和自动加载机制源于 Anthropic 的 Agent Skills 发布(Anthropic, 2025 [链接]),已被包括 Claude Code(Anthropic, 2024 [链接])在内的多个框架采用;Xu 和 Yan(2026 [链接])提供了近期综述。Voyager(Wang 等, 2024 [链接])将技能定义为通过自动课程发现的可组合代码块;我们的工作流技能与之相似,但由作者策划、交付物导向且模板驱动。MemGPT(Packer 等, 2023 [链接])将上下文窗口视为受管内存;自动加载标志是其运行时分页的设计时静态类比。 ## 3. 技能系统 ### 3.1. 格式与加载器 Tinycloud 中的技能是一个包含三个组件的目录:一个带有 YAML 前置元数据(名称、描述、可选自动加载;默认为真)和自由形式主体(智能体将其视为过程知识)的 SKILL.md 文件;一个可选的 scripts/ 目录(包含可通过智能体 bash 工具调用的 .ts 或 .sh 可执行文件);以及一个可选的 templates/ 目录(包含参考文件(HTML、JSON 架构、Markdown),智能体读取后进行定制)。 ### 3.2. 系统提示中的暴露面 自动加载标志控制技能在会话开始时如何向智能体暴露。自动加载为真的技能出现在系统提示的*技能*块中,包含完整的每技能细节(名称、描述、脚本路径、模板路径,以及框架维护的每技能使用指南)。自动加载为假的技能出现在单独的*附加技能*块中,仅包含名称和描述;其完整指令仅在用户(或智能体)发出 /skills: 命令时按需注入。这种不对称是故意的:完整的技能主体和每技能指南可能各有数百到数千个令牌,因此在仅触发小子集的工作流中,每次加载所有技能会消耗上下文预算。 ### 3.3. 两个涌现类别 在生产环境中,自动加载划分似乎对应于每个技能功能的结构性区别: - •工具技能是封装外部 API 或系统工具的原子原语:语音转录、语义搜索、文件管理、结构化提取、ffmpeg 风格的媒体处理。智能体将其视为可组合的词汇。它们是自动加载的,以便智能体始终可用。 - •工作流技能是特定领域的交付物配方,编排多个工具技能、LLM 推理步骤和模板渲染,以生成用户明确要求的东西:会议分解、销售辅导报告、博客文章、YouTube 发布包。它们是按需加载的,因为每个都长而窄,仅在请求其特定交付物时触发。 ### 3.4. 模板作为结构指纹 在我们的框架中,templates/ 目录除了自动加载标志外,还作为有用的类别标记。工作流技能一致地包含*恰好一个*模板:交付物形状(HTML 报告、发布元数据页面、博客文章布局)。工具技能包含零个模板,或在特殊情况下,作为原语库的工具技能包含多个模板,*其他*技能通过模板名称标志使用。因此,相同的组件(templates/)扮演两个不同的角色(交付物形状 vs. 原语库),每技能模板计数有助于区分它们。 图 1([链接])展示了一个工作流技能如何为单个用户请求编排工具技能。 用户:“X.mp4 的会议分解” 智能体(LLM 规划器) 工作流技能:meeting-breakdown/generate VLM describe(按片段) VLM extract(自定义架构) 模板渲染(HTML) HTML 交付物(制品) bash + /skills:meeting-breakdown 图 1。一个工作流技能(紫色)编排工具技能调用(绿色):一个或多个 VLM describe/extract 作业加一次模板渲染,生成一个面向用户的交付物(橙色)。智能体通过 bash 调用一次工作流技能;底层的工具技能在技能的编排脚本内部进行编排,而非由智能体逐步执行。这将工作流技能定义为工具技能词汇之上的配方。 ## 4. 分类目录 表 1([链接])列出了框架当前部署的十二个技能,按工具/工作流区别进行分类。自动加载列是生产默认设置;*scripts* 计数非实用脚本(不包括共享帮助器);*templates* 计数 templates/ 中的文件。在此框架中,划分是一致的:每个工作流技能都是按需加载且恰好包含一个模板;每个工具技能都是自动加载且包含零个模板,或在一种情况下,包含一个原语库模板(供其他技能使用)。 表 1。十二个生产技能。*Cat.* 是 T(工具技能)或 W(工作流技能);*Auto.* 是生产自动加载标志;*Sc/Tp* =(非实用脚本)/(模板文件)。工作流技能模板塑造交付物;media-artifact 的七个模板是被其他技能使用的原语库。 技能 | Cat. | Auto. | Sc/Tp | 角色 --- | --- | --- | --- | --- 工具技能(原子原语) | | | | video-analyze | T | ✓ | 7/0 | VLM describe + extract cloudglue-files | T | ✓ | 7/0 | 按 ID 获取/描述 data-connectors | T | ✓ | 6/0 | 连接器摄入 collection-search | T | ✓ | 4/0 | 语义搜索 + 问答 captions | T | ✓ | 2/0 | SRT/VTT/转录 local-search | T | ✓ | 1/0 | 搜索缓存的丰富信息 media-artifact | T | ✓ | 2/7 | 渲染模板库 工作流技能(交付物配方) | | | | meeting-breakdown | W | ✗ | 2/1 | 时间线 + 章节 sales-coaching | W | ✗ | 2/1 | 辅导仪表板 ad-analysis | W | ✗ | 2/1 | 钩子 + 节奏 + CTA blog-post | W | ✗ | 2/1 | 长文文章 youtube-publish | W | ✗ | 2/1 | 标题/描述/章节 两个模式值得强调。工具技能在脚本复杂性上各异,但统一不携带交付物模板(它们是词汇,而非输出),而所有五个工作流技能共享相同的指纹——两个脚本(一个编排器和一个渲染器)加一个交付物模板——因为配方是相同的:编排工具技能调用、合成、渲染。唯一携带模板的工具技能(media-artifact)持有一个可复用的*库*,包含七个被其他工作流技能按名称使用的原语;因此,同一组件目录扮演两个不同的角色,每技能模板计数有助于标识。 ## 5. 实证 #### 问题。 自动加载划分的代价是什么?我们测量三种加载条件下的系统提示令牌预算,将成本分解为(a)框架发出的静态规则开销(与技能集无关)和(b)每个作为自动加载暴露的技能的边际成本。 #### 条件。 我们比较表 1([链接])技能集的三种配置: - •全开:每个技能都设为自动加载为真(完整的*技能*块以完整详细信息列出每个技能,包括其脚本和模板路径)。 - •默认:生产配置(工具技能自动加载,工作流技能按需加载)。 - •全关:每个技能都设为自动加载为假(整个技能集在轻量级的*附加技能*块中仅以名称和描述暴露;完整主体和每技能路径仅通过 /skills: 注入)。 两个生产技能不在表 1([链接])分类法内:yt-dlp(一个被省略的实用技能,因为它不符合任一类别)在每种条件的加载规则下均包含在消融中,而一个 Cloudglue SDK 技能在所有三种条件下作为系统不变项被强制自动加载,并排除在消融之外;它为每个提示贡献了额外的约 1,862 个令牌的主体内容。因此,消融测量了剩余 13 个技能(12 个已编目技能加 yt-dlp)的边际效应。令牌计数是
相似文章
Skill Following: 评估检索增强LLM代理中的实际技能使用
本文介绍了Skill Following和检索调用实际使用效应(RAE),用于评估LLM代理中的技能检索是否真正提升任务性能,揭示了聚合指标可能具有误导性。
SkillRet:面向 LLM 智能体技能检索的大规模基准
本文提出了 SkillRet,这是一个用于评估 LLM 智能体技能检索的大规模基准,旨在解决从大型技能库中选择相关技能的挑战。该基准提供了包含超过 17,000 项技能的 dataset,并证明针对特定任务的微调能显著提升检索性能。
超越Top-$k$技能检索:面向LLM代理的多样性感知技能路由
本文提出了多样性感知技能路由(DSR),一种使用行列式点过程来平衡LLM代理技能选择中的相关性和非冗余性的重排序框架,从而在基准测试中提升召回率和覆盖率。
Skill-RAG:通过隐层状态探测和技能路由的故障感知检索增强
Skill-RAG 是一个故障感知的 RAG 框架,利用隐层状态探测和技能路由来诊断和纠正检索增强生成中的查询-证据不对齐问题。该方法检测检索失败并有选择性地应用目标技能(查询重写、问题分解、证据聚焦)以提高硬案例和分布外数据集的准确率。
@dair_ai: 关于检索到的智能体技能是否真正有帮助的良好测量工作。他们报告说,提升聚合得分的智能体技能可能会伤害……
论文引入了检索调用实际使用效果(RAE)来评估检索到的技能是否真正帮助LLM智能体,显示聚合指标可能会通过隐藏对特定任务的负面影响而产生误导。