SkillSmith:学习组合参数化技能与文本知识
摘要
本文介绍了SkillSmith,这是一种增强型LLM,能够对前缀权重和文本知识进行推理,从而实现指令引导的新参数化技能合成,其性能优于仅文本和仅权重的基线方法。
arXiv:2607.27497v1 公告类型:新
摘要:由大型语言模型(LLMs)驱动的智能体系统通常具备两种关键机制,用于自主解决复杂问题:从过往经验中合成基于文本的知识和流程,以及为重复出现的子目标构建参数化(权重空间)技能库。迄今为止,研究大多将这两者视为正交方向:要么通过组合与反思来组织文本知识,要么通过权重空间合并来整合参数化技能。因此,针对特定目标的性能提升中,文本与模型权重的无缝集成在很大程度上仍未得到探索。本工作将模型权重视为LLM可以原生推理的额外模态,从而弥合了这一模态鸿沟。我们通过前缀微调(prefix-tuning)实例化参数化学习,并增强LLM,使其能够同时输入前缀权重和捕获目标能力关系的丰富文本数据。这个增强后的LLM被称为SkillSmith,它综合这些输入以执行指令引导的参数化合成,直接输出体现目标技能的新前缀权重。我们证明,我们的方法显著优于仅文本和仅权重空间的基线,实现了单模态(仅文本或仅权重)适应无法达到的性能提升。
查看缓存全文
缓存时间: 2026/07/31 10:01
# SkillSmith:学习组合参数化技能与文本知识
来源:https://arxiv.org/html/2607.27497
\uselogo\correspondingauthor ldery@google\.com, atjandr@google\.com
Benedict Aaron Tjandra\equal contributions\thepa
Siavash Samiei\thepa
Adhiguna Kuncoro\thepa
Zohar Yahav\thepa
Jiajun Shen\thepa
Arthur Szlam\thepa
###### 摘要
由大型语言模型(LLM)驱动的智能体系统通常具备两个关键机制,以自主解决复杂问题:一是从过往经验中综合基于文本的知识和流程;二是为重复出现的子目标构建参数化(权重空间)技能库。迄今为止,研究大多将这两者视为相互独立的追求:要么通过组合与反思来组织文本知识,要么通过权重空间合并来整合参数化技能。因此,文本与模型权重的无缝集成以达成针对性性能提升,在很大程度上仍未得到探索。本工作通过将模型权重视为一种 LLM 可以原生推理的额外模态,弥合了这一模态鸿沟。我们通过前缀微调(prefix-tuning)实例化参数化学习,并增强 LLM,使其能够同时吸收前缀权重和丰富的文本数据,这些数据捕捉了与目标能力的关系。我们称这个增强后的 LLM 为 **SkillSmith**,它综合这些输入以执行指令引导的参数化合成,直接输出体现目标技能的新前缀权重。我们证明,我们的方法显著优于纯文本和纯权重空间的基线,解锁了单模态(仅文本或仅权重)适应无法企及的性能提升。
###### 关键词:模型合并、KV 缓存、持续学习、前缀微调
## 1 引言
LLM\[gpt4,gemini25,claude3,qwen25,gemmateam2025gemma3technicalreport\]已从静态对话界面演变为智能体系统的驱动核心,能够解决需要复杂多步推理的问题\[metr,sima2,imo2025\]。这些系统有效性的核心在于其从过往经验中学习和适应的能力。目前,这种适应由两种强大但 largely 相互隔离的机制驱动。第一种是综合基于文本的知识,智能体使用自然语言——例如自我反思\[shinn2023reflexion,self-refine,renze2024selfreflection\]、结构化记忆\[mem0,a-mem,open-source-phoenix\]或提示生成\[promptagent,gepa\]——来指导未来的推理和规划。第二种是通过参数高效微调(PEFT)\[shekar2025adaptive\]构建参数化技能库,将学到的行为整合为模块化权重,这些权重可以被检索并独立使用,或与其他技能合并,以高效处理重复出现的子目标\[huang2023lorahub,pfeiffer2020adapterhub\]。
尽管智能体研究\[sun2025training,zhang2025agentic,zhou2025memento\]日益活跃,但迄今为止,社区 largely 将基于文本的推理和参数化技能获取视为相互独立的追求。我们认为这种割裂限制了智能体系统的潜力。赋予智能体在权重空间和文本上进行无缝推理的能力,可以解锁参数化技能的组合泛化\[dziri2023faith,keysers2019measuring,lake2018generalization\],其额外优势在于组合和泛化的轴可以通过指令文本灵活引导。
举一个具体例子:考虑一个智能体,它已经开发了一组模型(参数化技能)来解决各种子任务,同时拥有部署这些技能的丰富文本策略。假设通过过去的用户交互,该智能体在一次会话中训练了一个用于将英语翻译成契维语(Twi)的前缀缓存\[prefix-tuning\],并在另一次会话中编写了关于分析英语法律文件的综合笔记。当遇到一个新任务时,例如分析一份用契维语书写的法律文件,智能体推理出解决方案需要组合其先前技能:英语到契维语翻译、契维语语言建模以及法律文件分析。然而,尽管智能体可以在文本上清晰表达这种迁移,但目前没有任何机制能让它利用这种推理,连同权重空间的翻译技能和契维语语言技能,直接为新问题合成相应的任务权重。
参见图注
图 1:SkillSmith 高层流水线(i)和架构(ii)。由文本和前缀缓存权重组成的源任务包——以及关于如何综合这些任务包以帮助目标任务的文本理由——作为输入馈送给增强后的 LLM,以直接生成用于调制下游 LLM 以执行目标任务的前缀缓存。
本工作朝着文本与基于权重的智能体工件无缝组合迈出了初步步伐。我们提议将权重空间输入仅仅视为一种额外的模态,可以由适当增强的预训练 LLM 原生处理。这个增强后的 LLM——我们称之为 **SkillSmith**——被训练为同时推理文本和权重空间输入,使其能够直接生成任务特定的参数化技能以供下游部署(图 1)。具体而言,我们首先将参数化技能学习实例化为前缀微调\[prefix-tuning\]。然后,我们训练 SkillSmith 来吸收(i)前缀权重以及关于这些权重所解决问题的丰富文本元数据,以及(ii)额外文本元数据,这些元数据捕捉(权重/)技能与期望目标能力之间的功能关系。目标能力通过高层级文本描述或少量示例(few-shot exemplars)来指定,SkillSmith 输出的前缀权重以端到端方式直接针对目标任务进行优化,如 liu2024deliberation 所述。
为展示 SkillSmith 能灵活地将文本与基于权重的智能体工件组合成目标技能,我们做出以下贡献:
- • 我们对前缀微调的基线权重空间合并方法进行了全面研究。据我们所知,现有的 PEFT 合并工作主要集中在 LoRA 模块上\[prabhakar2025lora,zhao2024merging,lora\],因此对前缀微调的简单合并方法缺乏广泛的基线测试。
- • 为了在规模上研究混合模态组合,我们需要稳健的数据集,其中任务之间的真实关系是已知的。为此,我们贡献了一个数据生成工作流,用于生成 **Composite SNI**,一个合成组合泛化数据集。通过系统地提示 Gemini 2.5\[gemini25\]生成需要来自 Super Natural Instructions(SNI)数据集\[wang2022super\]的两个输入任务组合技能集的任务,我们创建了一个目标能力的真实输入任务已知的设置。我们将展示,我们可以在任务数量有限的情况下,有效地引导这些合成数据来启动文本与权重的组合学习。
- • 使用 4B Gemma 3 模型\[gemmateam2025gemma3technicalreport\]作为 SkillSmith 和下游任务求解器,我们证明 SkillSmith 在三个数据集上优于标准零样本和权重空间组合基线:Composite SNI、SNI 和 MMLU-ProX\[mmluprox\]。此外,我们证明 SkillSmith 是一个高度优越的参数初始化;在目标任务上对 SkillSmith 生成的前缀权重进行微调,得到的表示在性能上优于或与所有其他研究方法相当,包括从上下文示例初始化的前缀缓存的直接训练。
- • 最后,我们引入了一种基于检索器的方法,适用于输入任务到目标任务能力的真实映射未知的设置。我们表明,即使在这种嘈杂的设置下,SkillSmith 也能从候选源任务中提取并组合相关信号(如果存在),并利用该信号生成前缀权重,在同等条件下优于基线。
最终,SkillSmith 证明语言模型可以像处理文本一样,原生地推理(它们自己的)模块化权重,从而为更整体的智能体架构提供了蓝图。我们的结果强调,将参数空间视为一种可读、可合成的模态,为针对性适应提供了明显优越的初始化,促进了智能体技能的可扩展和有效组合。
## 2 相关工作
**基于文本的智能体适应。**现代 LLM 驱动的智能体严重依赖过往经验来解决复杂问题。迄今为止,这种适应几乎完全由综合基于文本的知识驱动。智能体通过自我反思\[self-refine,renze2024selfreflection,shinn2023reflexion\]、结构化记忆\[mem0,open-source-phoenix\]和提示优化\[gepa,promptagent\]等机制,利用自然语言指导未来规划。虽然文本为表达任务迁移提供了高度灵活和可组合的媒介,但它严格受限于推理时的上下文窗口:尽管可以通过在上下文中列出所有文本示例来完整指定一个任务,但这无法扩展。
**参数化技能获取与权重合并。**相反,参数高效微调(PEFT)通过将学到的行为整合为高效、模块化的权重,使语言模型适应下游任务\[peft-survey-2024\]。适配器\[adapter-1,adapter-2,adapter-3\]、LoRA\[lora\]和提示或前缀微调\[prompt-tuning,prefix-tuning\]等技术允许模型构建参数化技能库。先前的工作利用这些组件,通过权重合并迁移学到的行为,使用的方法如 SPoT\[spot\]、ATTEMPT\[attempt\]、AdapterHub\[pfeiffer2020adapterhub\]和 LoRAHub\[huang2023lorahub\]。然而,这些方法依赖浅层算术运算——例如简单平均、拼接或路由——这在数学上是刚性的,未能利用被合并任务之间丰富的语义关系。
**通过超网络弥合模态鸿沟。**尽管进展迅速,社区 largely 将基于文本的推理和参数化技能获取视为相互独立的追求。通过统一这些分离的范式,我们的目标是实现真正的组合泛化\[dziri2023faith,keysers2019measuring,lake2018generalization\]。我们不进行浅层任务算术,而是将 LLM 用作超网络\[shenaj2025lora\]。与现有超网络方法不同,我们的方法旨在原生处理权重空间输入——特别是前缀 KV 缓存,之所以选择它,是因为文本片段可以通过标准前向传播自然地转换为它们——并伴随文本元数据。通过将参数空间视为可读、可合成的模态,SkillSmith 将智能体的文本推理转化为指令引导的参数化合成。
## 3 使用 SkillSmith 弥合文本与参数模态
我们感兴趣的场景是:智能体在其学习过程中,能够积累文本和权重空间工件来解决问题。我们假设智能体随时间遇到的任务彼此足够相关,以至于可以通过综合过去经验中的相关信息来解决新任务。我们具体化问题设置如下:
### 3.1 预备知识
设 \\(\mathcal{T}_{src}\\) 为智能体之前遇到的所有任务的集合。我们将每个任务 \\(T_i \in \mathcal{T}_{src}\\) 与一个任务包 \\(b_i = (m_i, w_i)\\) 关联,其中 \\(m_i\\) 是一个学习到的 PEFT 模块,\\(w_i\\) 表示任务相关的文本元数据,例如上下文学习(ICL)演示或任务反思\[shinn2023reflexion\]。虽然概念上模块 \\(m_i\\) 可以代表任何 PEFT 方法,但本工作特别关注前缀微调。因此,每个 \\(m_i\\) 是与预指定、冻结的基础模型 \\(M_\phi\\) 关联的键值(K-V)前缀缓存。选择前缀微调的动机是,文本片段可以通过 \\(M_\phi\\) 的前向传播自然转换为 K-V 缓存。这提供了先验信心,即通过从零训练的参数化 K-V 缓存和直接从文本派生的 K-V 缓存之间学习关系来弥合模态鸿沟是可行的。
### 3.2 问题陈述
考虑一个面临新任务 \\(T_{new}\\) 的智能体。我们的目标是生成一个新的 PEFT 模块 \\(m_{new}\\),使其能够解决智能体可能遇到的 \\(T_{new}\\) 实例。基线方法是仅使用 \\(T_{new}\\) 的数据训练一个全新的 PEFT 模块;然而,这未能利用存储在智能体历史经验 \\(\mathcal{T}_{src}\\) 中的潜在有用信息。因此,我们假设智能体可以访问先前遇到的源任务的子集 \\(\mathcal{T}_{src}[T_{new}] = \{T_1, \dots, T_N\}\\),这些任务被认为与构建 \\(T_{new}\\) 的解决方案相关。¹
> ¹ 预先找到这种绝对真实映射可能具有挑战性,但我们的检索实验表明,简单的基于嵌入的检索技术可以提供有效的近似。
利用 \\(\mathcal{T}_{\text{src}}[T_{new}]\\) 存在单模态策略,但其相互隔离的特性带来局限性:
- • **仅文本策略:** 一种方法是将来自源任务的所有可用文本元数据(即 ICL 示例和反思)聚合起来,并与 \\(T_{new}\\) 的文本元数据直接结合,作为解决 \\(T_{new}\\) 的上下文数据。虽然这种方法高度灵活,但计算成本高昂,且受限于推理时的上下文长度。
- • **权重空间策略:** 可以使用标准权重空间合并技术(例如平均)从与 \\(\mathcal{T}_{src}[T_{new}]\\) 中任务关联的相关已训练模块 \\(\{m_i\}\\) 初始化,并可选地在 \\(T_{new}\\) 的数据上对合并后的权重进行后续调整。虽然推理高效,但算术合并忽略了文本元数据中表达的丰富功能关系。
我们认为这些孤立的方法未能最大化地重用构建 \\(\mathcal{T}_{src}\\) 所花费的计算,并且错过了通过跨交错模态综合信息可能获得的性能提升。因此,我们被激励回答:**我们如何弥合这些模态,有效结合来自 \\(\mathcal{T}_{\text{src}}[T_{\text{new}}]\\) 的基于文本和权重空间的工件,以构建一个明确优于纯单模态基线的 \\(m_{\text{new}}\\)?**
### 3.3 SkillSmith 架构
参见图注
图 2:要由协同处理器处理的连续任务包表示。
鉴于上述单模态方法的局限性,我们引入 SkillSmith(图 1),一个增强的预训练 transformer 语言模型,能够综合文本和权重空间前缀缓存工件。为了求解新任务 \\(T_{new}\\),SkillSmith 组合现有的相关源任务包 \\(\mathcal{T}_{src}[T_{new}]\\) 以及描述性文本元数据,生成 \\(m_{new}\\)。具体来说,给定 \\(N\\) 个任务包 \\(\{b_i\}_N\\) 作为输入,SkillSmith 首先通过我们参数化的输入 K-V 适配器将权重空间模块 \\(\{m_i\}_N\\) 投影到语言模型的潜空间。相似文章
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
LatentSkill:从上下文文本技能到LLM智能体的权值潜技能
LatentSkill将文本技能转换为存储在权值空间中的LoRA适配器,减少上下文开销,同时保持LLM智能体的模块化和可组合性,在ALFWorld和Search-QA基准测试上取得了显著改进。
SkillSmith: 将智能体技能编译为边界引导的运行时接口
SkillSmith是一个边界优先的编译器-运行时框架,从LLM智能体技能中提取细粒度的操作边界,使智能体能够动态访问仅相关的组件,在SkillsBench基准测试上减少了57.44%的求解阶段令牌使用量和42.99%的思考迭代次数。
SkillGen:经过验证的推理时代理技能合成
本文介绍了 SkillGen,这是一个多智能体框架,通过对比成功和失败的轨迹来合成和验证可复用的推理时大语言模型(LLM)代理技能。该方法确保技能可审计,并通过实证验证其对代理性能具有净正面影响。
技能并非通用:面向LLM智能体的模型感知技能对齐
本文提出MASA框架,该框架在不修改模型权重的情况下,通过分层进化和模型条件重写器将技能适配到每个LLM骨干网络,相比基线方法最高提升25.8个点。