Google推出WikiSkill用于持久智能体学习(阅读需22分钟)
摘要
WikiSkill是一个框架,与持久知识库共同进化智能体技能,持续超越最先进的方法,并实现跨模型的有效技能转移。
WikiSkill是一个框架,与持久维基共同进化可重用智能体技能,维基整合先前经验的知识。
查看缓存全文
缓存时间: 2026/09/01 11:41
# WikiSkill:将智能体经验编译为持久化知识以实现技能演进 来源:https://arxiv.org/html/2608.27454 Cyrus Rashtchian 隶属机构:Google Research Chun-Sung Ferng 隶属机构:Google Research Andrew Tomkins 隶属机构:Google Research Da-Cheng Juan 隶属机构:Google Research Tu Vu 通讯作者:[email protected], [email protected] 隶属机构:Google Research, Virginia Tech ###### 摘要 *智能体技能*将专业知识与工作流程封装为可复用资源,以扩展AI智能体的能力。近期研究通过智能体经验自动发现此类技能,使智能体能在交互中逐步适应。然而,指导技能开发的洞见通常分散在优化历史中,限制了其在迭代间的系统性复用。我们提出WikiSkill,一个将智能体技能与*持久化*知识库(wiki)协同演进的框架。宏观上,WikiSkill将原始执行经验、积累知识与可执行技能分离,并持续将经验整合进wiki,后续技能更新可基于此构建。在多个基准测试和模型上,WikiSkill始终优于*最先进*的技能演进方法,并在大多数模型-基准设置中超越无技能基线。我们发现技能演进与模型规模提升具有互补性:更大模型通常从演进技能中获益更多,而配备技能的小模型能超越无技能的大模型。我们还发现演进技能能跨模型和模型家族有效迁移,其他模型演进的技能有时能优于自我演进的技能。最后,消融研究证实wiki中的持久化知识积累对有效技能演进至关重要。这些结果表明,系统性地积累与优化智能体经验,对于开发可复用、可迁移的技能具有显著优势。 图1:WikiSkill在无技能基线与现有技能演进方法上均持续提升性能。有趣的是,其优势在更强大的模型上更为显著。我们报告每个模型在无技能,或使用EvoSkill、SkillOpt和WikiSkill演进技能时,在评估基准上的平均准确率(详见表1 (https://arxiv.org/html/2608.27454#S4.T1))。 ## 1 引言 通用AI智能体在跨领域执行复杂任务方面日益强大(Patwardhan等人,2026 (https://arxiv.org/html/2608.27454#bib.bib1);Jackson等人,2025 (https://arxiv.org/html/2608.27454#bib.bib2);Merrill等人,2026 (https://arxiv.org/html/2608.27454#bib.bib3);Phan等人,2026 (https://arxiv.org/html/2608.27454#bib.bib4))。然而,可靠完成现实任务往往需要领域特定专业知识(例如,程序性知识和工作流程)。*智能体技能*(Zhang等人,2025 (https://arxiv.org/html/2608.27454#bib.bib5);Li等人,2026 (https://arxiv.org/html/2608.27454#bib.bib33);Chen等人,2026a (https://arxiv.org/html/2608.27454#bib.bib43);Liu等人,2026 (https://arxiv.org/html/2608.27454#bib.bib45))提供了一种轻量级、开放式的格式来捕获此类专业知识,而无需更新模型参数。核心上,技能将指令、脚本和其他资源打包为一个可复用的基于文件系统的模块(即一个组织化的目录)(Zhang等人,2025 (https://arxiv.org/html/2608.27454#bib.bib5);Li等人,2026 (https://arxiv.org/html/2608.27454#bib.bib33);Anthropic,2026 (https://arxiv.org/html/2608.27454#bib.bib24);Xia等人,2026b (https://arxiv.org/html/2608.27454#bib.bib38))。此设计使专业知识保持一致、可审计,并可在技能兼容的智能体间复用。它还支持*渐进式披露*(Jiang等人,2026 (https://arxiv.org/html/2608.27454#bib.bib6)),即智能体在任何给定时间仅加载相关内容,从而节省上下文空间。更广泛地说,技能提供了一种在模型参数之外积累知识的自然机制。 然而,开发有效技能仍然具有挑战性。大多数智能体技能是手动编写的,这需要预测智能体所需的程序性知识和工作流程(Li等人,2026 (https://arxiv.org/html/2608.27454#bib.bib33);Liang等人,2026 (https://arxiv.org/html/2608.27454#bib.bib7);Xu和Yan,2026 (https://arxiv.org/html/2608.27454#bib.bib46))。这一挑战促使近期工作通过在训练任务上执行智能体、分析成功与失败的轨迹,并基于所得经验优化技能来迭代式地开发智能体技能(Yuksekgonul等人,2025 (https://arxiv.org/html/2608.27454#bib.bib8);Agrawal等人,2026 (https://arxiv.org/html/2608.27454#bib.bib32);Alzubi等人,2026 (https://arxiv.org/html/2608.27454#bib.bib9);Ni等人,2026 (https://arxiv.org/html/2608.27454#bib.bib10);Ouyang等人,2026 (https://arxiv.org/html/2608.27454#bib.bib11);Yang等人,2026 (https://arxiv.org/html/2608.27454#bib.bib12))。一个关键的设计问题是如何在整个技能演进过程中保存和组织智能体所学内容。先前工作以不同方式解决此问题。EvoSkill(Alzubi等人,2026 (https://arxiv.org/html/2608.27454#bib.bib9))维护先前建议及其评估结果的累积历史;Trace2Skill(Ni等人,2026 (https://arxiv.org/html/2608.27454#bib.bib10))从执行轨迹中提取并整合经验以更新技能;SkillOpt(Yang等人,2026 (https://arxiv.org/html/2608.27454#bib.bib12))使用被拒绝的编辑反馈和逐纪元的元指导。然而,这些方法并未将所学内容作为独立的、不断演进的知识表示进行维护。 受Karpathy (2026) (https://arxiv.org/html/2608.27454#bib.bib13)关于LLM Wiki的观点启发(该观点主张将经验编译为持久化、复合增长的知识),我们提出疑问:*智能体经验是否可以类似地编译为持久化知识以支持长期技能演进?*我们引入WikiSkill,它在原始经验与可执行程序(即技能)之间增加了一个结构化知识层。该层允许技能开发基于迭代间日益完善和整合的知识构建,而非分散在技能演进构件中的知识。 WikiSkill将智能体工作区组织为三层:一个存储不可变执行轨迹的*原始层*,一个维护结构化知识的*Wiki层*,以及一个包含演进中程序性知识的*技能层*(图2 (https://arxiv.org/html/2608.27454#S3.F2))。每次迭代涉及四个组件:一个使用当前技能执行运行的*推理智能体*,一个将轨迹整合进wiki的*Wiki维护者*,一个使用wiki和轨迹提出技能更新的*技能提议者*,以及一个保留能提升验证性能更新的*门控与回滚机制*。虽然技能更新可以回滚,但wiki会持久化,以便未来的更新可以基于积累的知识构建。宏观上,这些组件形成一个持续循环,其中经验被整合为支持技能演进的持久化知识。 我们在*五个*基准测试上评估WikiSkill,涵盖数学推理(LiveMathematicanBench (He等人,2026 (https://arxiv.org/html/2608.27454#bib.bib14)))、网络搜索(SealQA (Pham等人,2026 (https://arxiv.org/html/2608.27454#bib.bib15)))、电子表格操作(SpreadSheetBench (Ma等人,2024 (https://arxiv.org/html/2608.27454#bib.bib16)))、长上下文文档问答(OfficeQA (Singhvi等人,2025 (https://arxiv.org/html/2608.27454#bib.bib17)))和交互式具身任务(ALFWorld (Shridhar等人,2021 (https://arxiv.org/html/2608.27454#bib.bib18))),并使用来自Qwen (Qwen Team, 2026a (https://arxiv.org/html/2608.27454#bib.bib19); Qwen Team, 2026b (https://arxiv.org/html/2608.27454#bib.bib20))、Gemma (Gemma Team, 2026 (https://arxiv.org/html/2608.27454#bib.bib21))和Gemini (Google DeepMind, 2026 (https://arxiv.org/html/2608.27454#bib.bib22))家族的*五*个模型。我们发现WikiSkill在大多数设置中优于现有技能演进方法并提升了无技能基线性能。有趣的是,技能演进与模型规模提升具有互补性。在Qwen家族内,WikiSkill使4B、9B和27B模型的平均性能分别提升了12.3%、17.5%和23.9%,*且增益随模型规模增长而增加*。同时,演进技能可以弥补模型规模的巨大差距:配备WikiSkill的Qwen-3.5-9B性能超过了无技能的Qwen-3.6-27B(47.4% vs. 39.4%)。我们进一步发现,演进技能能跨模型家族有效迁移,并且有时能优于自我演进的技能。例如,在ALFWorld上,使用Qwen-3.6-27B演进技能的Qwen-3.5-9B达到了70.2%的性能,而使用其自身技能时为63.4%。这些结果表明,技能发现与技能执行是不同的能力。最后,我们的分析表明,持久化的wiki对这些增益至关重要,支持了我们关于跨迭代积累和优化知识能改进技能演进的假设。 总结来说,我们的主要贡献是: - • 我们引入WikiSkill,这是一个将智能体技能与持久化知识库协同演进的框架,该知识库持续组织和优化来自智能体经验的知识。 - • 我们在五个基准测试和五个模型上证明,WikiSkill始终优于现有技能演进方法,消融研究证实了持久化知识积累的重要性。 - • 我们系统性地研究了演进技能如何与模型能力交互,表明技能演进与模型规模提升互补,且演进技能可以跨模型有效迁移,有时能超越自我演进技能。 综上所述,我们希望本工作能推动更多关于智能体如何从经验中积累、组织和复用知识的基础性研究。 ## 2 问题设定 我们形式化LLM智能体的迭代技能演进任务。设$\mathcal{D}=\{(x_i,y_i)\}_{i=1}^N$为任务数据集,其中$x_i$表示任务实例,$y_i$表示其真实答案。我们将$\mathcal{D}$划分为三个不相交的子集:训练任务$\mathcal{D}_{\text{train}}$、验证任务$\mathcal{D}_{\text{val}}$和测试任务$\mathcal{D}_{\text{test}}$。一个智能体$\pi$是一个基于LLM的系统,配备一组工具$\mathcal{U}$(例如,bash shell、搜索API或文件读取器)和一个活跃技能集$S=\{s_1,s_2,...,s_M\}$。技能是一个模块化的、基于文件系统的目录,它将领域特定的程序性知识封装为指令、脚本和其他资源(Zhang等人,2025 (https://arxiv.org/html/2608.27454#bib.bib5);Li等人,2026 (https://arxiv.org/html/2608.27454#bib.bib33);Chen等人,2026a (https://arxiv.org/html/2608.27454#bib.bib43);Liu等人,2026 (https://arxiv.org/html/2608.27454#bib.bib45))。具体而言,每个技能包含一个`SKILL.md`文件,该文件具有前置元数据(唯一名称和简明描述)以及完整的程序性说明和适用条件。技能集$S$初始化为空集($\emptyset$),并通过演进过程为每个数据集开发。 当执行任务$x_i$时,智能体接收任务上下文$x_i$并可访问可用技能$S$。智能体使用其工具和技能与环境进行多步交互,生成执行轨迹$\tau_i \sim \pi(x_i; S)$。轨迹$\tau_i=(o_1,a_1,o_2,a_2,...,o_T,a_T)$由观测$o_t$和动作$a_t$组成(动作可能包括调用$\mathcal{U}$中的工具)。最终动作$a_T$输出预测答案$\hat{y}_i$。预测的正确性由特定领域的评分函数$f(\hat{y}_i, y_i) \in [0,1]$评估。对于任何任务子集$\mathcal{D}_{\text{split}} \subset \mathcal{D}$,在$\mathcal{D}_{\text{split}}$的所有任务实例上运行智能体$\pi(\cdot; S)$会生成相应的执行轨迹集$\mathcal{T}_{\text{split}} = \{\tau_i \sim \pi(x_i; S)\}_{(x_i, y_i) \in \mathcal{D}_{\text{split}}}$。在任务子集上的性能$\mathcal{R}(\mathcal{T}_{\text{split}})$是所有任务实例$(x_i, y_i) \in \mathcal{D}_{\text{split}}$的平均分数。 在WikiSkill中,第$k$次迭代时的系统状态由元组$(S_k, W_k)$表示,其中$S_k=\{s_1,...,s_M\}$表示活跃的程序性技能集,$W_k$表示持久化知识库(Wiki)。虽然候选技能更新需经过验证门控,并在分数下降时回滚,但知识库$W_k$在迭代间持续存在并复合增长。从$(S_0, W_0)=(\emptyset, \emptyset)$开始,WikiSkill在迭代$k \in \{1,...,K\}$中协同演进联合状态$(S_k, W_k)$,利用训练运行$\mathcal{T}_{\text{train}, k}$、模式整合以及基于$\mathcal{T}_{\text{val}, k}$的验证门控,以最大化在未见任务$\mathcal{D}_{\text{test}}$上的最终测试性能$\mathcal{R}(\mathcal{T}_{\text{test}})$。 ## 3 方法 (见图注)图2:WikiSkill框架概览。智能体工作区结构分为三层:不可变的执行轨迹(原始层)、跨迭代复合增长的持久化知识库(Wiki层)和活跃的程序性指令(技能层)。在每个演化循环中,推理智能体运行轨迹(注入活跃技能但限制Wiki访问),Wiki维护者将轨迹整合进Wiki,技能提议者(具有ReAct机制)提出更新建议,同时Wiki在所有迭代中得以保留。 我们提出WikiSkill,一个将智能体技能与持久化知识库(wiki)协同演进的框架。围绕三层知识架构构建(§3.1 (https://arxiv.org/html/2608.27454#S3.SS1)),WikiSkill执行一个协调的演化循环:智能体运行轨迹,Wiki维护者整合轨迹并更新wiki,技能提议者提出技能更新,门控机制过滤变更(§3.2 (https://arxiv.org/html/2608.27454#S3.SS2))。 ### 3.1 三层知识架构 WikiSkill工作区由三个不同的层组成,如图2 (https://arxiv.org/html/2608.27454#S3.F2)所示并在下文描述。 ##### 原始层(`raw/`) 此层存储每次迭代中从训练样本收集的原始执行轨迹$\tau_i \in \mathcal{T}_{\text{train}, k}$。这些轨迹捕获了智能体完整的逐步交互,包括推理、工具调用、工具调用输出和最终答案。在我们的设置中,Wiki维护者和技能提议者智能体可以访问这些原始轨迹以分析智能体行为。为了保留原始历史记录,此层是不可变的。 ##### Wiki层(`wiki/`) 此层将原始轨迹编译为结构化的、复合增长的知识,并在整个技能演进过程中维护。它包含一个模式目录(`patterns/`)。
相似文章
WikiSkill:将代理经验编译为持久知识以促进技能演化
WikiSkill 介绍了一个框架,该框架与持久知识库共同演化代理技能,以系统性地积累经验并提升跨模型性能,展示了优于最先进的技能演化方法的优势。
@omarsar0: Google关于通过持久化知识维护智能体技能的一篇优秀论文。
一篇Google论文讨论了通过在类似维基的结构中分离原始执行痕迹与持久化知识来维护智能体技能。
@hwchase17: https://x.com/hwchase17/status/2071963622298050997
文章讨论了AI代理中新兴的'wiki记忆'模式,其中原始源数据被智能压缩成一个持久、结构化的知识层,代理可以高效地使用它。文章将其与基础RAG进行了比较,并给出了DeepWiki和LLM Wiki等例子。
预印本表明,具备进化技能的小模型能超越无此技能的大模型。那么,什么应该持久化?
WikiSkill通过持久化维基来进化和转移技能,显示拥有此类技能的小模型在基准测试中优于无此技能的大模型,引发了关于AI代理中哪些知识应持久化的疑问。
Google's SkillOS:面向自进化 AI 智能体(阅读需22分钟)
Google Cloud AI Research 推出 SkillOS,这是一种强化学习框架,使基于 LLM 的智能体能够通过从过往经验中提炼可复用技能来实现自我进化。