自我对弈遇上技能进化:能提问、求解并记忆的自进化搜索代理

arXiv cs.AI 论文

摘要

本文介绍了 SESA——一种自进化的技能增强搜索代理,它通过工具增强的搜索自我对弈,使任务生成和技能记忆共同进化。它在七个问答基准上相比基线提升了准确率,同时支持无需记忆的部署。

arXiv:2607.29468v1 公告类型:新 摘要:自我对弈代理无需目标基准中的问题即可生成训练问题,但其课程缺乏持续状态:失败会影响梯度,却不会明确塑造未来的练习。外部技能记忆保留了程序性经验,但通常是从固定的任务分布中学习的。我们引入了 \textbf{SESA}(自进化技能增强代理),它将程序性记忆作为工具增强搜索自我对弈的一种演化状态。一个挑战者提出问题,而一个单独参数化的求解器独立检索技能。有信息量的失败被提炼为可复用的技能并写回记忆。更新后的记忆改变了求解器的行为和成功率,从而改变挑战者的奖励和未来问题的分布;由此产生的前沿会产生新的失败,进而重写记忆。这种双向循环使任务生成和技能记忆共同进化。由于检索到的技能塑造了同策略训练轨迹,它们的好处既能进入模型参数,也能保留在外部库中,从而实现无需记忆的部署和可选的推理时检索。在七个开放域和多跳问答基准上,SESA 在多个骨干网络上将平均准确率比 SSP 提高 1.2--3.2 个百分点,并在统一评估协议下超过技能增强的 SkillRL 基线 0.9 个百分点。在 Qwen3 模型上,SESA-Off 相对于 SSP 保持了 1.8--2.2 个百分点的提升,而最终的技能库又额外增加了 0.5--1.0 个百分点。这些结果表明,进化的技能记忆不仅仅是推理时的插件:它改变了策略学习和未来的训练分布,同时作为可选的外部记忆保留价值。我们的代码可在 https://github.com/Zenghuang-Fu/SESA-Self-Evolving-Search-Agents 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/03 07:32

# 自我博弈遇上技能进化:提出、求解并记忆的自我进化搜索代理

Zenghuang Fu1,2\equalcontrib, Zhaoyang Li3\equalcontrib, Qiuyuan Ai3\equalcontrib, Haoyu Wu3, Minghui Wu4, Chenxu Zhao4, Ante Wang5, Guannan He3\corresponding, Changwei Wang6,7\corresponding

###### 摘要

自我博弈代理可以在没有目标基准问题集的情况下生成训练问题,但其课程缺乏持久状态:失败会影响梯度,却不会明确地塑造未来的练习。外部技能记忆能够保留程序性经验,但通常是从固定的任务分布中学习的。我们提出了 SESA(Self-Evolving Skill-Augmented Agent,自我进化技能增强代理),它将程序性记忆变成工具增强搜索自我博弈中的一种进化状态。挑战者提出问题,而一个单独参数化的求解器独自检索技能。有信息量的失败被提炼为可复用的技能并写回记忆。更新后的记忆改变了求解器的行为和成功率,进而改变挑战者的奖励和未来问题的分布;由此产生的前沿会催生新的失败,并再次改写记忆。这种双向循环使任务生成与技能记忆共同进化。由于检索到的技能会塑造在线策略的训练轨迹,其收益既能进入模型参数,也能留在外部记忆库中,从而实现无需记忆的部署和可选的推理时检索。在跨越七个开放域和多跳问答基准的测试中,SESA 在多种骨干模型上将平均准确率相对于 SSP 提升了 1.2–3.2 个百分点,并在统一评估协议下比技能增强的 SkillRL 基线高出 0.9 个百分点。在 Qwen3 模型上,SESA-Off 相对于 SSP 保留了 1.8–2.2 个百分点的提升,而最终技能库又额外贡献了 0.5–1.0 个百分点。这些结果表明,进化的技能记忆不仅仅是一个推理时的插件:它改变了策略学习和未来的训练分布,同时保留着作为可选外部记忆的价值。我们的代码可在 https://github.com/Zenghuang-Fu/SESA-Self-Evolving-Search-Agents 获取。

参见图注 图 1:SESA 的概念总览。自我提出的搜索失败不会被丢弃:它们被提炼为可复用的技能,存入记忆,并反馈给求解器,从而使下一轮自我博弈朝着更难的问题推进。

## 引言

大型语言模型(LLM)代理正越来越多地从自身经验中训练,而不是依赖固定的示范语料库。其中一条路线是*零数据自我博弈*,代理在没有外部问题集的情况下,利用可验证的奖励来提出并求解问题(Luet al.2026 (https://arxiv.org/html/2607.29468#bib.bib1); Chenet al.2025 (https://arxiv.org/html/2607.29468#bib.bib3); Xiaet al.2025 (https://arxiv.org/html/2607.29468#bib.bib4); Acikgozet al.2026 (https://arxiv.org/html/2607.29468#bib.bib5))。由于任务生成是内生的,自我博弈可以随着求解器的提升而调整难度。然而,其经验通常是短暂的:一条轨迹贡献了策略梯度,却没有留下任何可复用的、关于从中习得策略的显式记录。

一条互补的路线是*技能增强的强化学习*,它将经验提炼为可检索的策略或结构化笔记(Xiaet al.2026 (https://arxiv.org/html/2607.29468#bib.bib6); Wanget al.2026 (https://arxiv.org/html/2607.29468#bib.bib7); Shiet al.2026 (https://arxiv.org/html/2607.29468#bib.bib8); Liet al.2026a (https://arxiv.org/html/2607.29468#bib.bib9),b (https://arxiv.org/html/2607.29468#bib.bib10); Zhanget al.2026 (https://arxiv.org/html/2607.29468#bib.bib11))。这类记忆能够在产生它的更新之外保留程序性知识,但它们通常是从固定数据集或手工设计的课程中构建的。这两个局限互为镜像:自我博弈决定练什么,却会遗忘教训;而技能增强的强化学习则记住了并非由自己选择的任务中的教训。缺失的设置是这样一种代理:它能同时做到两者。

我们提出了 SESA(Self-Evolving Skill-Augmented Agent,自我进化技能增强代理),它将在线技能进化置于工具增强的搜索自我博弈之中。挑战者提出一个带有可验证目标的问题,一个单独参数化的求解器使用搜索工具尝试求解。有信息量的求解器失败被提炼为人类可读的技能,经去重后写入一个有界非参数记忆。求解器在后续轮次中检索这些技能,因此过去的失败会改变未来的在线策略轨迹以及用于策略优化的数据。记忆对挑战者保持隐藏,从而防止直接技能泄漏,并在问题生成与问题求解之间保持一种非对称博弈。

仅仅将自我博弈与技能库组合起来并不足够。存储每一次失败会累积噪声和冗余;将同一记忆暴露给挑战者可能会把解题策略泄漏进生成的问题中;而只在训练之后加入检索则无法改变自我博弈的课程。因此,一个闭环必须决定哪些失败是可学的、谁可以访问其提炼出的经验教训,以及这些经验教训如何回到在线策略训练中。

SESA 通过四个阶段实现这一反馈回路。*记忆初始化*提供初始检索基础;*非对称自我博弈*让求解器独享技能访问权;*前沿塑造*引导挑战者接近求解器当前能力边界附近的问题;*失败提炼*将有用的失败轨迹转换为新技能。最终形成一条“失败→技能→求解器”的循环:自我提出的问题暴露弱点,这些弱点变成可复用的指导,而强化后的求解器又将挑战者推向新的前沿。

由于技能在训练期间参与其中,SESA 支持两种形式的复用。技能条件下的轨迹可以在训练后的求解器中留下*参数性迁移*,从而支持无记忆推理。最终记忆库也可以保持启用,以提供额外的*非参数增强*。我们通过比较 SSP、禁用记忆的 SESA(SESA-Off)以及启用同一训练后 SESA 求解器记忆的版本(SESA-On),来隔离这些效应。这一区分表明技能收益究竟驻留在策略中、外部记忆库中,还是两者兼有。

我们在跨越七个事实性和多跳搜索基准的 3,125 个留出问题上进行评估。在已完成的运行中,SESA-On 在 Qwen3-4B 上将平均准确率相对于 SSP 提升了 2.3 个百分点,在 Qwen3-8B 上提升 3.2 个百分点,在 LLaMA-3.1-8B 上提升 1.2 个百分点,同时相对于对应基础模型分别高出 10.9、7.0 和 10.8 个百分点。这些跨模型规模和模型家族的增益表明,持久技能进化在自我博弈之外还能带来额外价值;受控的 Off/On 比较进一步检验了其中有多大比例的价值来自参数迁移。

我们做出三点贡献。

- • 耦合的自我进化。我们将自我提出的问题生成与持久技能整合结合起来,使代理既能选择自己的练习前沿,又能从自身失败中保留经验教训。
- • SESA 循环。仅求解器检索、前沿塑造和在线失败提炼将可复用技能反馈到后续自我博弈中,而不会向挑战者泄漏记忆。
- • 双路径评估。我们在多个搜索基准和模型家族上,将无记忆的参数性迁移与推理时检索增益区分开来。

## 相关工作

### 用于代理训练的自我博弈

自我博弈已成为一种实用的代理训练方式,无需固定的人类编写任务池。Search Self-Play(SSP)(Luet al.2026 (https://arxiv.org/html/2607.29468#bib.bib1))仅使用可验证奖励来训练面向检索增强搜索的提出者与求解者策略;Multi-Agent Evolve(Chenet al.2025 (https://arxiv.org/html/2607.29468#bib.bib3))通过提出者–求解者–评判者博弈扩展了这一思想;Tool-R0(Acikgozet al.2026 (https://arxiv.org/html/2607.29468#bib.bib5))研究了工具使用的零数据自我博弈;EvolveR(Wuet al.2025 (https://arxiv.org/html/2607.29468#bib.bib12))则将自我进化构建为经验驱动的生命周期。R-Few(Yuet al.2025 (https://arxiv.org/html/2607.29468#bib.bib13))和 Agent0(Xiaet al.2025 (https://arxiv.org/html/2607.29468#bib.bib4))进一步强调了非对称角色和自适应难度。这些方法使任务生成内生化,但求解经验通常只作为训练轨迹被消耗,然后被丢弃。SESA 遵循自我提出的设置,但增加了一条显式整合路径:失败的求解器轨迹变成可检索的技能,从而影响后续自我博弈轮次。

### 技能记忆与经验整合

一条互补的研究线关注在模型权重之外存储可复用经验的代理(Aiet al.2026 (https://arxiv.org/html/2607.29468#bib.bib2))。SkillRL(Xiaet al.2026 (https://arxiv.org/html/2607.29468#bib.bib6))将冷启动技能库、保留失败以及策略–技能共同进化结合起来;相关工作还进一步研究了带技能库的强化学习(Wanget al.2026 (https://arxiv.org/html/2607.29468#bib.bib7)),以及 Skill1(Shiet al.2026 (https://arxiv.org/html/2607.29468#bib.bib8))、SkillGraph(Liet al.2026a (https://arxiv.org/html/2607.29468#bib.bib9))、ARISE(Liet al.2026b (https://arxiv.org/html/2607.29468#bib.bib10))和 CoEvoSkills(Zhanget al.2026 (https://arxiv.org/html/2607.29468#bib.bib11))中的技能展开、选择、结构与共同进化。其他系统则聚焦于技能整理和生命周期管理(Ouyanget al.2026 (https://arxiv.org/html/2607.29468#bib.bib14); Puet al.2026 (https://arxiv.org/html/2607.29468#bib.bib15); Linet al.2026b (https://arxiv.org/html/2607.29468#bib.bib16),a (https://arxiv.org/html/2607.29468#bib.bib17)),而 Voyager(Wanget al.2024 (https://arxiv.org/html/2607.29468#bib.bib18))、Reflexion(Shinnet al.2023 (https://arxiv.org/html/2607.29468#bib.bib19))和 ExpeL(Zhaoet al.2024 (https://arxiv.org/html/2607.29468#bib.bib20))则表明非参数记忆可以让代理经验变得可复用且可检查。然而,这些系统通常从固定数据集、手工设计课程或非 RL 交互循环中学习技能。SESA 的不同之处在于将技能整合置于零数据自我博弈之中:代理既创造出暴露失败的搜索问题,又将这些失败写回一个会改变未来求解行为的记忆。因此,与 SkillRL 的区别并不仅仅在于是否存在技能库。SkillRL 是在外生任务分布下进化技能,而 SESA 让求解器不断进化的记忆改变其在内生前沿上的行为,进而改变训练挑战者的奖励。任务生成与程序性记忆由此成为同一学习过程中相互耦合的部分。

## 方法

### 设置与记号

SESA 通过自我博弈训练一个工具增强的搜索代理,不使用任何外部问题集。一个*提出者*(挑战者)策略 πp\pi\_\{p\} 生成搜索问题;一个*求解器*(学习者)策略 πs\pi\_\{s\} 通过向固定搜索工具发出检索查询并产生最终答案来尝试求解;一个可验证奖励将答案与提出者提供的目标进行比较。在此自我博弈骨干之上,SESA 维护一个非参数*技能记忆* B\mathcal\{B\}:一组可检索、人类可读的策略,求解器在训练期间会查阅它,并可在推理时选择性地保留,它从求解器自身的失败中成长。每条技能存储为

s=(u,c,a,z,m),s=(u,c,a,z,m),(1) 其中 uu 是描述,cc 是触发条件,aa 是规避线索(反模式或常见混淆),zz 是可复用的查询模板,mm 是用于维护的检索次数、有用计数和有害计数。训练循环被组织为四个算法阶段:*记忆初始化*、*非对称自我博弈*、*前沿塑造*和*失败提炼*。图2 (https://arxiv.org/html/2607.29468#Sx3.F2) 展示了这些阶段如何闭合 SESA 飞轮。我们先定义驱动自我博弈博弈的智能体强化学习目标,然后在下一节描述每个阶段并分析它们为何必须耦合。

参见图注 图 2:SESA 训练循环。记忆初始化播种一个可检索的技能库;非对称自我博弈让挑战者提出搜索任务,而只有求解器可以检索技能;前沿塑造将挑战者引向求解器可解性边界附近的问题;失败提炼将失败的轨迹转换为去重后的技能并写回记忆。更新后的技能库强化求解器,并提升后续挑战者生成问题的前沿。

### 记忆初始化

SESA 用 15 条涵盖常见搜索模式的 handwritten 技能和 142 条在早期自我博弈引导阶段挖掘并去重后的技能来初始化 B\mathcal\{B\}:

B0=Bseed∪Bwarm。\mathcal\{B\}\_\{0\}=\mathcal\{B\}\_\{\mathrm\{seed\}\}\cup\mathcal\{B\}\_\{\mathrm\{warm\}\}。(2)

在这 157 条初始条目中,描述、触发器、规避线索、查询模板和使用元数据提供了初始检索基础,并为后续技能提炼和去重锚定了粒度。

### 非对称自我博弈

SUSA 遵循非对称自我博弈(Xiaet al.2025 (https://arxiv.org/html/2607.29468#bib.bib4)),使用分别参数化的提出者策略和求解者策略。这种分离使得求解器的成功率可以稳定地解释为提出者生成问题的难度,更重要的是,它让 SESA 只向求解器暴露检索到的技能。因此,提出者仅通过奖励反馈进行适应,无法直接观察面向解决方案的记忆。关于这种信息不对称性的更多动机和实现细节见补充材料。

### 智能体强化学习目标

SESA 使用基于 Group Relative Policy Optimization(GRPO)的无评论家策略梯度后端来优化两个角色。求解器使用标准分组形式:对于每个生成的问题 x=(q,a∗)x=(q,a^{\ast}),它采样 GG 条独立的搜索轨迹

τi∼πs(⋅∣q,T,R(q;Bt)), i=1,...,G,\tau_{i}\sim\pi_{s}(\cdot\mid q,\mathcal{T},R(q;\mathcal{B}_{t})),\quad i=1,\ldots,G,(3)

其中 T\mathcal{T} 是搜索工具,R(q;Bt)R(q;\mathcal{B}_{t}) 是仅求解器可检索的技能上下文。每条轨迹产生一个最终答案 a^i\hat{a}_{i}。求解器获得一个可验证的答案奖励,

rs(τi,a∗)=1{Judge(a^i,a∗)=1},r_{s}(\tau_{i},a^{\ast})=\mathbf{1}\{\mathrm{Judge}(\hat{a}_{i},a^{\ast})=1\},(4)

其中评判器先检查规范化后的精确匹配,否则使用基于模型的语义匹配来判断是否与目标答案一致。这一奖励稀疏但可靠,并被赋给最终响应 token。由于检索到的上下文 R(q;Bt)R(q;\mathcal{B}_{t}) 会进入式 (1) 中的*在线策略*轨迹,技能并不仅仅是条件化单次推理过程:它们重塑了计算策略梯度所依据的轨迹分布。因此,检索到的指导在训练期间被内化到求解器参数中,而不仅仅作为推理时的提示词,这就是为什么即使禁用技能库,训练后的求解器也保留了大部分优势(参见表 技能增益位于何处? (https://arxiv.org/html/2607.29468#Sx5.SSx3))。

提出者则根据从同一求解器分组导出的难度塑形奖励进行优化(定义见下一节),从而学会提出接近求解器能力前沿的问题。对于求解器更新,GRPO 在组内对奖励进行归一化,以

相似文章

ERSkill: Evolving for Skill-Guided Adaptive Memory Retrieval

arXiv cs.CL

Introduces ERSkill, a retrieval-centric framework for self-evolving, skill-guided adaptive memory access in LLM agents. It co-evolves retrieval skills and a routing policy, substantially outperforming strong baselines across agent memory benchmarks.

自我进化搜索索引

Hugging Face Daily Papers

本文介绍了SELF-INDEX,这是一个使搜索索引能够自主自我进化的框架,从而提升检索性能,并惠及搜索代理和代理记忆系统等下游应用。