$\varepsilon$-MemEvo:面向LLM程序演化的自适应跨任务记忆迁移

arXiv cs.AI 论文

摘要

本文介绍了ε-MemEvo,一个用于基于LLM的程序演化中跨任务知识迁移的框架,它将策略记忆存储为自然语言摘要,并使用自适应注入门控。该框架在8个优化基准上均取得了性能提升,计算开销不到1%。

arXiv:2608.12522v1 公告类型:新 摘要:基于LLM的程序演化系统(如FunSearch和AlphaEvolve)已展现出发现新算法的强大能力,但通常每个任务都被孤立优化,任务完成后搜索经验即被丢弃。我们提出了$\varepsilon$-MemEvo,一个用于LLM程序演化中跨任务知识迁移的框架。$\varepsilon$-MemEvo将先前经验存储为与任务无关的策略记忆:成功算法策略的简洁自然语言摘要,而非原始代码,从而支持跨不同API和评估器的任务迁移。为避免语义不匹配记忆带来的负迁移,$\varepsilon$-MemEvo采用自适应注入门控,决定检索到的记忆是否应被注入以及以何种强度注入。我们在涵盖数学优化和系统工程的8个不同优化基准上评估了$\varepsilon$-MemEvo,使用内容级留一法协议排除目标任务记忆条目。在主要的GPT-5骨干网络上,与AdaEvolve相比,$\varepsilon$-MemEvo在所有8个任务上均提升了AUCC,平均相对增益为+8.7%,平均早期收敛改进为+9.4%。消融实验表明,朴素记忆注入可能灾难性地失败,而自适应门控在所有五项消融任务中均保持安全。数据更新后的后验在观测状态下是可解释的:在搜索改进期间它倾向于跳过,并在早期和晚期平台期从跳过转向提示。这些增益的计算开销不到1%。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:25

# 面向LLM程序演化的自适应跨任务记忆迁移
来源:https://arxiv.org/html/2608.12522
## ε\varepsilon\-MemEvo:面向LLM程序演化的自适应跨任务记忆迁移

###### 摘要

基于LLM的程序演化系统(如FunSearch和AlphaEvolve)已展现出发现新算法的强大能力,但通常以孤立方式优化每个任务,并在完成后丢弃搜索经验。我们提出 ε\varepsilon\-MemEvo,一个用于LLM程序演化中*跨任务知识迁移*的框架。ε\varepsilon\-MemEvo 将先前的经验存储为*任务无关的策略记忆*:成功算法策略的紧凑自然语言摘要,而非原始代码,从而支持跨不同API和评估器的迁移。为避免来自语义不匹配记忆的负迁移,ε\varepsilon\-MemEvo 使用自适应注入门控,决定检索到的记忆是否应被注入,以及以何种强度注入。我们在8个覆盖数学优化和系统工程的多样化优化基准上评估 ε\varepsilon\-MemEvo,使用内容级留一(Leave-One-Out)协议,排除目标任务记忆条目。在主要GPT-5骨干上,ε\varepsilon\-MemEvo 在所有8个任务上相对于AdaEvolve提高了AUCC,平均相对增益为\+8.7%\+8.7\%,并且平均提升早期收敛\+9.4%\+9.4\%。消融实验表明,朴素记忆注入可能灾难性失败,而自适应门控在所有五个消融任务上保持安全。数据更新的后验在观测状态下可解释:它在改善搜索期间偏向*skip*,并在早期和晚期平台期从*skip*转向*hint*。这些增益带来<1%<\\\!1\%的计算开销。

## 1 引言

大规模语言模型(LLMs)已成为自动算法发现的强大引擎。像 FunSearch (26 (https://arxiv.org/html/2608.12522#bib.bib1)) 和 AlphaEvolve (22 (https://arxiv.org/html/2608.12522#bib.bib2)) 这样的系统利用LLMs迭代生成、评估和改进程序,在组合优化、矩阵乘法和科学计算方面取得了突破。最近的工作如 AdaEvolve (4 (https://arxiv.org/html/2608.12522#bib.bib3)) 引入了自适应岛屿模型和范式突破,以进一步提升搜索多样性。

尽管取得了这些进展,一个根本性的局限仍然存在:*每个任务都从零开始*。当LLM演化系统完成一个优化任务并转向相关任务时,它不保留任何东西——既没有关于哪些策略有效的记忆,也没有关于搜索结构的直觉,更没有可复用的启发式方法。这种“遗忘式”行为导致相关任务之间的冗余探索、缓慢的冷启动收敛以及API预算的浪费。

图1:动机示例。在解决一个相关的几何任务后,ε\varepsilon\-MemEvo 在圆填充问题上从记忆中检索到一种几何排列启发式,并在3次迭代内达到其最终分数的90%(而AdaEvolve需要9次)。策略记忆库存储策略摘要(而非代码),支持跨不同API和指标的任务迁移。

考虑一个具体场景:在优化一个几何填充问题后,系统已经学到“具有对称偏移的结构化网格布局最小化重叠”。这种几何直觉也可以使相关填充任务受益,然而现有系统无法利用它。人类研究者自然会借鉴先前经验——LLM演化系统为何不能如此?我们提出 ε\varepsilon\-MemEvo(ε\varepsilon\-Memory\-augmented Evolution,记忆增强演化),一个用于基于LLM的程序演化中跨任务知识迁移的框架。ε\varepsilon\-MemEvo 做出了两个针对演化编码的方法论举措:

- •内容级迁移:通过*策略记忆库*,存储已完成任务中由LLM提取的自然语言策略摘要(而非原始代码),从而支持跨异构API和评估器的迁移。
- •策略级门控:通过*自适应注入门控*,将记忆使用视为自适应门控问题,其主要作用是避免负迁移:它根据搜索状态学习检索到的记忆应在何时被抑制、软性建议或强力施加。

ε\varepsilon\-MemEvo 背后的关键洞见是,*演化编码中的跨任务迁移主要是一个安全问题,而不仅仅是检索问题*。如果每轮迭代都天真地注入跨任务策略,可能导致灾难性的负迁移——在我们的消融中,五个任务中有两个在始终注入(always-inject)下搜索完全无法产生*任何*分数改进的程序,同样的两个任务在基于规则停滞策略下也失败(第4.5节 (https://arxiv.org/html/2608.12522#S4.SS5))。自适应门控通过对Beta臂进行后验采样来解决这一问题,因此在几次不成功的注入后,guide 臂会被降权,在错配任务上恢复类似 skip 的行为,同时在其它地方保留注入收益。尽管自适应门控在良性任务上并不统一优于手工调优规则,但它是我们研究中唯一在所有五个任务上无需逐任务阈值调优即可保持安全的变体。

为了评估内容级跨任务迁移,我们采用*留一(LOO)协议*:当对任务 kk 进行评估时,记忆库排除来自任务 kk 自身的所有经验。

我们在8个基准上评估 ε\varepsilon\-MemEvo,涵盖圆填充、信号处理、负载均衡、SQL优化等,并使用两个LLM骨干(GPT-5 和 Gemini-3-Pro)。我们的关键发现:

1. 1\.一致的收敛改进。ε\varepsilon\-MemEvo 在所有8个任务上均取得更高AUCC(p=0.0078p=0.0078,Wilcoxon符号秩检验),在GPT-5上平均相对改进为\+8.7%\+8.7\%,在Gemini-3-Pro上为\+11.7%\+11.7\%。
2. 2\.最强的早期加速。在GPT-5上,AUC@20平均提升\+9.4%\+9.4\%,其中圆填充提升\+26.0%\+26.0\%,事务调度提升\+27.2%\+27.2\%,表明最大增益出现在冷启动收敛阶段。
3. 3\.TS避免灾难性负迁移。完整的 ε\varepsilon\-MemEvo 在所有5个消融任务上优于AdaEvolve;而朴素始终注入和基于规则的停滞变体在2/5的任务上均未能产生任何分数改进程序。
4. 4\.可忽略的开销。跨任务迁移增加了每轮迭代不到1%的成本(约0.77秒,对比基线80–140秒);8个主要任务的总墙钟时间为AdaEvolve的0.69×0.69\times。

## 2 相关工作

#### 基于LLM的程序演化。

在遗传编程 (14 (https://arxiv.org/html/2608.12522#bib.bib16)) 的基础上,最近的工作用LLMs取代了手工设计的变化算子。FunSearch (26 (https://arxiv.org/html/2608.12522#bib.bib1))、AlphaEvolve (22 (https://arxiv.org/html/2608.12522#bib.bib2)) 和 OpenEvolve (29 (https://arxiv.org/html/2608.12522#bib.bib17)) 在数学和系统基准上确立了基于LLM的演化搜索;ShinkaEvolve (15 (https://arxiv.org/html/2608.12522#bib.bib19))、CodeEvolve (3 (https://arxiv.org/html/2608.12522#bib.bib20))、GEPA (1 (https://arxiv.org/html/2608.12522#bib.bib18)) 和 AdaEvolve (4 (https://arxiv.org/html/2608.12522#bib.bib3)) 通过样本高效采样、岛屿模型和自适应范式突破进一步扩展了这些工作。更早期的工作包括 ELM (16 (https://arxiv.org/html/2608.12522#bib.bib5))、Language Model Crossover (21 (https://arxiv.org/html/2608.12522#bib.bib9))、EoH (18 (https://arxiv.org/html/2608.12522#bib.bib6))、OPRO (33 (https://arxiv.org/html/2608.12522#bib.bib7))、EvoPrompting (6 (https://arxiv.org/html/2608.12522#bib.bib4)) 和 EvoX (19 (https://arxiv.org/html/2608.12522#bib.bib8))。所有这些都是在任务内运作,没有显式的跨任务记忆。ε\varepsilon\-MemEvo 通过在表示层面(策略记忆)和控制层面(自适应干预)都将跨任务迁移作为一等公民来填补这一空白。

#### 基于LLM的程序演化中的选择。

最近的LLM演化框架通过各种机制选择*任务内*程序进行变异。FunSearch (26 (https://arxiv.org/html/2608.12522#bib.bib1)) 和 OpenEvolve (29 (https://arxiv.org/html/2608.12522#bib.bib17)) 使用具有分数加权父代采样和周期性岛屿重置的岛屿模型;AlphaEvolve (22 (https://arxiv.org/html/2608.12522#bib.bib2)) 通过多模型协作扩展了这一点;ShinkaEvolve (15 (https://arxiv.org/html/2608.12522#bib.bib19)) 增加了拒绝采样的自适应父代采样以提高样本效率;AdaEvolve (4 (https://arxiv.org/html/2608.12522#bib.bib3)) 将自适应岛屿模型与范式突破相结合,定期向下一轮变异提示中注入概念上不同的策略。所有这些都在单一任务内运作:选择使用为当前问题发现的程序,可记忆的工件在任务之间重置。ε\varepsilon\-MemEvo 则增加了一个跨任务层:一个上下文Thompson采样门控 (31 (https://arxiv.org/html/2608.12522#bib.bib11);5 (https://arxiv.org/html/2608.12522#bib.bib30);12 (https://arxiv.org/html/2608.12522#bib.bib31);2 (https://arxiv.org/html/2608.12522#bib.bib32)) 决定检索到的策略应被抑制、建议还是施加。最接近的先例是运行内自适应算子选择 (7 (https://arxiv.org/html/2608.12522#bib.bib33);9 (https://arxiv.org/html/2608.12522#bib.bib34));ε\varepsilon\-MemEvo 则是对跨任务干预进行门控。

相关基础包括元学习 (11 (https://arxiv.org/html/2608.12522#bib.bib15);10 (https://arxiv.org/html/2608.12522#bib.bib26))、检索增强代码生成 (17 (https://arxiv.org/html/2608.12522#bib.bib12);20 (https://arxiv.org/html/2608.12522#bib.bib21);25 (https://arxiv.org/html/2608.12522#bib.bib22);34 (https://arxiv.org/html/2608.12522#bib.bib23))、智能体记忆 (30 (https://arxiv.org/html/2608.12522#bib.bib13);32 (https://arxiv.org/html/2608.12522#bib.bib14);23 (https://arxiv.org/html/2608.12522#bib.bib24);24 (https://arxiv.org/html/2608.12522#bib.bib25)) 以及持续学习 (13 (https://arxiv.org/html/2608.12522#bib.bib27);28 (https://arxiv.org/html/2608.12522#bib.bib28);8 (https://arxiv.org/html/2608.12522#bib.bib29))。

## 3 方法

### 3.1 问题设定

我们考虑一个顺序设置,其中基于LLM的演化系统解决任务 T={T1,...,TN}\\mathcal\{T\}=\\\{T\_\{1\},\\ldots,T\_\{N\}\\\}。每个任务 TiT\_\{i\} 有描述 did\_\{i\}、评估函数 fi:P→Rf\_\{i\}:\\mathcal\{P\}\\to\\mathbb\{R\} 和种子程序 pi0p\_\{i\}^\{0\};系统在每个任务上运行 MM 次迭代以最大化 fif\_\{i\}。ε\varepsilon\-MemEvo 通过一个持久记忆状态 M=(B,π)\\mathcal\{M\}=\(\\mathcal\{B\},\\pi\) 增强标准的(每任务)设置,该状态包含一个策略记忆库 B\\mathcal\{B\} 和一个注入策略 π\\pi。该策略在每个任务期间更新,而记忆库在成功任务完成时追加一次;两者都被带到后续任务中。

### 3.2 架构概述

参见图2标题。图2:ε\varepsilon\-MemEvo 架构。先前任务的最佳程序在LOO下被提炼为任务无关的策略。在每次迭代中,状态条件的Thompson采样门控选择 skip、hint 或 guide;检索到的策略和选定的强度增强基础提示。AdaEvolve 评估每个候选并返回延迟奖励,用于更新门控。在一次成功的任务运行完成后,其最终最佳程序会向记忆贡献一条策略,供后续任务使用。ε\varepsilon\-MemEvo 包裹在 AdaEvolve (4 (https://arxiv.org/html/2608.12522#bib.bib3)) 基础框架周围,增加了两个跨任务迁移模块(图2 (https://arxiv.org/html/2608.12522#S3.F2)):一个*策略记忆库* B\\mathcal\{B\},存储来自先前任务的策略摘要(通过嵌入相似度检索),以及一个*自适应注入门控* π\\pi,决定是否注入记忆以及以何种强度注入。在任务 TiT\_\{i\} 的第 tt 次迭代时,控制器 (1) 根据搜索状态 sts\_t 查询 π\\pi 以获得动作 at∈{skip,hint,guide}a\_\{t\}\\in\\\{\\texttt\{skip\},\\texttt\{hint\},\\texttt\{guide\}\\\};(2) 如果 at≠skipa\_\{t\}\\neq\\texttt\{skip\},从 B−i\\mathcal\{B\}\_\{\-i\} 检索前3个策略;(3) 以强度 ata\_\{t\} 构建增强提示;(4) 生成并评估候选;(5) 解析延迟奖励并更新 π\\pi。

### 3.3 策略记忆库

#### 策略提取。

在一次成功的任务运行完成后,我们使用 GPT-4.1-mini 从其最终最佳程序中提取任务无关的策略摘要:

tactici=LLMextract(di,pibest,fi(pibest)).\\text\{tactic\}\_\{i\}=\\text\{LLM\}\_\{\\text\{extract\}\}\\\!\\left\(d\_\{i\},\\;p\_\{i\}^\{\\text\{best\}\},\\;f\_\{i\}\(p\_\{i\}^\{\\text\{best\}\}\)\\right\).(1)

提取提示要求给出通用算法描述(例如,“两阶段优化,先贪心初始化,再进行梯度下降”)而非任务特定代码。每个成功完成的任务贡献一个条目,包含策略、方法类型标签、任务描述和嵌入;该条目仅供后续任务使用。

#### 语义检索。

对于新任务描述 djd\_\{j\},我们通过 text-embedding-3-small(1536维)嵌入 ej=Embed(dj)\\mathbf\{e\}\_\{j\}=\\text\{Embed\}\(d\_\{j\}\),并按分数加权相似度对记忆条目排序:

rk=cos(ej,ek)⋅(1+0.3⋅log(1+max(Δk,0.01))),r\_\{k\}=\\cos\(\\mathbf\{e\}\_\{j\},\\mathbf\{e\}\_\{k\}\)\\cdot\\left\(1\+0\.3\\cdot\\log\(1\+\\max\(\\Delta\_\{k\},0\.01\)\)\\right\),(2)

其中 Δk\\Delta\_\{k\} 是条目 kk 的策略相对于其基线的分数改进;我们返回前3个。

### 3.4 自适应注入门控

注入门控实现为一个上下文bandit,具有由Thompson采样更新的Beta分布臂。我们将其主要设计为*抵御负迁移的门控*,而非追求奖励最大化的控制器:在检索到的策略不匹配的任务上,guide 的后验会在几次不成功的注入内迅速坍缩,策略会恢复到以 skip 动作为主。

#### 状态空间。

由两个特征组合出六个离散状态:搜索阶段∈{improving,plateau,stagnating}\\in\\\{\\texttt\{improving\},\\texttt\{plateau\},\\texttt\{stagnating\}\\\},由全局改进率 ρ=improvementsevaluations\\rho=\\frac\{\\text\{improvements\}\}\{\\text\{evaluations\}\}\(ρ>0.1⇒improving\\rho\>0\.1\\Rightarrow\\texttt\{improving\};0.02<ρ≤0.1⇒plateau0\.02<\\rho\\leq 0\.1\\Rightarrow\\texttt\{plateau\};ρ≤0.02⇒stagnating\\rho\\leq 0\.02\\Rightarrow\\texttt\{stagnating\});以及任务阶段∈{early,late}\\in\\\{\\texttt\{early\},\\texttt\{late\}\\\},其中 t/M<0.4t/M<0.4 为早期,其余迭代为晚期。

#### 动作空间。

三种注入强度:skip(不注入,使用基础提示)、hint(将检索到的策略作为可选参考)、guide(将最佳策略作为推荐方法,并注入到范式突破生成中)。

#### 信息先验。

每个 (s,a)(s,a) 对为 Beta(αs,a,βs,a)\\text\{Beta\}\(\\alpha\_\{s,a\},\\beta\_\{s,a\}\)。我们设置 Prior(improving,skip)=Beta(3,1)\\text\{Prior\}\(\\texttt\{improving\},\\texttt\{skip\}\)=\\text\{Beta\}\(3,1\) 和 Prior(stagnating,guide)=Beta(3,1)\\text\{Prior\}\(\\texttt\{stagnating\},\\texttt\{guide\}\)=\\text\{Beta\}\(3,1\),其它对为 Beta(1,1)\\text\{Beta\}\(1,1\)。

#### 决策与奖励。

在每次迭代中,我们采样 θs,a∼Beta(αs,a,βs,a)\\theta\_\{s,a\}\\sim\\text\{Beta\}\(\\alpha\_\{s,a\},\\beta\_\{s,a\}\) 并选择 a∗=arg⁡maxa⁡θs,aa^\{\*\}=\\arg\\max\_\{a\}\\theta\_\{s,a\}。在应用动作之前,我们记录当前最佳分数 fpre∗f^\{\*\}\_\{\\mathrm\{pre\}\}。奖励是延迟的:在窗口之后...

相似文章

MemEvoBench:LLM 代理内存误演化基准测试

arXiv cs.CL

MemEvoBench 引入了首个用于评估 LLM 代理内存安全性的基准测试,衡量对抗性内存注入、噪声输出和有偏反馈在问答与工作流任务中导致的行为衰退。该研究表明内存演化是安全失败的重要因素,且静态防御措施不足以应对。

跨异构任务的自演化LLM记忆抽取

Hugging Face Daily Papers

研究者推出BEHEMOTH基准与CluE聚类提示优化,使LLM能从多样化任务中抽取并保留异构记忆,相比既往自演化框架提升9%。

MemPro:作为可进化程序的智能体记忆系统

arXiv cs.CL

MemPro 是一个系统级进化框架,它将记忆构建-检索管道视为一个可进化的程序,使用进化智能体(Evolving Agent)迭代诊断失败并创建改进版本。在长期任务基准上的实验表明,与静态和提示级基线相比,它在性能-成本权衡方面取得了持续改进。

EvoArena:追踪记忆演化以实现动态环境中鲁棒的LLM智能体

Hugging Face Daily Papers

EvoArena引入了一个基准测试,用于评估LLM智能体在动态环境中的表现,该环境在终端、软件和社交领域具有渐进式更新;同时EvoMem提出了一种基于补丁的记忆范式,记录结构化的演化;实验表明,当前智能体在EvoArena上仅达到39.6%的准确率,而EvoMem在该基准测试上平均提升1.5%,并在GAIA和LoCoMo上也有所改进。