Evolution Fine-Tuning: 跨371个优化任务学习发现
摘要
本文介绍了Evolution Fine-Tuning (EFT),这是一种中期训练范式,通过将进化搜索轨迹转化为监督信号,教会大语言模型跨优化任务进化解决方案。作者构建了包含156K条轨迹、涵盖371个任务的Finch Collection数据集,并证明微调后的模型能够泛化到保留任务,并在多个基准测试上达到最先进性能。
arXiv:2606.29082v1 公告类型: 新
摘要: 设计更快的GPU内核的经验是否也有助于解决一个长期悬而未决的数学猜想?集成进进化搜索的大型语言模型(LLMs)最近在优化任务上取得了最先进的成果,包括开放数学猜想、GPU内核设计、科学定律发现和组合谜题。为了实现这一点,先前的工作每次只对一个目标任务应用搜索框架,因此每个新问题都从头开始处理,搜索过程中积累的经验在模型完成尝试后就被丢弃。这使得迭代进化解决方案的能力(例如,知道要变异哪个部分以及如何变异,决定何时回溯)完全存在于框架中,而非模型本身。模型本身能否获得这种能力并在不同任务间复用,在很大程度上尚未被研究。为解决这一问题,我们提出了Evolution Fine-Tuning (EFT),一种中期训练范式,通过将进化搜索轨迹转化为监督信号来教会LLMs跨任务进化解决方案。我们构建了Finch Collection数据集,包含156K条轨迹,涵盖10个领域和371个优化任务,并对从2B到9B参数的开源LLMs进行微调。实验表明,EFT赋予了跨任务泛化能力:在22个保留任务上,我们的模型平均超过其基础模型10.22%。此外,当与测试时强化学习结合时,我们的模型在两个圆填充任务上达到了最先进的性能,并在Erdős最小重叠问题上优于其基础模型。因此,EFT充当了通用发现代理的“练习阶段”,这些代理不会从头解决新问题。
查看缓存全文
缓存时间: 2026/06/30 05:30
# 进化微调:在 371 个优化任务中学习如何发现
来源:https://arxiv.org/html/2606.29082
11所属机构:明尼苏达大学
22所属机构:卡内基梅隆大学
33所属机构:韩国科学技术院
44所属机构:剑桥大学
55所属机构:汉阳大学
66所属机构:亚马逊
Seungone Kim · Minki Kang · Alistair Cheong · Zerui Chen · Seungho Han · Taehee Jung
本工作独立于作者在亚马逊的职位,与亚马逊的任何工作均无关系。
Dongyeop Kang
###### 摘要
设计更快 GPU 内核的经验是否也能帮助解决长期悬而未决的数学猜想?集成到进化搜索中的大型语言模型(LLM)近期在优化任务上取得了最先进的成果,包括开放式数学猜想、GPU 内核设计、科学定律发现和组合谜题。为了实现这一目标,先前的工作一次只对一个目标任务应用搜索框架,因此每个新问题都是从零开始,而在搜索过程中积累的经验在模型完成尝试后就被丢弃。这使得迭代进化解决方案的能力(例如,知道修改哪部分以及如何修改,决定何时回溯)完全存在于框架中,而非模型本身。模型本身能否获得这种能力并在不同任务间重用,这在很大程度上尚未被研究。为了解决这个问题,我们引入了**进化微调(EFT)**,一种中间训练范式,通过将进化搜索轨迹转化为监督信号,教会 LLM 跨任务进化解决方案。我们构建了 **F\mathcal{F}inch Collection**,一个包含 156K 条轨迹的数据集,涵盖 10 个领域和 371 个优化任务,并对 2B 到 9B 参数的开源 LLM 进行微调。实验表明,EFT 赋予了跨任务泛化能力:在 22 个保留任务上,我们的模型平均超越其基础模型 10.22%。此外,当与测试时强化学习结合时,我们的模型在两个圆堆积任务上达到了最先进的性能,并在 Erdős 最小重叠问题上超越了其基础模型版本。因此,EFT 可以作为通用发现代理的“练习阶段”,而无需每次从零开始解决新问题。
参见图注
图 1:(左) **进化微调(EFT)** 作为“中间训练”,在测试时搜索和学习下,提升了 **F\mathcal{F}inch** 在 Erdős 最小重叠问题上的发现能力。(右) 在 NP 难竞争性编程(CALICO,UC Berkeley 竞赛)中,EFT 实现了跨发现迁移:**F\mathcal{F}inch** 通过结合来自不同领域的策略来解决问题,例如组合优化、推荐系统、鲁棒统计/计算机视觉和数值优化。相比之下,没有 EFT 的基础模型依赖于单一、重复的策略。
## 1 引言
数学、算法工程和自然科学中一些最具影响力的问题是优化任务:这类问题中,候选解可以针对目标进行评分,但最优解无法直接计算得出 [kirkpatrick1983optimization]。具体例子包括开放数学猜想,如 Erdős 最小重叠问题 [erdHos1955some, white2023new]、高性能 GPU 内核的设计 [ouyang2025kernelbench] 以及从数据中发现新的科学定律 [shojaee2025llm]。最近,结合进化搜索方法的大型语言模型(LLM)开始在这些任务上产生最先进的解决方案:在每次迭代中,LLM 提出新的候选解,框架对其进行评分并更新高分候选解的种群,循环持续直到出现强解决方案 [romera2024mathematical, novikov2025alphaevolve, lange2025shinkaevolve]。
这一工作方向上占主导地位的有两个方法论分支:
(1) **测试时搜索** 方法使用固定的、通常是专有的 LLM 作为变异算子,并依赖框架的父代选择和提示逻辑来驱动改进 [assumpccao2025codeevolve, yan2026pacevolve, cemri2026adaevolve, liu2026evox]。
(2) **测试时学习** 方法在搜索过程中额外更新 LLM 的权重,允许模型在探索时专门针对目标任务进行优化 [wang2025thetaevolve, yuksekgonul2026learning]。
尽管取得了经验上的成功,这两个分支有一个共同的局限性:发现能力(即迭代改进解决方案的技巧,知道修改什么、保留什么以及何时回溯)是在每次搜索中构建的,而非内化到模型本身中。具体来说:
1. 测试时搜索方法通常依赖专有的、前沿规模的 LLM 作为其变异算子,因为框架要求在每次迭代中都有一致的高质量提案。在我们的实验中,我们观察到小于 9B 参数的开源模型无法遵循此类框架内的进化轨迹,性能显著较弱(图 1(左))。
2. 测试时学习方法通过允许较小的 LLM 根据自身的搜索经验调整权重来缓解这一问题,并已在这几个数学问题上产生了新的最佳已知解 [wang2025thetaevolve, yuksekgonul2026learning]。然而,这些更新是针对单个搜索循环和单个任务定制的;模型发现的策略未被整合为可重用的能力,因此模型在解决新问题时无法组合来自先前任务的策略(图 1(右))。
3. 更根本的是,在这两个分支中,模型本身都没有获得进化能力。测试时搜索方法根本不更新模型,能力被设计为留在搜索过程中。测试时学习方法通过测试时 RL 更新模型,但更新目的是在单个搜索循环内找到解决方案,而非内化发现能力本身,并且一旦任务解决,这些更新就被丢弃。
解决这些限制的一个有希望的方向是让 LLM 本身**元学习**发现能力(即学习如何跨优化任务进化解决方案)。这样做的核心挑战在于优化任务是 NP 难的,并且缺乏真实的最优解,因此无法使用标准的监督学习配方收集(问题,答案)对。为了规避这一点,我们提出了 **进化微调 (EFT)**,一种中间训练范式,将搜索运行的**轨迹**视为监督信号,从而将发现能力内化到模型本身中。
我们构建了 **F\mathcal{F}inch Collection**,一个大规模数据集,包含 156K 条轨迹,这些轨迹是使用广泛使用的搜索框架 OpenEvolve [openevolve] 和最新的强大模型 Qwen3.5-397B-A17B [qwen35blog] 在 10 个领域、371 个任务上收集的。利用 F\mathcal{F}inch Collection,我们对 2B 到 9B 的开源模型进行微调,并获得了一个新的模型家族:![[Uncaptioned image]](https://arxiv.org/html/2606.29082v1/logos/finch_icon.png) **F\mathcal{F}inch-\{2, 4, 8, 9\}B**。
参见图注
图 2:进化微调 (EFT) 的概念
为了证明 F\mathcal{F}inch Collection 所带来的跨任务泛化能力,我们首先在测试时搜索框架中使用 F\mathcal{F}inch 作为变异算子。F\mathcal{F}inch 在 22 个保留任务上优于其基础模型版本,并实现了与之前由专有模型获得的最佳已知解相当的性能,尽管其使用的是小得多的开源骨干网络。值得注意的是,如图 1(右)所示,在解决一个竞争性编程任务时,我们观察到基础 LLM 倾向于仅应用领域内策略(即 Gauss-Seidel 均匀权重),而 F\mathcal{F}inch 则跨领域迁移策略(例如,应用来自推荐系统的对数域交替最小二乘法、来自数值优化的 Levenberg-Marquardt 方法来解决竞争性编程问题),这表明 EFT 在发现任务中产生了涌现行为。此外,将 F\mathcal{F}inch Collection 中的训练任务数量从 15 个扩展到 355 个,使得 F\mathcal{F}inch 在保留任务上的平均性能提升了 **14.1%**。
最后,为了评估 F\mathcal{F}inch 是否也能从自身的搜索经验中学习,我们在三个任务上对 F\mathcal{F}inch(即带 EFT)和基础 LLM(即不带 EFT)应用测试时学习。我们发现 F\mathcal{F}inch 在两个圆堆积任务上达到了最先进的性能,并在 Erdős 最小重叠问题上超越了其基础模型版本。
## 2 预备知识
#### 优化设置。
我们考虑一个优化任务 τ∈T,具有初始候选解 x₀ 和迭代预算 T。搜索过程中生成的候选解集合记为 X = {x₀, ..., x_T},其中 x₀ 可以是程序 [novikov2025alphaevolve]、数学构造 [imajuku2025ale] 或提示 [openevolve],具体取决于任务。在迭代 t 时,进化框架 S 使用变异算子 M_θ(通常是一个 LLM),根据父解和搜索历史生成新的候选解:x_t = S(x_{t-1}, I, H_{t-1}; M_θ),其中 H_{t-1} 包含选定的先前候选解和反馈。评估器 E 分配一个分数和辅助产物,如日志或自然语言反馈。目标是
x⋆ = arg opt_{x∈X} E(x), opt ∈ {max, min}, (1)
其中优化方向由任务决定:最大化任务用 max,最小化任务(如 Erdos 问题中的 c5 下界)用 min。
表 1:进化方法的比较。"Scaffold" 表示方法是否提供搜索或学习支持来进行进化。"Train" 和 "Test" 分别表示训练或测试时的框架。"OS" 表示是否开源。
| 方法 | 主要贡献 | 框架 | 训练 | 测试 | 范式 | #任务 |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| | | 搜索 | 学习 | 搜索 | 学习 | | |
| AlphaEvolve [novikov2025alphaevolve] | 搜索 | ✓ | ✗ | ✗ | ✗ | – | – | ✗ |
| OpenEvolve [openevolve] | 搜索 | ✓ | ✗ | ✗ | ✗ | – | – | ✓ |
| ShinkaEvolve [lange2025shinkaevolve] | 搜索 | ✓ | ✗ | ✗ | ✗ | – | – | ✓ |
| GEPA [agrawal2025gepa] | 搜索 | ✓ | ✗ | ✗ | ✗ | – | – | ✓ |
| PAC-Evolve [yan2026pacevolve] | 搜索 | ✓ | ✗ | ✗ | ✗ | – | – | ✗ |
| AdaEvolve [cemri2026adaevolve] | 搜索 | ✓ | ✗ | ✗ | ✗ | – | – | ✓ |
| EvoX [liu2026evox] | 搜索 | ✓ | ✗ | ✗ | ✗ | – | – | ✓ |
| DGM [zhang2025darwin] | 搜索 | ✓ | ✗ | ✗ | ✗ | – | – | ✓ |
| HyperAgent [zhang2026hyperagents] | 搜索 | ✓ | ✗ | ✗ | ✗ | – | – | ✓ |
| CORAL [qu2026coral] | 搜索 | ✓ | ✗ | ✗ | ✗ | – | – | ✓ |
| ThetaEvolve [wang2025thetaevolve] | 学习 | ✗ | ✓ | ✗ | ✓ | RL | 1 | ✓ |
| TTT-Discover [yuksekgonul2026learning] | 学习 | ✗ | ✓ | ✗ | ✓ | RL | 1 | ✓ |
| **EFT (Ours)** | 模型, 数据 | ✓ | ✓ | ✓ | ✓ | SFT, RL | **371** | ✓ |
参见图注
图 3:F\mathcal{F}inch Collection 中优化任务组(共 371 个任务)的概览,气泡大小表示每组中的任务数量。
#### 发现。
遵循先前的工作 [yuksekgonul2026learning],如果 x⋆ 在预算 T 内改进了先前的最佳已知解 x_{sota},则称为**发现**,即对于最大化任务 E(x⋆) > E(x_{sota}),对于最小化任务不等式方向相反。
#### 进化搜索框架。
为了发现新解,现有的基于 LLM 的进化方法使用基于搜索或基于学习的框架。基于搜索的框架保持 θ 固定并依赖外部搜索机制,而基于学习的框架在测试时更新 θ。这两种方法都基于四个核心模块组件:(i) 根据父解、任务指令、历史和反馈构建提示;(ii) 使用 M_θ 通过基于 diff 的编辑器或完整重写生成候选解;(iii) 使用 E 评估候选解;(iv) 将合格的候选解存储在种群数据库 D 中。更新后的数据库 D_t 随后用于下一次迭代,直到达到计算预算或目标分数。我们在表 3 中总结了现有的进化方法。
## 3 进化微调
进化框架可以在测试时发现强解,但发现过程通常位于模型外部。我们引入了**进化微调 (EFT)**,一种中间训练过程,将这种测试时发现行为迁移到较小的开源 LLM 中。EFT 将进化搜索轨迹转化为监督训练示例,使得模型在部署前学会充当更强的变异算子。如表 3 所总结,EFT 与测试时框架的选择是正交的:所得模型可以在基于搜索的框架中冻结权重使用,也可以通过基于学习的框架(如测试时 RL)进一步适应。
参见图注
图 4:F\mathcal{F}inch Collection 构建流程概览,包括 (1) 种子优化任务收集,(2) 通过进化搜索框架(即 OpenEvolve [openevolve])进行轨迹收集,以及 (3) 针对不可恢复情况、中断情况以及导致系统性错误(例如超时错误)的候选解进行轨迹过滤。
### 3.1 F\mathcal{F}inch Collection 构建
#### 概览。
图 4 说明了 F\mathcal{F}inch Collection 的构建过程。每个任务包括任务规范、初始候选解、评估器和配置文件。我们在这些任务文件上运行进化框架,以生成一系列父代到子代解的转换。每次转换记录提示、父解、生成的候选解、评估器输出、分数变化和执行产物。然后,我们移除反馈不可靠或其转换会提供误导性监督的轨迹。最终数据集包含大约 156K 条跨 371 个优化任务的进化轨迹。
#### 步骤 1:种子优化任务收集。
优化的训练数据难以合成,因为许多目标问题是 NP 难的,缺乏已知的全局最优解,并且需要专家设计的评估器(参见附录 B 中的表 8)。我们不生成人工任务,而是从现有优化基准中获取种子任务,这些基准的目标是可执行且经过外部验证的。我们根据三个标准选择任务:(i) 任务需要非平凡的搜索,(ii) 不应简化为匹配已知的真实答案,(iii) 应提供确定性评估器,为候选解分配连续或可比较的分数。总共,如图 3 所示,我们收集了来自 10 个基准的 371 个种子任务,涵盖数学发现、竞争性编程、启发式优化、数值算法优化、符号回归、GPU 内核优化、构造性搜索和生物去噪基准。这些包括 AlphaEvolve 的数学发现问题 [novikov2025alphaevolve]、FrontierCS [mang2025frontiercs]、ALE-Bench [imajuku2025ale]、AlgoTune [press2025algotune]、GPU Mode [gpumode]、LLM-SRBench [shojaee2025llm] 以及来自 OpenEvolve 的函数最小化和 K-Module 任务。相似文章
Task-CoEvolve:通过自适应验证任务选择实现高效工具优化
Task-CoEvolve是一种新方法,用于高效优化LLM智能体工具,通过自适应选择验证任务来降低评估成本并保持性能,在基准测试中实现了评估次数减少80%。
MetaEvo: 一种用于经验驱动型智能体持续进化的元优化框架
MetaEvo 提出了一种两阶段框架,用于基于LLM的智能体的持续进化,利用基于偏好的优化来增强原则抽象和用于经验重用的模块化架构,在推理基准测试上优于强基线。
自我改进往往是突发的:大规模模型的Enlightenment式微调
本文介绍了Enlightenment,一种针对大规模模型的无需训练的后调整方法,它修改关键模块中的快捷连接而不更新权重,实现了突发的能力提升。通过注意力头混合和标量调制的残差连接,该方法在LLMs和VLMs上展示了有效性。
什么让大模型成为优秀优化器?——LLM引导演化搜索的轨迹分析
对15个大模型在8项任务上的大规模研究表明,优化成功的关键在于保持局部化搜索轨迹,而非初始解题能力或解的新颖性。
跨对齐训练、模型生物和玩具模型的共享SFT经验
本文研究将关于监督微调(SFT)的经验跨对齐训练、模型生物和玩具模型进行迁移,表明像基于行为原因的训练和混合模型内数据等技术可以改善泛化性和能力保持。