Hyper-ES:通过下降方向合并实现LLM推理的高效进化策略
摘要
本文提出Hyper-ES,一种基于子空间的进化策略框架,用于LLM推理。该框架通过轻量级基于梯度的微调获得下降方向,然后使用CMA-ES合并逐层的DARE-TIES系数,在需要更少梯度更新的情况下持续优于GRPO-LoRA。
arXiv:2608.05541v1 公告类型:新
摘要:进化策略(ES)是资源受限的大型语言模型(LLM)推理中基于梯度微调的一种有前景的替代方案。然而,将ES直接应用于数十亿参数的LLM效率极低。在这种高维参数空间中,大多数随机扰动几乎与有用的更新方向正交,导致优化不稳定。我们提出Hyper-ES,一种基于子空间的ES框架,它避免了ES在全参数搜索中的弱点,同时利用其在低维优化中的优势。Hyper-ES不是让ES从LLM参数空间的随机扰动中发现有用方向,而是首先执行少量低成本的基于梯度的微调运行以获得下降方向。尽管每个方向本身可能只能提供有限的改进,但它们的张成空间形成了一个紧凑的适应子空间,捕获了有用的推理更新。然后,Hyper-ES应用CMA-ES在该子空间内优化逐层的DARE-TIES合并系数,使ES能够搜索有意义的下降方向的组合,而不是任意的全模型扰动。我们在三个Qwen2.5-Instruct和DeepSeek-R1-Distill骨干网络上、六个数学推理数据集上评估了Hyper-ES。结果表明,Hyper-ES在需要少10%的占用空间的梯度更新的情况下,持续优于GRPO-LoRA 1%。代码见https://github.com/kuangrepi/Hyper-ES。
查看缓存全文
缓存时间: 2026/08/07 07:47
# 通过下降方向合并实现大语言模型推理的高效进化策略
**来源:** https://arxiv.org/html/2608.05541
余果³,¹,∗,‡ 郑智²,∗,† 巴云鹏¹ 童夏良⁴ 袁明轩⁴ 王振坤¹,†
¹南方科技大学自动化与智能制造学院,中国
²新加坡国立大学计算学院,新加坡
³南京大学智能科学与技术学院,中国
⁴华为技术有限公司诺亚方舟实验室,中国
‡在南开大学实习期间完成的工作。∗同等贡献。†共同通讯作者。
###### 摘要
进化策略(ES)是资源受限的大语言模型(LLM)推理场景中基于梯度的微调的一种有前景的替代方案。然而,直接将ES应用于数十亿参数的LLM是极其低效的。在如此高维的参数空间中,大多数随机扰动几乎与有用的更新方向正交,导致优化不稳定。我们提出**Hyper-ES**,一种基于子空间的ES框架,它避免了ES在全参数搜索中的弱点,同时利用了其在低维优化中的优势。Hyper-ES不是让ES在LLM参数空间中通过随机扰动来发现有用方向,而是首先执行少量低成本的基于梯度的微调运行以获得下降方向。虽然每个方向单独可能只能提供有限的改进,但它们的张成空间形成了一个紧凑的适配子空间,能够捕获有用的推理更新。随后,Hyper-ES应用CMA-ES在该子空间内优化逐层的DARE–TIES合并系数,使ES能够搜索有意义的下降方向的组合,而非任意的全模型扰动。我们在三个Qwen2.5-Instruct和DeepSeek-R1-Distill基座模型上,跨越六个数学推理数据集评估了Hyper-ES。结果表明,Hyper-ES持续优于GRPO-LoRA约1%,同时所需的占用显存的梯度更新次数减少了10%。¹¹¹代码见 https://github.com/kuangrepi/Hyper-ES。
# Hyper-ES:通过下降方向合并实现大语言模型推理的有效进化策略
## 1 引言
大语言模型(LLM)在数学推理方面展现出惊人的能力Li et al. (2025)(https://arxiv.org/html/2608.05541#bib.bib9),尤其是当配备了思维链(CoT)提示技术Wei et al. (2022)(https://arxiv.org/html/2608.05541#bib.bib32),并进一步通过基于梯度的监督微调(SFT)Zheng and Lee (2025)(https://arxiv.org/html/2608.05541#bib.bib34)或强化学习(RL)方法Shao et al. (2024)(https://arxiv.org/html/2608.05541#bib.bib13)进行优化时。然而,尽管这些方法在推理能力上取得了显著提升,但它们内部的梯度反向传播过程导致了显著更高的时间和内存消耗Liu et al. (2025b)(https://arxiv.org/html/2608.05541#bib.bib33),这阻碍了在资源受限场景下对LLM进行推理微调Park et al. (2025)(https://arxiv.org/html/2608.05541#bib.bib35)。
(a) 基于梯度的GRPO用于LLM推理
(b) 无梯度ES用于LLM推理
(c) Hyper-ES(我们的方法):在合并下降方向上进行ES
图1:(a) GRPO使用策略梯度更新模型参数,这通常消耗大量资源。(b) ES为LLM推理提供了一种无梯度方法,适用于资源受限场景,但会导致显著的低效率和失控的随机游走。(c) Hyper-ES用对快速获取的下降方向的系数进行的低维搜索替代全参数探索,以更少的梯度更新实现更高的LLM推理性能。
近年来,进化策略(ES)方法已成为基于梯度的微调的一种有前景的替代方案,用于提升LLM推理能力Qiu et al. (2025)(https://arxiv.org/html/2608.05541#bib.bib12); Sarkar et al. (2025)(https://arxiv.org/html/2608.05541#bib.bib30); Sun et al. (2026)(https://arxiv.org/html/2608.05541#bib.bib29)。与基于梯度的方法(例如,组相对策略优化(GRPO),如图1(a)(https://arxiv.org/html/2608.05541#S1.F1)所示)不同,ES不通过模型进行反向传播,如图1(b)(https://arxiv.org/html/2608.05541#S1.F1)所示,而是仅扰动参数,用可验证的奖励评估每个候选,并朝着表现更优的区域更新参数,展现出10倍的显存效率(Sun et al., 2026)(https://arxiv.org/html/2608.05541#bib.bib29)。然而,它直接应用于LLM时受到维度性的严重限制。在数十亿参数空间中,几乎所有随机采样的扰动都位于与任务改进无关的方向上。在有限的种群规模下,ES因此接收到极其微弱的定向信号,使得全参数搜索的样本效率低下且不稳定Hoy et al. (2026)(https://arxiv.org/html/2608.05541#bib.bib18); Abdi et al. (2026)(https://arxiv.org/html/2608.05541#bib.bib27)。为了在保持ES效率的同时避免其在高维方向发现方面的缺点,我们将更新方向的探索与无导数优化解耦。Hyper-ES不是要求ES通过在全LLM参数空间中进行随机扰动来找到有用的下降方向,而是首先通过在不同数据子集上运行不到十次GRPO更新步骤,从共享基座模型构建N个少样本LoRA方向。虽然这些初步更新成本低廉且各自效果有限,但它们的LoRA增量提供了与任务相关的下降方向,比各向同性随机噪声更能与推理改进对齐。然后,Hyper-ES将这些增量视为基方向,并应用协方差矩阵自适应进化策略(CMA-ES)Hansen and Ostermeier (2001)(https://arxiv.org/html/2608.05541#bib.bib42)来优化它们组合上的逐层DARE–TIES合并系数。Hyper-ES将全参数适配重新表述为仅含数百个参数的低维结构化系数搜索,使ES在保留其轻显存和可并行化特性的同时,在其最有效的机制中运行。
在实验上,我们在Qwen2.5-0.5B-Instruct、Qwen2.5-1.5B-Instruct和DeepSeek-R1-Distill-1.5B上实现了Hyper-ES。在包括GSM8K、GSM-Hard、SVAMP和MultiArith在内的四个算术推理基准,以及两个更具挑战性的数学推理基准AMC23和MATH-500上,Hyper-ES相对于模型合并基线有所提升,并且略微但持续地优于单阶段GRPO。特别是,它实现了高达1%的性能增益,同时需要的昂贵的反向传播步骤减少了10%。
我们的贡献如下:
- •我们提出了Hyper-ES,一种下降方向辅助的ES框架,将全参数搜索转化为对任务相关LoRA更新的紧凑逐层系数搜索。
- •Hyper-ES使用少样本GRPO更新来构建信息丰富的下降方向,使ES能够避免高维随机探索,同时保留其效率。
- •在六个数学推理基准和三个LLM基座模型上,Hyper-ES持续优于模型合并基线,并以更少的昂贵反向传播步骤超越单阶段GRPO。
## 2 预备知识
### 2.1 LLM推理
语言推理过程针对给定的问题 \(\boldsymbol{Q}=(q_{1},\ldots,q_{|\boldsymbol{Q}|})\),首先生成一系列CoT语言推理词元 \(\boldsymbol{R}=(r_{1},\ldots,r_{|\boldsymbol{R}|})\),随后生成答案词元 \(\boldsymbol{A}=(a_{1},\ldots,a_{|\boldsymbol{A}|})\)。推理和答案词元均根据LLM的下一词元预测策略 \(\pi_{\theta}\) 生成,如下所示:
\[
p(\boldsymbol{R},\boldsymbol{A}|\boldsymbol{Q}) = \prod_{t=1}^{|\boldsymbol{R}|}\pi_{\theta}(r_{t}|[\boldsymbol{Q},\boldsymbol{r}_{1:t-1}]) \prod_{t=1}^{|\boldsymbol{A}|}\pi_{\theta}(a_{t}|[\boldsymbol{Q},\boldsymbol{R},\boldsymbol{a}_{1:t-1}]),
\]
其中 \(\boldsymbol{r}_{1:t-1}=(r_{1},\ldots,r_{t-1})\) 且 \(\boldsymbol{a}_{1:t-1}=(a_{1},\ldots,a_{t-1})\);\([\cdot,\cdot]\), \([\cdot,\cdot,\cdot]\) 表示拼接。
##### 用于LLM推理的RL微调
RL方法——如组相对策略优化(GRPO)Shao et al. (2024)(https://arxiv.org/html/2608.05541#bib.bib13)、Dr. GRPO Liu et al. (2025c)(https://arxiv.org/html/2608.05541#bib.bib5)、DAPO Yu et al. (2025)(https://arxiv.org/html/2608.05541#bib.bib22)——为每个问题采样多个候选CoT \([\boldsymbol{R},\boldsymbol{A}]\),并使用反映答案 \(\boldsymbol{A}\) 质量的奖励来评估每个候选。例如,在标准GRPO中Shao et al. (2024)(https://arxiv.org/html/2608.05541#bib.bib13)(如公式(1)所示),为每个 \(\boldsymbol{Q}\) 生成 \(G\) 个候选CoT \(\{\boldsymbol{R},\boldsymbol{A}\}_{g=1}^{G}\),并根据这 \(G\) 个样本内的相对优势 \(\hat{\boldsymbol{A}}_{g}\) 来更新目标。
\[
\mathcal{J}_{\text{GRPO}}(\theta)=\frac{1}{G}\mathbb{E}_{\{\boldsymbol{R},\boldsymbol{A}\}_{g=1}^{G}\sim p(\cdot,\cdot|\boldsymbol{Q})}\Bigg[\sum_{g=1}^{G}\frac{1}{\left\|\boldsymbol{R}_{g}\right\|+\left\|\boldsymbol{A}_{g}\right\|}\sum_{t=1}^{\left\|\boldsymbol{R}_{g}\right\|+\left\|\boldsymbol{A}_{g}\right\|}\Big(\min\left(p_{g,t}\hat{A}_{g},\text{clip}(p_{g,t},1-\epsilon,1+\epsilon)\hat{A}_{g}\right)\Bigg]
\]
\[
\hat{\boldsymbol{A}}_{g}=\frac{f(\boldsymbol{A}_{g})-\text{mean}(f(\boldsymbol{A}))_{g=1}^{G}}{\text{std}(f(\boldsymbol{A}))_{g=1}^{G}},
\qquad p_{g,t}=
\begin{cases}
\frac{\pi_{\theta}(a_{g,t}|[\boldsymbol{Q},\boldsymbol{r}_{g},(a_{g,1},...,a_{g,t-1})])}{\pi_{\theta_{old}}(a_{g,t}|[\boldsymbol{Q},\boldsymbol{r},(a_{g,1},...,a_{g,t-1})])} & \text{if } t>|\boldsymbol{R}_{g}| \\
\frac{\pi_{\theta}(r_{g,t}|[\boldsymbol{Q},(r_{g,1},...,r_{g,t-1})])}{\pi_{\theta_{old}}(r_{g,t}|[\boldsymbol{Q},(r_{g,1},...,r_{g,t-1})])} & \text{if } t\le|\boldsymbol{R}_{g}|.
\end{cases}
\tag{1}
\]
这些基于RL的方法在数学推理任务上通常显著超过监督微调(SFT),使其成为LLM推理的首选。然而,由于较长的采样轨迹(通常有数千个词元),通过反向传播更新参数会消耗大量的时间和空间,这对于资源受限的应用场景来说是难以承受的。
### 2.2 用于LLM推理的进化策略
##### 用于LLM推理的ES微调
直接ES从预训练参数 \(\theta\in\mathbb{R}^{d}\) 开始,并反复构建一个邻近模型的种群。在第 \(t\) 次迭代时,当前模型为 \(\theta_{t}\),其中 \(\theta_{0}=\theta\)。ES从高斯分布中采样 \(G\) 个随机扰动并形成种群,如下所示:
\[
\theta_{t,k}=\theta_{t}+\epsilon_{t,k},\quad \epsilon_{t,k}\sim\mathcal{N}(0,\sigma^{2}I_{d}),\tag{2}
\]
\[
k=1,\ldots,G,
\]
其中 \(\epsilon_{t,k}\) 是参数空间中的一个随机方向,\(\sigma\) 控制扰动的程度。每个候选模型 \(\theta_{t,k}\) 通过一个标量适应度 \(f(\theta_{t,k})\) 进行评估,例如可验证的奖励或验证准确率(例如,公式(1)中基于答案的奖励 \(\hat{\boldsymbol{A}}_{g}\))。这些适应度值随后用于估计更新方向:
\[
\widehat{g}_{\mathrm{ES}}(\theta_{t})=\frac{1}{G}\sum_{k=1}^{G}f(\theta_{t,k})\epsilon_{t,k}.
\]
当前参数更新如下:Salimans et al. (2017)(https://arxiv.org/html/2608.05541#bib.bib28);Qiu et al. (2025)(https://arxiv.org/html/2608.05541#bib.bib12);Sun et al. (2026)(https://arxiv.org/html/2608.05541#bib.bib29):
\[
\theta_{t+1}=\theta_{t}+\eta_{t}\widehat{g}_{\mathrm{ES}}(\theta_{t}).
\]
这里 \(\eta_{t}\) 是ES学习率。
由于ES仅需模型前向采样和评估,而不需要反向传播,因此基于ES的LLM微调方法相比基于梯度的方法(如GRPO)通常消耗更少的时间和空间。如Sun et al. (2026)(https://arxiv.org/html/2608.05541#bib.bib29)所述,ES消耗的GPU显存减少10倍,使其适用于资源受限的场景。然而,当 \(\theta_{t}\) 有数千维甚至数十亿维时,每个 \(\epsilon_{t,k}\) 都是十亿维空间中的随机向量。
##### 问题1:方向发现失败。
直接ES的第一个缺点是,它很难通过随机搜索发现下降方向。在高维空间中,随机扰动很可能与任何有用的下降方向几乎正交。考虑到ES种群后,这一点依然成立,因为种群规模的增长远慢于环境参数维度。
###### 引理1(高维角度集中于正交性附近)。
设 \(g^{*}=-\nabla_{\theta}\mathcal{L}(\theta_{t})\) 为任意固定的非零下降方向。设 \(u_{1},\ldots,u_{G}\) 为 \(\mathbb{R}^{d}\) 中独立采样的 \(G=G(d)\) 个单位扰动方向,并定义锐角
\[
\alpha_{k}=\arccos\left(\left|\left\langle u_{k},\frac{g^{*}}{\|g^{*}\|}\right\rangle\right|\right)\in[0,\pi/2].\tag{3}
\]
给定有限的种群(即 \(\log G=o(d)\)),有
\[
\max_{1\le k\le G}\left|\left\langle u_{k},\frac{g^{*}}{\|g^{*}\|}\right\rangle\right|\xrightarrow[d\to\infty]{p}0,\tag{4}
\]
或等价地,
\[
\min_{1\le k\le G}\alpha_{k}\xrightarrow[d\to\infty]{p}\frac{\pi}{2}.\tag{5}
\]
证明见附录C.1(https://arxiv.org/html/2608.05541#A3.SS1)。
对于数十亿参数的LLM,引理1意味着实际的ES种群中,主导的是那些与损失降低方向夹角接近 \(90^{\circ}\) 的扰动。种群中可能包含具有不同奖励的模型,但这些奖励差异并不意味着ES找到了接近最优更新的方向。相反,当到 \(g^{*}\) 的有用投影极小时,由种群重加权引起的更新主要由与 \(g^{*}\) 正交的分量构成。
##### 问题2:正交随机游走。
第二个缺点是这些正交更新的累积。即使每个单独的正交分量对损失降低没有信息量,重复的ES更新也会在参数空间中累积,导致模型偏离预训练初始化。
###### 引理2(不相关的ES更新累积参数漂移)。
设 \(r_{t}=\widehat{g}_{\mathrm{ES}}(\theta_{t})-\operatorname{Proj}_{g^{*}}\widehat{g}_{\mathrm{ES}}(\theta_{t})\)相似文章
@Kevin_GuoweiXu: 在训练后和推理阶段,对于直接 rollout 很少产生正确答案的困难推理问题,LLM 应如何采样?…
介绍了 BES(双向进化搜索),这是一种面向 LLM 的搜索框架,它将前向候选进化与后向目标分解相结合,以改进在训练后和推理阶段对困难推理问题的采样。
刻意进化:基于智能体推理的样本高效符号回归与大语言模型
刻意进化(DE)是一个智能体框架,通过将候选生成与搜索控制解耦,并结合自适应算子、结构诊断工具和反思性记忆,显著提升了基于大语言模型的符号回归效果,仅需标准样本预算的40%即可取得更优结果。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
HyperGuide:大型语言模型中高效多步推理的双曲引导方法
本文提出HyperGuide方法,将推理进展提炼为双曲几何信号,以指导LLMs的逐步生成,从而无需显式树搜索即可提高多步推理效率。
LC-ERD:通过一致性规约的奖励分解挖掘潜在逻辑实现自我进化推理
LC-ERD是一个框架,从LLM生成的推理链中挖掘潜在逻辑,将全局奖励分解为步骤级信号,实现无需人工标注的自我进化推理。它通过变分逻辑势和多智能体值分解来解决标签噪声、粗粒度监督和分布崩溃问题。