理解Evolution Strategies在LLM推理中的应用:比GRPO更广泛的推理覆盖
摘要
本文研究了Evolution Strategies (ES)作为LLM推理的后训练范式,表明ES通过稀疏功能更新和种群多样性,提供了比GRPO更广泛的推理覆盖和更好的Pass@K性能。
查看缓存全文
缓存时间: 2026/08/28 03:24
论文页面 - 理解用于LLM推理的进化策略:比GRPO具有更广的推理覆盖范围
来源: https://huggingface.co/papers/2608.27351
摘要
进化策略通过稀疏的功能性更新和种群多样性,提高了推理多样性及Pass@K表现(优于GRPO),并支持混合训练方法。
进化策略 (https://huggingface.co/papers?q=Evolution%20Strategies) (ES) 近期已成为一种用于LLM推理的内存高效后训练范式。然而,ES的优化行为仍未被充分研究,这使得我们很难界定其相对于主流后训练范式(例如,群组相对策略优化 (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization) (GRPO (https://huggingface.co/papers?q=GRPO)))的优势范围。本文通过系统研究ES的动态机制,首先识别出ES相较于GRPO的性能优势,从理论和实证上表明ES能带来更广的推理覆盖,从而更好地利用预训练LLM的推理能力。理论上,我们证明ES种群中的验证器投影Jensen-Shannon散度 (https://huggingface.co/papers?q=verifier-projected%20Jensen-Shannon%20diversity) 有助于实现更高的Pass@K (https://huggingface.co/papers?q=Pass%40K) 性能。实证上,与表现出熵坍缩 (https://huggingface.co/papers?q=entropy%20collapse) 的GRPO (https://huggingface.co/papers?q=GRPO) 不同,ES在提升Pass@1的同时,达到了比GRPO更高的Pass@K。我们进一步开发了GRPO-ES的序列训练策略,结合了GRPO在Pass@1上的优势和ES在Pass@K上的增益。其次,我们发现尽管存在整体模型参数漂移,但ES的任务性能提升仅由稀疏的、幅度较大的更新子集贡献。这种功能性稀疏性表明,较大的参数变化不一定意味着广泛的功能改变,而保留集评估也进一步表明这不一定导致灾难性遗忘 (https://huggingface.co/papers?q=catastrophic%20forgetting)。最后,我们研究了超参数设计如何影响ES的有效性,证明在大型LLM中ES需要更小的种群规模 (https://huggingface.co/papers?q=population%20size)。这些发现将ES定位为一种独特的推理后训练范式,而非效果较差、内存高效的GRPO替代方案。
查看arXiv页面 (https://arxiv.org/abs/2608.27351)查看PDF (https://arxiv.org/pdf/2608.27351)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.27351)
通过代理获取此论文:
hf papers read 2608\.27351
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文 在模型的README.md中引用 arxiv.org/abs/2608.27351 以从本页链接。
引用此论文的数据集0
无数据集链接此论文 在数据集的README.md中引用 arxiv.org/abs/2608.27351 以从本页链接。
引用此论文的Space0
无Space链接此论文 在Space的README.md中引用 arxiv.org/abs/2608.27351 以从本页链接。
包含此论文的收藏集0
无收藏集包含此论文 将此论文添加到收藏集 (https://huggingface.co/new-collection)以从本页链接。
相似文章
Hyper-ES:通过下降方向合并实现LLM推理的高效进化策略
本文提出Hyper-ES,一种基于子空间的进化策略框架,用于LLM推理。该框架通过轻量级基于梯度的微调获得下降方向,然后使用CMA-ES合并逐层的DARE-TIES系数,在需要更少梯度更新的情况下持续优于GRPO-LoRA。
超越最佳猜测:利用进化策略提升LLM解决方案覆盖率
本文提出在LLM后训练中使用进化策略(ES)而非强化学习,表明ES能提升解决方案覆盖率(pass@k),并在数学基准上取得更好结果。
@Kevin_GuoweiXu: 在训练后和推理阶段,对于直接 rollout 很少产生正确答案的困难推理问题,LLM 应如何采样?…
介绍了 BES(双向进化搜索),这是一种面向 LLM 的搜索框架,它将前向候选进化与后向目标分解相结合,以改进在训练后和推理阶段对困难推理问题的采样。
大语言模型何时进行推理?基于熵相变的动力系统视角
本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。
什么让大模型成为优秀优化器?——LLM引导演化搜索的轨迹分析
对15个大模型在8项任务上的大规模研究表明,优化成功的关键在于保持局部化搜索轨迹,而非初始解题能力或解的新颖性。