理解Evolution Strategies在LLM推理中的应用:比GRPO更广泛的推理覆盖

Hugging Face Daily Papers 论文

摘要

本文研究了Evolution Strategies (ES)作为LLM推理的后训练范式,表明ES通过稀疏功能更新和种群多样性,提供了比GRPO更广泛的推理覆盖和更好的Pass@K性能。

Evolution Strategies (ES) 最近作为一种内存高效的LLM推理后训练范式出现。然而,ES的优化行为仍研究不足,难以界定其相对于主流后训练范式(如Group Relative Policy Optimization (GRPO))的优势范围。通过系统研究ES的动态和机制,本文首先确立了ES相对于GRPO的性能优势,从理论和实证上表明ES能带来更广泛的推理覆盖,从而更好地利用预训练LLM的推理能力。理论上,我们证明跨ES种群的验证器投影Jensen-Shannon多样性有助于提升Pass@K性能。实证上,与表现出熵崩溃的GRPO不同,ES在提高Pass@1的同时,达到了比GRPO更高的Pass@K。我们进一步开发了一种顺序GRPO-ES训练策略,将GRPO在Pass@1上的优势与ES在Pass@K上的增益相结合。其次,我们发现尽管整体模型参数漂移显著,但ES的任务性能增益仅由少量较大规模更新的稀疏子集贡献。这种功能稀疏性表明,大的参数移动不一定意味着广泛的功能变化,而保留评估进一步显示它不一定会导致灾难性遗忘。最后,我们研究了超参数设计如何影响ES的有效性,表明在更大的LLM中,ES需要较小的种群规模。这些发现将ES定位为一种独特的推理后训练范式,而非GRPO的一种效果较差、内存高效的替代方案。
查看原文
查看缓存全文

缓存时间: 2026/08/28 03:24

论文页面 - 理解用于LLM推理的进化策略:比GRPO具有更广的推理覆盖范围

来源: https://huggingface.co/papers/2608.27351

摘要

进化策略通过稀疏的功能性更新和种群多样性,提高了推理多样性及Pass@K表现(优于GRPO),并支持混合训练方法。 进化策略 (https://huggingface.co/papers?q=Evolution%20Strategies) (ES) 近期已成为一种用于LLM推理的内存高效后训练范式。然而,ES的优化行为仍未被充分研究,这使得我们很难界定其相对于主流后训练范式(例如,群组相对策略优化 (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization) (GRPO (https://huggingface.co/papers?q=GRPO)))的优势范围。本文通过系统研究ES的动态机制,首先识别出ES相较于GRPO的性能优势,从理论和实证上表明ES能带来更广的推理覆盖,从而更好地利用预训练LLM的推理能力。理论上,我们证明ES种群中的验证器投影Jensen-Shannon散度 (https://huggingface.co/papers?q=verifier-projected%20Jensen-Shannon%20diversity) 有助于实现更高的Pass@K (https://huggingface.co/papers?q=Pass%40K) 性能。实证上,与表现出熵坍缩 (https://huggingface.co/papers?q=entropy%20collapse) 的GRPO (https://huggingface.co/papers?q=GRPO) 不同,ES在提升Pass@1的同时,达到了比GRPO更高的Pass@K。我们进一步开发了GRPO-ES的序列训练策略,结合了GRPO在Pass@1上的优势和ES在Pass@K上的增益。其次,我们发现尽管存在整体模型参数漂移,但ES的任务性能提升仅由稀疏的、幅度较大的更新子集贡献。这种功能性稀疏性表明,较大的参数变化不一定意味着广泛的功能改变,而保留集评估也进一步表明这不一定导致灾难性遗忘 (https://huggingface.co/papers?q=catastrophic%20forgetting)。最后,我们研究了超参数设计如何影响ES的有效性,证明在大型LLM中ES需要更小的种群规模 (https://huggingface.co/papers?q=population%20size)。这些发现将ES定位为一种独特的推理后训练范式,而非效果较差、内存高效的GRPO替代方案。 查看arXiv页面 (https://arxiv.org/abs/2608.27351)查看PDF (https://arxiv.org/pdf/2608.27351)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2608.27351) 通过代理获取此论文: hf papers read 2608\.27351 没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文 在模型的README.md中引用 arxiv.org/abs/2608.27351 以从本页链接。

引用此论文的数据集0

无数据集链接此论文 在数据集的README.md中引用 arxiv.org/abs/2608.27351 以从本页链接。

引用此论文的Space0

无Space链接此论文 在Space的README.md中引用 arxiv.org/abs/2608.27351 以从本页链接。

包含此论文的收藏集0

无收藏集包含此论文 将此论文添加到收藏集 (https://huggingface.co/new-collection)以从本页链接。

相似文章

大语言模型何时进行推理?基于熵相变的动力系统视角

arXiv cs.LG

本文探讨了思维链推理在何时对大语言模型有益,表明早期熵动力学能够可靠地指示推理效用,并介绍了EDRM,这是一个轻量级、无需训练的框架,可自适应选择推理策略,在保持或提升准确率的同时显著节省token。