@Kevin_GuoweiXu: 在训练后和推理阶段,对于直接 rollout 很少产生正确答案的困难推理问题,LLM 应如何采样?…
摘要
介绍了 BES(双向进化搜索),这是一种面向 LLM 的搜索框架,它将前向候选进化与后向目标分解相结合,以改进在训练后和推理阶段对困难推理问题的采样。
在训练后和推理阶段,对于直接 rollout 很少产生正确答案的困难推理问题,LLM 应如何采样?Best-of-N(例如 GRPO)和树搜索存在两个局限性:验证信号稀疏;候选结果局限于模型自身的分布。我们引入了 BES:双向进化搜索(Bidirectional Evolutionary Search)—— 一种将前向候选进化与后向目标分解相结合的搜索框架。适用于训练后和推理阶段。
相似文章
理解Evolution Strategies在LLM推理中的应用:比GRPO更广泛的推理覆盖
本文研究了Evolution Strategies (ES)作为LLM推理的后训练范式,表明ES通过稀疏功能更新和种群多样性,提供了比GRPO更广泛的推理覆盖和更好的Pass@K性能。
超越最佳猜测:利用进化策略提升LLM解决方案覆盖率
本文提出在LLM后训练中使用进化策略(ES)而非强化学习,表明ES能提升解决方案覆盖率(pass@k),并在数学基准上取得更好结果。
Hyper-ES:通过下降方向合并实现LLM推理的高效进化策略
本文提出Hyper-ES,一种基于子空间的进化策略框架,用于LLM推理。该框架通过轻量级基于梯度的微调获得下降方向,然后使用CMA-ES合并逐层的DARE-TIES系数,在需要更少梯度更新的情况下持续优于GRPO-LoRA。
@lateinteraction: 非常酷的工作!!
Guowei Xu 讨论了 Best-of-N 和树搜索方法在 LLMs 处理困难推理问题时的局限性,指出验证信号稀疏且候选答案仍处于模型的分布范围内。
刻意进化:基于智能体推理的样本高效符号回归与大语言模型
刻意进化(DE)是一个智能体框架,通过将候选生成与搜索控制解耦,并结合自适应算子、结构诊断工具和反思性记忆,显著提升了基于大语言模型的符号回归效果,仅需标准样本预算的40%即可取得更优结果。