@Kevin_GuoweiXu: 在训练后和推理阶段,对于直接 rollout 很少产生正确答案的困难推理问题,LLM 应如何采样?…
摘要
介绍了 BES(双向进化搜索),这是一种面向 LLM 的搜索框架,它将前向候选进化与后向目标分解相结合,以改进在训练后和推理阶段对困难推理问题的采样。
在训练后和推理阶段,对于直接 rollout 很少产生正确答案的困难推理问题,LLM 应如何采样?Best-of-N(例如 GRPO)和树搜索存在两个局限性:验证信号稀疏;候选结果局限于模型自身的分布。我们引入了 BES:双向进化搜索(Bidirectional Evolutionary Search)—— 一种将前向候选进化与后向目标分解相结合的搜索框架。适用于训练后和推理阶段。
相似文章
@lateinteraction: 非常酷的工作!!
Guowei Xu 讨论了 Best-of-N 和树搜索方法在 LLMs 处理困难推理问题时的局限性,指出验证信号稀疏且候选答案仍处于模型的分布范围内。
刻意进化:基于智能体推理的样本高效符号回归与大语言模型
刻意进化(DE)是一个智能体框架,通过将候选生成与搜索控制解耦,并结合自适应算子、结构诊断工具和反思性记忆,显著提升了基于大语言模型的符号回归效果,仅需标准样本预算的40%即可取得更优结果。
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。
@rasbt: LLM 如何切换低、中、高努力推理?以及 LLM 如何学习推理更多或更少?
一篇文章解释 LLM 如何在推理和训练中切换低、中、高努力推理。
使用推理代理的大规模反例引导学习
本文提出将反例引导学习用于LLM执行正则表达式归纳,其中验证器提供反例以优化候选表达式。该方法显著提高了具有挑战性任务上的样本效率和成功率,表明LLM可以从结构化反馈中受益,而不仅仅是将其视为额外数据。