@Kevin_GuoweiXu: 在训练后和推理阶段,对于直接 rollout 很少产生正确答案的困难推理问题,LLM 应如何采样?…

X AI KOLs Timeline 论文

摘要

介绍了 BES(双向进化搜索),这是一种面向 LLM 的搜索框架,它将前向候选进化与后向目标分解相结合,以改进在训练后和推理阶段对困难推理问题的采样。

在训练后和推理阶段,对于直接 rollout 很少产生正确答案的困难推理问题,LLM 应如何采样?Best-of-N(例如 GRPO)和树搜索存在两个局限性:验证信号稀疏;候选结果局限于模型自身的分布。我们引入了 BES:双向进化搜索(Bidirectional Evolutionary Search)—— 一种将前向候选进化与后向目标分解相结合的搜索框架。适用于训练后和推理阶段。
查看原文

相似文章

@lateinteraction: 非常酷的工作!!

X AI KOLs Timeline

Guowei Xu 讨论了 Best-of-N 和树搜索方法在 LLMs 处理困难推理问题时的局限性,指出验证信号稀疏且候选答案仍处于模型的分布范围内。

使用推理代理的大规模反例引导学习

arXiv cs.LG

本文提出将反例引导学习用于LLM执行正则表达式归纳,其中验证器提供反例以优化候选表达式。该方法显著提高了具有挑战性任务上的样本效率和成功率,表明LLM可以从结构化反馈中受益,而不仅仅是将其视为额外数据。