@lateinteraction: 非常酷的工作!!
摘要
Guowei Xu 讨论了 Best-of-N 和树搜索方法在 LLMs 处理困难推理问题时的局限性,指出验证信号稀疏且候选答案仍处于模型的分布范围内。
非常酷的工作!!
查看缓存全文
缓存时间: 2026/05/30 18:43
非常酷的工作!!
Guowei Xu (@Kevin_GuoweiXu): 🚀 在直接生成很少产生正确答案的困难推理问题上,LLM 在后训练和推理过程中应如何采样?
Best-of-N(例如 GRPO)和树搜索共有两个局限性: 🔻 验证信号稀疏 🔻 候选答案仍限于模型自身的
相似文章
@Kevin_GuoweiXu: 在训练后和推理阶段,对于直接 rollout 很少产生正确答案的困难推理问题,LLM 应如何采样?…
介绍了 BES(双向进化搜索),这是一种面向 LLM 的搜索框架,它将前向候选进化与后向目标分解相结合,以改进在训练后和推理阶段对困难推理问题的采样。
@burny_tech: 隐式推理综述 "大型语言模型(LLMs)展现了令人印象深刻的推理能力,尤其是……
本综述全面概述了LLM中的隐式推理,探讨了在连续隐藏状态中执行多步推理且无需显式token级监督的方法。
重采样不如精炼:LLM推理中的测试时自校正
一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。
从零阶选择到二阶判断:组合硬化暴露前沿大语言模型的组合性缺陷
本文介绍了 LogiHard,这是一个利用组合硬化来暴露前沿大语言模型组合性缺陷的框架,展示了模型在逻辑推理任务中准确率的显著下降。
@_avichawla: https://x.com/_avichawla/status/2088536550552605174
这篇文章总结了八种基于Google、OpenAI和Anthropic研究的推理时技术,用于改进大语言模型推理,包括权衡和实用注意事项。