@lateinteraction: 非常酷的工作!!

X AI KOLs Timeline 新闻

摘要

Guowei Xu 讨论了 Best-of-N 和树搜索方法在 LLMs 处理困难推理问题时的局限性,指出验证信号稀疏且候选答案仍处于模型的分布范围内。

非常酷的工作!!
查看原文
查看缓存全文

缓存时间: 2026/05/30 18:43

非常酷的工作!!

Guowei Xu (@Kevin_GuoweiXu): 🚀 在直接生成很少产生正确答案的困难推理问题上,LLM 在后训练和推理过程中应如何采样?

Best-of-N(例如 GRPO)和树搜索共有两个局限性: 🔻 验证信号稀疏 🔻 候选答案仍限于模型自身的

相似文章

重采样不如精炼:LLM推理中的测试时自校正

arXiv cs.AI

一种新的无验证器广度-深度精炼框架通过采样多个推理轨迹、利用自我批评迭代地精炼每条轨迹,并通过多数投票进行聚合,从而在测试时提升LLM推理能力。在多个数学基准和开放权重模型上,该方法持续优于贪心解码、多数投票和基于验证器的选择。