@marfinxx: 这篇Google DeepMind论文简直太棒了 一篇新研究论文证明,将验证器转化为生成式下一个…

X AI KOLs Timeline 论文

摘要

一篇Google DeepMind研究论文表明,将验证器转化为生成式下一token预测器能显著提高推理准确性,通过推理时计算缩放实现链式思考验证,并提升在数学问题上的性能。

这篇Google DeepMind论文简直太棒了 一篇新研究论文证明,将验证器转化为生成式下一token预测器能够解锁超越人类的推理准确性 结果包括:链式思考验证理由、推理时计算缩放,以及从小学数学到竞赛问题的无缝泛化 候选解 → CoT理由生成 → token概率评分 → 多数投票集成 → 最优解选择 Google DeepMind在标准下一token预测下统一了验证和生成: → 验证作为下一token预测 用生成Yes或No token的直接概率替代任意标量奖励头。验证成为原生自回归文本生成,而非人为分类 → 链式思考验证 (GenRM-CoT) 验证器在预测正确性之前生成明确的逐步批评,捕获直接评分遗漏的隐藏计算错误和幻觉 → 推理时计算缩放 采样多个独立的验证理由,并在多数投票中平均预测的Yes概率,过滤单路径错误,并超越基于提示的LLM评判器 → 易到难泛化 一个仅在小学数学上训练的9B生成式验证器成功泛化到MATH500上的高中竞赛问题,将解决率从28.0%提升至44.6% → 假设验证与实证结果 Google DeepMind假设,带有测试时计算缩放的生成式批评显著优于判别式奖励建模。在复杂多步推理管道上的实际验证证实了这一发现:在GSM8K上,任务准确性从73.0%飙升至93.4%,同时所需候选样本减少了2.5倍 将验证视为生成式推理,将奖励建模转变为自回归自我纠正引擎 阅读下文中的完整解析 ↓
查看原文
查看缓存全文

缓存时间: 2026/08/19 14:43

这篇谷歌DeepMind的论文非常出色

新研究论文证明:将验证器转变为生成式下一个词预测器,能解锁超越人类水平的推理准确率

结果带来:思维链验证原理、推理时计算扩展能力,以及从小学数学到竞赛问题的无缝泛化能力

候选解决方案 → 思维链原理生成 → 词元概率评分 → 多数投票集成 → 最优解选择

谷歌DeepMind在标准下一个词预测框架下统一了验证与生成:

验证即下一个词预测 用生成“是“或“否“词元的直接概率,替代任意标量奖励头。验证过程成为原生自回归文本生成,而非人工分类任务

思维链验证机制 验证器在预测正确性前,先生成逐步显式批判分析,能捕获直接评分遗漏的隐性计算错误与幻觉信息

推理时计算扩展 采样多个独立验证原理,通过多数投票平均预测“是“的概率,过滤单路径错误,在性能上超越基于提示的LLM判官

从易到难的泛化能力 仅用小学数学数据训练的9B参数生成式验证器,成功在MATH500高中竞赛题上实现泛化,解决率从28.0%提升至44.6%

假设验证与实证结果 谷歌DeepMind假设:带测试时计算扩展的生成式批判,性能显著优于判别式奖励建模。在复杂多步推理流程上的实践验证确认了这一发现:GSM8K任务准确率从73.0%飙升至93.4%,同时所需候选样本量减少2.5倍

将验证转化为生成式推理,使奖励建模成为自回归自我修正引擎

完整解析请阅读下文文章↓

相似文章

@rohanpaul_ai: Google DeepMind 的新论文。表明人工智能现在可以搜索形式化数学证明,但仅限于精心限制的范围内……

X AI KOLs Following

Google DeepMind 的新论文介绍了 AlphaProof Nexus,这是一个结合了 LLM 与 Lean 证明检查器的 AI 系统,用于在受限的数学领域中搜索形式化证明。该系统解决了来自 Erdős 和 OEIS 集合的几个未解问题,展示了一种新的分工:AI 提出候选证明,验证器确保正确性。