@marfinxx: 这篇Google DeepMind论文简直太棒了 一篇新研究论文证明,将验证器转化为生成式下一个…
摘要
一篇Google DeepMind研究论文表明,将验证器转化为生成式下一token预测器能显著提高推理准确性,通过推理时计算缩放实现链式思考验证,并提升在数学问题上的性能。
查看缓存全文
缓存时间: 2026/08/19 14:43
这篇谷歌DeepMind的论文非常出色
新研究论文证明:将验证器转变为生成式下一个词预测器,能解锁超越人类水平的推理准确率
结果带来:思维链验证原理、推理时计算扩展能力,以及从小学数学到竞赛问题的无缝泛化能力
候选解决方案 → 思维链原理生成 → 词元概率评分 → 多数投票集成 → 最优解选择
谷歌DeepMind在标准下一个词预测框架下统一了验证与生成:
→ 验证即下一个词预测 用生成“是“或“否“词元的直接概率,替代任意标量奖励头。验证过程成为原生自回归文本生成,而非人工分类任务
→ 思维链验证机制 验证器在预测正确性前,先生成逐步显式批判分析,能捕获直接评分遗漏的隐性计算错误与幻觉信息
→ 推理时计算扩展 采样多个独立验证原理,通过多数投票平均预测“是“的概率,过滤单路径错误,在性能上超越基于提示的LLM判官
→ 从易到难的泛化能力 仅用小学数学数据训练的9B参数生成式验证器,成功在MATH500高中竞赛题上实现泛化,解决率从28.0%提升至44.6%
→ 假设验证与实证结果 谷歌DeepMind假设:带测试时计算扩展的生成式批判,性能显著优于判别式奖励建模。在复杂多步推理流程上的实践验证确认了这一发现:GSM8K任务准确率从73.0%飙升至93.4%,同时所需候选样本量减少2.5倍
将验证转化为生成式推理,使奖励建模成为自回归自我修正引擎
完整解析请阅读下文文章↓
相似文章
@rohanpaul_ai: Google DeepMind 的新论文。表明人工智能现在可以搜索形式化数学证明,但仅限于精心限制的范围内……
Google DeepMind 的新论文介绍了 AlphaProof Nexus,这是一个结合了 LLM 与 Lean 证明检查器的 AI 系统,用于在受限的数学领域中搜索形式化证明。该系统解决了来自 Erdős 和 OEIS 集合的几个未解问题,展示了一种新的分工:AI 提出候选证明,验证器确保正确性。
@omarsar0: 值得收藏的新AI论文。这是我早期预言的,这篇论文证实了:验证已经出现……
这篇来自斯坦福大学、英伟达和加州大学伯克利分校的论文介绍了LLM-as-a-Verifier,一种无需训练的验证框架,利用LLM logits的连续评分来提高编码、机器人和医疗领域的准确性,在多个基准上取得了最先进的结果。
@askalphaxiv: 由Yoshua Bengio指导的一篇精彩论文 "Generative Recursive Reasoning" 测试时计算不仅应…
论文《Generative Recursive Reasoning》提出了一种方法,通过并行采样多个潜在推理轨迹来扩展测试时计算,使模型能够探索多样化的假设并避免确定性坍缩。该方法在数独、ARC AGI、N皇后和图形着色等任务上提升了性能,还可以从头生成有效的数独棋盘和MNIST数字。
@gurtej__gill_: 来自斯坦福、伯克利和NVIDIA的这篇新论文感觉像是测试时计算拼图中至关重要的一块……
这篇来自斯坦福、伯克利和NVIDIA的论文提出了LLM-as-a-Verifier,一个利用token logits进行连续评分的通用验证框架。它在包括Terminal-Bench V2(86.5%)和SWE-Bench Verified(78.2%)在内的多个基准上达到了SOTA,并提供了可以加速强化学习训练的细粒度信号。
@rohanpaul_ai:Google 的 ScientistOne 论文解决了 AI 生成研究的一个基本问题:结果可能看起来可信,即使……
Google Cloud AI Research 的 ScientistOne 论文通过引入 Chain-of-Evidence 来解决 AI 生成研究中的信任问题,该方法会在最终确定稿件之前,对照源工件验证引用、数值声明和方法描述。