携带证明的认知:通过现实结算奖励弥合验证差距
摘要
本文将验证差距确定为AI推理进步的关键约束,对验证器可靠性权衡进行了理论和实证分析,并引入携带证明的认知以增强强化学习中的奖励结算。
arXiv:2609.09776v1 Announce Type: new
摘要:语言模型推理的前沿进展来自对推理轨迹的强化学习,并集中于具有廉价、可靠验证器的领域。我们认为该领域的关键约束是验证差距:在形式化领域之外,缺乏可扩展、不可腐蚀的推理奖励。我们做出四项贡献。(1) 理论:在最佳N选择的联合高斯模型中,验证器与真实值的相关性ρ是测试时计算与能力之间的精确交换率,不可靠的验证器会带来多项式惩罚 N^(1/ρ^2);无边际copula形式将真实LLM评判的已实现可靠性预测至中位数误差4%。(2) 实证:在具有可执行真实值的程序合成测试平台上,包括预先注册的规模化复制实验,不可靠的验证器在优化增长时失去压力下的可靠性(在N=4096时从0.94降至0.32),而可靠的验证器则单调提升;现实锚定的结算在独立同分布和对抗压力下优于冻结的验证器,将篡改差距从~0.27降至~0;可靠性随结算标签对数线性扩展,按策略结算比随机标记效率高约10倍。使用真实LLM评判器和单元测试执行作为金标准,弱评判器在最佳N选择下失去可靠性(p<0.001),较强评判器更稳健,且仅选择就会从诚实样本中制造+0.53的篡改差距。在真实GRPO训练中,冻结的奖励模型追踪完整的过度优化曲线(执行奖励崩溃90%),而同一模型在10%结算流上重新拟合可保留6倍的执行奖励。(3) 范式:携带证明的认知,其中推理步骤是类型化的概率声明,由仅基于保留现实数据训练的自建世界模型定价,并通过适当评分规则结算。(4) 基准:我们指定压力下的可靠性作为现实结算推理基准的主要指标。
查看缓存全文
缓存时间: 2026/09/11 08:40
# 携证认知:用现实锚定奖励弥合验证鸿沟 来源:https://arxiv.org/html/2609.09776 **Eshwar Reddy** MAI工程师,Testsigma大学 | 圣地亚哥大学 [email protected] **Sourav Karmakar** 高级AI科学家,Intuit India [email protected] ###### 摘要 近期大语言模型的前沿进展主要源于基于推理链的强化学习——且高度集中于具备廉价、可靠验证器的领域。我们因此认为,该领域的核心制约因素是*验证鸿沟*:缺乏可扩展、不可篡改的推理奖励源(超出狭窄形式化领域)。本文做出四项贡献: (1) 理论:在最优N选择的联合高斯模型中,我们证明验证器与金标准的相关性ρ是测试时计算与能力之间的精确换算率,且不可靠验证器需支付多项式计算惩罚N^{1/ρ²}才能匹配可靠验证器。 (2) 验证:在可执行金标准程序合成测试平台(最小六词领域及预注册的约10¹⁰程序规模扩展复现,任务量增加2-4倍且工具更强)中,我们发现:不可靠验证器在优化压力下会丧失"抗压可靠性"(在N=4096时浅层验证器从0.94降至0.32),在最小领域完全崩溃而在丰富领域趋于平台期;而可靠验证器则单调提升。现实锚定解决机制在独立同分布及定向对抗压力下(包括针对解决过程的显式建模攻击者)均优于静态验证器,将破解差距从约0.27降至约0;可靠性随已解决标签对数线性扩展,策略内解决机制比随机标注效率高约10倍,且显著优于不确定性采样控制组;解决机制提升主张*清晰度*而非仅改善校准度。复现研究证伪了两项量化主张:在高斯模型外换算率ρ不具定量预测性,闭式解N^{1/ρ²}在实际N值处高估惩罚(命题1的精确有限N形式可将预算匹配误差控制在3.4%内)。 (2b) 真实模型证据:在预注册的真实前沿生成器、真实LLM裁判及真实单元测试金标准实验中,弱裁判在最优N选择下丧失可靠性(在MBPP与HumanEval上p<10⁻³);强裁判显著更稳健——验证鸿沟的约束性取决于裁判能力与任务难度的相对关系。基于执行结果锚定的解决模型将裁判定价误差降低59%,而朴素上下文锚定反而恶化;LLM对抗性提示未能成功误导裁判——但挖掘相同候选库表明仅选择机制就能从诚实样本制造+0.53的破解差距:有效的古德哈特压力源于选择而非说服。 对每项失败的预注册诊断产生改进的无换算率误差定律(Copula形式将真实LLM裁判的实现可靠性预测误差中值控制在4%),以及该范式的设计约束:平均校准锚定在理论上无法提升可靠性且实践中放大尾部欺骗——世界模型需匹配欺骗面的表达能力。 (3) 范式:我们提出*携证认知*训练循环,其中推理步骤作为类型化概率主张发出,由自建世界模型定价(其唯一损失是现实预测),并通过严格适当评分规则解决——使现实而非人类判断成为最终奖励函数。 (4) 基准:我们定义"抗压可靠性"这一现实锚定推理基准的核心指标,论证构建此基准是该领域短期最重要的单一行动。 (2c) 在真实GRPO训练中,静态已学习奖励模型描绘了完整的过优化曲线——代理奖励上升而执行奖励崩溃90%——而相同奖励模型在10%解决流上重新拟合后,可将执行奖励保持在静态组的6倍,并优于等预算的LLM裁判更新控制组,实证了现实作为标签源的有效性;注册的漂移警报标准首次测试失败,如实报告。 ## 1 引言 现代机器学习的两大发明:反向传播解决了参数信用分配问题(Rumelhart等人,1986),以及Transformer解决了上下文带宽问题(Vaswani等人,2017)。我们认为下一个具有同等重要性的发明必须解决*思想信用分配*:可扩展且不可篡改地判定推理步骤是否正确。此论点源于经验观察:前沿能力提升目前主要来自基于思维链的强化学习(Wei等人,2022;OpenAI,2024;Guo等人,2025),且这些提升高度集中于具有廉价可靠验证器的领域——可验证答案的数学(Hendrycks等人,2021)、可执行测试的代码(Chen等人,2021)以及基于内核的形式证明(Trinh等人,2024;AlphaProof与AlphaGeometry团队,Google DeepMind,2024)。其核心机制——采样多个推理链,保留验证器接受的路径,进行强化(Zelikman等人,2022)——构成以验证器覆盖率为节流阀的自我改进引擎。在验证器可靠的领域,数月训练已产出超人类表现;在仅有奖励模型或LLM裁判作为人类偏好标签的领域(Christiano等人,2017;Ouyang等人,2022),相同模型停滞于流畅但难以问责的推理,因为偏好奖励存在噪声、可操纵性且比评估的推理更浅薄(Gao等人,2023)。 本文将此约束命名为*验证鸿沟*,并从四个方向攻克: - •理论(§3):我们证明在最优N选择中,验证器与金标准的相关性ρ是计算与能力的换算率,不可靠验证器需支付N^{1/ρ²}的多项式候选惩罚(命题1,推论1);模拟结果与理论差异在0.011σ内(图1)。 - •验证(§6-§7):在可执行金标准验证器的程序合成测试平台中:已学习验证器在最优N压力下发生古德哈特效应(相对可靠性0.94→0.32;最小领域完全崩溃)而可靠验证器单调提升;现实锚定解决机制在定向对抗压力下(包括针对解决过程的攻击者)优于静态验证器,将破解差距驱动至约0;验证器可靠性随已解决标签对数线性扩展,策略内解决比随机标注效率高约10倍;解决机制提升主张*清晰度*,反驳了解决机制奖励模糊主张的担忧。§7报告预注册扩展复现,包括证伪内容。 - •范式(§5):我们提出*携证认知*(算法1):将推理构建为可证伪、可定价主张的组合,以现实作为唯一未摊销损失。 - •基准(§9):我们定义形式化指标"抗压可靠性",并提供现实锚定推理基准的构建方法。 说明:本文是立场与概念验证的混合论文。§3-§6的实验真实可复现但特意保持最小化,旨在验证机制而非主张前沿规模。 ## 2 瓶颈:生成已扩展,验证未跟进 ### 2.1 验证鸿沟 定义领域D的*验证器*为满足以下条件的预言机V:claims(D)→[0,1]:(a)*可靠性*——其接受反映地面真值;(b)*低成本*——评估V的成本远低于生成候选;(c)*优化下鲁棒性*——对抗性训练的生成器无法系统地从V获得虚假主张的奖励。验证鸿沟指当今仅存在形式化基础领域(证明内核、程序执行、游戏规则)的此类预言机,其他领域使用的替代方案(人类标注、奖励模型、LLM裁判)在足够优化压力下均无法满足(c)。Gao等人(2023)直接量化该失败:针对固定奖励模型优化产生代理奖励上升而金标准奖励达峰后下降——古德哈特定律作为硬天花板生效(Strathern, 1997)。模型无法超越其裁判的判别能力(Leike等人,2018;Bowman等人,2022)。 图1:模拟(点;每点20,000次试验)与理论(线;ρE[max_N])在最优N选择下代理验证器相关性ρ的对比。所有点理论偏差最大绝对值:0.011σ。在N=4096时,ρ=0.5验证器实现可靠验证器收益的50.2%,与命题1精确匹配。 ### 2.2 其他瓶颈归结于此 **数据墙**:高质量人类文本有限,但自生成数据无界——*如果*其可信。AlphaGo Zero(Silver等人,2017)证明完美验证器(游戏规则)下仅通过自我对弈即可超越人类。AlphaProof(AlphaProof与AlphaGeometry团队,Google DeepMind,2024)将其扩展至数学,基于Lean内核裁决数百万自动形式化问题达到IMO银牌水平。数据墙非文本短缺,而是合成推理可信赖奖励的短缺。 **不可靠代理**:长程自主因错误累积且缺乏中间步骤检查机制而失效。可靠的步骤级验证器将开环生成转化为闭环可审计行动。 **开放领域超人类推理**:在科学、策略、法律和医学中,人类已无法可靠评分超人类作业;可扩展监督(Amodei等人,2016;Bowman等人,2022)正是验证需求超越验证器自主能力的体现。 ## 3 理论:验证器相关性是计算–能力换算率 我们在最简模型中量化不可靠性的成本。最优N选择——采样N个候选并保留验证器评分最高者——是测试时计算转化为能力的规范机制(Cobbe等人,2021;Snell等人,2024),其诱导优化压力随log N增长。 ###### 命题1(验证器换算率) 设{(G_i, P_i)}_{i=1}^N为独立同分布联合高斯对(标准化),其中Corr(G,P)=ρ,G为金标准奖励,P为代理验证器得分。令i*=argmax_i P_i,则 E[G_{i*}] = ρ·E[max_i P_i] = ρ√(2ln N)(1+o(1))。 **证明**:将G_i分解为ρP_i + √(1-ρ²)Z_i,其中Z_i为标准高斯且与(P_1,...,P_N)独立。i*仅是(P_1,...,P_N)的函数;条件于这些变量,Z_{i*}保持标准高斯,故E[Z_{i*}]=0,E[G_{i*}]=ρE[P_{i*}]=ρE[max_i P_i]。渐近式E[max_i P_i] ∼ √(2ln N)是高斯极值理论标准结果。∎ ###### 推论1(不可靠性的多项式计算惩罚) 为匹配可靠验证器(ρ=1)使用N个候选获得的期望金标准奖励,相关性为ρ的代理验证器需要 N' = N^{1/ρ²}(渐近式)。 **证明**:令ρ√(2ln N') = √(2ln N),解得ln N' = ln N/ρ²。∎ 两种解读:首先,*在该模型类内,验证器相关性是测试时计算与能力的换算率*:每单位推理计算价值恰好为可靠验证器值的ρ倍(图1及§7的十万次复现证实误差在0.011σ与0.007σ内)。在模型类外,该等式*双向均不具定量预测性*:在§7的合成测试平台中,ρ≈0.50的验证器在N=4096时仅实现可靠验证器价值的≈0.32(存在超越高斯噪声的可利用结构),而真实LLM裁判(§8)线性相关性近乎零(ρ≈0.12)却在N=32时实现0.74(排名靠前尽管线性拟合差)。仅定性排序——更高保真度的裁判能更好转化压力为能力——在所有测试平台成立。修复方案(§8.1)以选择实际观测的不变量陈述该定律: ###### 员题2(无换算率误差定律) 设{(G_i, P_i)}_{i=1}^N为具有连续边缘及高斯Copula参数ρ_c的独立同分布对,i*=argmax_i P_i。则G_{i*}的分布——进而Snd@N——仅取决于ρ_c与G的边缘分布;P的边缘分布无关。 **证明**:i*在严格单
相似文章
验证前沿:编码智能体奖励并无银弹
本文探讨了验证AI编码智能体输出的挑战,认为随着模型改进,验证正变得比生成更困难。它分析了四种奖励构建方式,并表明随着模型能力的增长,没有固定奖励函数能保持有效。
AgentV-RL:用智能体验证器扩展奖励建模
AgentV-RL引入了智能体验证器框架,通过具有工具增强的前向和后向智能体进行双向验证来增强奖励建模,相比最先进的ORM实现了25.2%的性能提升。该方法通过将多轮深思熟虑过程与强化学习相结合,解决了验证器在复杂推理任务中的误差传播和基础性不足等问题。
验证器瓶颈
一篇概念性文章,认为人工智能中的递归自我改进受限于验证而非计算,并使用了认识论封闭的提示矩阵和数据加工不等式的隐喻。
超越可验证的RL(8分钟阅读)
本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。
闭环:形式化验证的法律作为自我改进法律AI的奖励信号
本文提出了一种架构,该架构使用形式化验证的法律作为训练法律AI的奖励信号,自适应地将法律规则自动形式化为形式化演算,并采用验证器确保可证明的正确性,在德国和美国法律示例上进行了演示。