超越可验证的RL(8分钟阅读)
摘要
本文分析讨论了使用可验证奖励的强化学习(RLVR)在数学和编程中的局限性,以及将强化学习扩展到主观或不可验证任务(如规划或科学发现)所面临的挑战。文章还探讨了RLHF和Constitutional AI等技术作为对齐的替代方案。
在可验证领域中,RL显然已经奏效。下一个重大突破将来自那些能够将同样成果推广到更难验证的问题上的方法。本文探讨了为何可验证性是一种限制、当前有效的技术,以及正在攻克这一问题的公司。
查看缓存全文
缓存时间: 2026/06/30 17:16
# 超越可验证的强化学习
来源:https://www.tanayj.com/p/rl-beyond-the-verifiable
*我是 Tanay Jaipuria,Wing (https://www.wing.vc/) 的合伙人。这是每周发布的一份关于科技行业商业的通讯。如果你想在收件箱中收到 Tanay 的通讯,请在此免费订阅:*
朋友们好,
在与 Dwarkesh (https://www.dwarkesh.com/p/dario-amodei-2) 的一次播客中,Anthropic 的 CEO Dario Amodei 表示,90% 确信十年内会有一个“数据中心里的天才国度”。当解释那缺失的 10% 时,他最大的不确定性归结为一点:那些无法验证的任务:
> *在编程领域,除了那不可消除的不确定性,我认为一到两年内我们就能实现。从端到端编程的能力来看,十年内我们绝对会达到那个水平。**但即使拉长时间尺度,我仍有一点根本性的不确定性,是关于无法验证的任务:规划火星任务;像 CRISPR 那样进行根本性的科学发现;写一部小说。这些任务很难验证。** *
这就是我们今天要讨论的内容。在这篇文章中,我会涉及:
- 为什么可验证性是制约因素
- 目前有效的技术方法
- 攻克这个问题的公司
过去一年取得进展的一大原因就是可验证奖励的强化学习(RLVR)。想法很简单:给模型一个答案可以检查或验证的问题,让它推理出解决方案,并对正确结果的尝试进行强化。
数学和代码是完美的适用领域,我们也看到了相应的进展。奖励是干净、廉价的,而且可以运行数百万次。从 SWE-bench 的进步中就能看出这种爬山式改进的真实效果。2025 年,OpenAI (https://arxiv.org/abs/2502.06807) 和 Google DeepMind (https://deepmind.google/blog/advanced-version-of-gemini-with-deep-think-officially-achieves-gold-medal-standard-at-the-international-mathematical-olympiad/) 都在国际数学奥林匹克竞赛中达到了金牌水平,在大多数优秀的本科生都难以触及的问题上分别获得了 42 分中的 35 分。
Jason Wei (https://www.jasonwei.net/blog/asymmetry-of-verification-and-verifiers-law)(当时在 OpenAI)将此总结为“验证者定律”:训练 AI 完成一项任务的难易程度大致与任务的可验证性成正比。任何可以快速、客观地检查的内容,都可以通过强化学习不断打磨直到生效。
关键在于,大多数有价值的工作不一定容易验证。一份好的备忘录或设计就没有测试套件,更不用说像建立企业这样需要长时间周期和来自真实世界反馈的事情了。

所以,在“无法验证的领域”中,整个游戏归结为一个问题:当你无法轻易检查答案时,奖励从何而来?
这个问题并不新鲜。RLHF 和 宪法 AI (https://arxiv.org/abs/2212.08073) 本质上都是对“没有检查器时该怎么办”的回答。
RLHF 在人类偏好(这两个答案哪个更好)上训练一个单独的奖励模型,然后优化模型以在这上面取得高分。宪法 AI(Anthropic 在每个 Claude 模型上使用)则用由书面原则指导的 AI 反馈取代了大部分人类反馈。
这些方法在对齐方面有效,但在主观领域并未产生 RLVR 在数学和代码中那样的能力飞跃,而且可以说它们优化的更多是参与度而非能力提升。那么,对于主观领域,我们还能通过其他方式获得验证器或奖励信号吗?
以下是一些不同的方法,用于尝试验证那些不一定容易验证的事物:

**评分细则作为奖励。** Scale AI 在 2025 年中发布了一篇相关论文 (https://arxiv.org/abs/2507.17746)。对于每个提示,他们生成一个特定于该实例的评分细则,即一份检查清单,列出好答案应该满足的条件,通常由人类专家锚定。一个 LLM 评判器根据检查清单对每次尝试进行评分,该分数成为奖励。

这种方法之所以有效,是因为它将验证一个难以验证的答案的问题分解为许多更小的“是/否”或基于评分的问题。不再问评判器“这个好吗?”并得到一个嘈杂的 1-10 分,而是问“它是否提到了 X,避免了 Y,处理了 Z?”,而每个子问题都接近于可检查。Scale 报告 (https://scale.com/blog/enterprise-rar) 在医疗基准 HealthBench 上,相对普通的评判器评分有高达 31% 的提升。后续工作如 OpenRubrics (https://arxiv.org/abs/2510.07743) 现在专注于大规模生成这些评分细则。这是许多在法律、医疗、金融等领域的数据提供商常用的方法。
**生成式奖励模型。** 这类似于“LLM 作为评判器”的方法。奖励模型不是输出一个黑箱数字,而是先进行推理,然后对答案进行评分。
**过程奖励模型。** 这种方法是对推理的每一步进行评分,而不仅仅是最终答案,对于更长周期和更难验证的任务来说更为关键。
共同点是,当你无法以编程方式创建一个检查器时,你可以通过创建一系列评分细则来比较最终输出或中间阶段,从而近似出一个检查器,并使用 LLM 或类似模型来根据这些细则进行评分。
有许多公司采取不同的方法,试图在这些更难验证的领域中启用强化学习:
超越可验证的强化学习的三种方法 (https://substackcdn.com/image/fetch/$s_!B73a!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F259f50f4-e296-4516-921e-a9ee54dae551_2400x1080.png)
**1. 向实验室出售验证器和数据。** 第一类公司正在这些领域构建程序化验证器和强化学习环境,并将其出售给实验室。通常的做法是让人类专家为任务编写评分细则,每一条细则都足够具体,可以以编程方式检查,从而将模糊的判断转化为可以大规模评分的内容。Mercor (https://mercor.com/), Surge, Micro1 等公司正在这样做,在医疗、法律和金融等领域采用基于评分细则的方法。Taste Labs (https://tastelabs.com/) 则明确针对更主观的领域,比如设计和“品味”,这些难以验证。他们明确指出 RLHF 为什么会停滞,因为平均每个人的偏好最终会变得毫无品味可言。
**2. 形式化领域。** 另一种方法是将有些模糊的领域转化为机器可以直接检查的内容,然后在该垂直领域销售最终的解决方案。这在数学中已经有效:用 Lean 等正式语言编写的证明可以自我检查,这就是为什么 DeepMind 的 AlphaProof 等系统可以在没有人工干预的情况下获得奖励。
Pramaana Labs (https://pramaanalabs.ai/) 正在将这个想法推广到更混乱、更高风险的工作中,使用形式化验证使税收、法律和医疗等受监管领域的答案变得可证明。每个你成功形式化的领域都会从“无法验证”的列表中移除。
**3. 拥有整个循环。** 另一类公司专注于答案难以验证但(并非通过计算机)可以验证的领域。你不能通过评分细则或证明来检查一种新材料或药物。你必须运行实验。因此,这些公司自己拥有完整的循环:AI 提出方案,物理实验室进行测试,结果成为奖励。
Periodic Labs (https://periodic.com/),由前 OpenAI 和 DeepMind 研究员创立,正在运行机器人实验室来发现新材料。Isomorphic Labs (https://www.isomorphiclabs.com/),DeepMind 的药物发现衍生公司,将其预测建立在湿实验室并最终基于临床现实。Lila Sciences (https://www.lila.ai/) 正在生命科学和材料科学领域构建自主实验室。这里的想法是,这些系统的验证发生在现实世界中,因此可能缓慢且昂贵,但通过拥有整个循环,你可以将奖励建立在物理现实之上。
强化学习在可验证领域显然正在发挥作用,但下一个重大飞跃将来自那些有助于将相同进展推广到经济中更难验证的领域的方法和公司。而当前的 RLVR 方法能泛化到何种程度,以及是否需要新的突破,是最大的悬而未决的问题之一。如果你正在这些领域构建,我很乐意交流!
按价值和可验证性划分的经济 (https://substackcdn.com/image/fetch/$s_!1q-p!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fdf699086-aeca-490f-a27d-9c09bb29a8a6_2480x1456.png)
相似文章
从RLVR到RLSVR:任务变换为开放式LLM自我改进引入自可验证奖励
本文提出RLSVR,一种任务变换范式,通过创建自可验证的代理环境,将基于可验证奖励的强化学习扩展到开放式LLM任务,并通过SpyRL多智能体自博弈框架实例化,在摘要生成、创意写作和数学推理上展示了性能提升。
@tanayj: https://x.com/tanayj/status/2072766211256119475
本文探讨了将强化学习应用于缺乏明确可验证性任务的挑战,引用了Dario Amodei关于实现“数据中心中的天才之国”的预测,并讨论了RLVR、RLHF、Constitutional AI以及Scale AI的基于规则的奖励等技术。
@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
从 RLVR 到 RLSVR(GitHub 仓库)
介绍 RLSVR,一种任务转换范式,通过自对弈游戏中的自验证奖励将 RLVR 扩展到开放式任务,并在 SpyRL 和 Vision-Zero 中实例化。它提升了 LLM 在摘要生成、创意写作和数学推理方面的表现。
RLVR中的奖励粒度:比较小语言模型数学推理中的过程奖励与结果奖励结构
本文系统比较了小语言模型在数学推理中用于可验证奖励强化学习(RLVR)的过程奖励与结果奖励结构。研究发现,仅过程监督相比仅结果监督显著提高了准确性和推理轨迹保真度,并分析了失败模式。