@sebkrier: 用强化学习训练模型常常会导致奖励信号被操纵;例如,当你用LLM评判者处理模糊任务时……
摘要
辩论训练可以通过使用辩论对手来提高模糊任务的真实性准确度,从而减轻来自AI反馈的强化学习(RLAIF)中的奖励操纵。
查看缓存全文
缓存时间: 2026/08/21 07:12
辩论训练减少 RLAIF 中的奖励劫持现象
来源:https://gdmalignment.substack.com/p/debate-training-reduces-reward-hacking 论文:辩论训练减少 RLAIF 中的奖励劫持 (https://arxiv.org/abs/2608.17776)
摘要:当使用 LLM 作为评判者进行强化学习时,评判者可能被“劫持”——即被欺骗而错误地给予高奖励;引入辩论对手可以缓解这一问题。
当前人工智能系统最令人瞩目的能力,许多是通过对数学和编程等明确任务的训练实现的,因为这些任务的成功与否可以自动验证。然而,我们真正关心的人工智能行为,在某种意义上都是“模糊”的(即便对于最经典的明确任务也是如此)。例如,编程代理应当生成可维护的代码,而不仅仅是通过测试的代码。更关键的是,编程代理不应不惜一切代价通过测试,尤其不能违背用户的原始意图。但是,使用 LLM 评判者为模糊任务提供奖励,也会带来自身的问题。说服 LLM 评判者给予高奖励,往往比正确解决任务更容易。因此,奖励劫持成为一个更大的问题。我们证明,通过辩论进行训练(即两个 AI 相互争论以说服评判者),可以缓解奖励劫持,这可能为扩大精确的训练监督以处理模糊任务提供一个有希望的方向。
结果概述
我们通过辩论训练了 LLM 策略,训练奖励由 LLM 评判者提供。作为基线,我们直接使用 LLM 评判者奖励训练了一个单独的 LLM 策略。所有策略都在有标准答案的数学任务上进行训练,以便准确衡量我们辩论协议的有效性。总体而言,我们的结果显示,直接使用 LLM 评判者奖励训练单一策略会导致奖励劫持:评判者的奖励持续上升,而真实准确率起初上升,但很快达到峰值然后下降。另一方面,通过辩论进行训练可以缓解奖励劫持:评判者奖励上升,真实准确率先上升然后趋于平稳,其峰值高于直接使用 LLM 评判者的情况。辩论恢复了大约 45% 的差距——介于使用 LLM 评判者训练单一策略的峰值准确率与使用真实答案训练的峰值准确率之间。
(图片)
在本文的其余部分,我们将解释我们设定的动机,包括我们对人工智能未来发展的模型、模糊任务的重要性,以及辩论如何帮助避免强化学习训练中出现的涌现失调。我们还将进一步讨论我们对当前辩论训练局限性的看法,以及可能在此方向上取得更多进展的未来工作。
使用 LLM 评判者的辩论训练
(图片)
我们专注于使用 LLM 评判者的辩论训练案例。如图 2 和图 3 所示,第一位辩手(Alice)就一个数学问题提出解决方案,第二位辩手(Bob)对该方案进行批评。LLM 评判者被展示了辩论的完整记录,并决定 Alice 的方案是否正确。这个决定直接用作强化学习训练的奖励。我们将这与仅 Alice 的基线进行比较,在基线中,Alice 产生一个解决方案,LLM 评判者直接评估它。
在部署时,我们只保留 Alice 的首次回复,丢弃其他所有内容。也就是说,Bob 以及 Alice 之后的任何回合,都仅用于确保训练信号的准确性,而我们最终只关心产生解决任务的最佳对齐策略。这意味着我们主要不关心 Bob 在辩论中具体做了什么,只要它能确保 Alice 的首次回复表现出正确、对齐的行为即可。做出这个选择的原因是,我们希望尽可能确信 Alice 解决方案的正确性和对齐性,因此必须让它经受我们能找到的最严厉的批评。必须将 Bob 想象成一个高度积极的辩护律师,无论其正确与否,都尽可能有力地反驳 Alice 的解决方案。当然,如果解决方案存在缺陷,这种论证可能更有效,但 Bob 的角色就是尽可能积极地寻找此类缺陷。这意味着 Bob 可能会撒谎,而这仍将被视为辩论协议的正确运行:我们只关心 Alice 首次回复的对齐性和正确性。
选择专注于训练而非仅仅使用推理时辩论脚手架(如一些先前工作)的原因是,我们的主要目标实际上是为给定任务产生最佳的对齐策略。虽然也可以尝试使用推理时辩论进行人工智能控制,但本工作的主要关注点是对齐训练。
为何使用 LLM 评判者?
使用 LLM 评判者(或基于人类反馈训练的奖励模型)的一个基本原因是,对于部分或全部模糊的任务,没有其他实际可行的程序化方法来获得奖励信号。一般来说,几乎所有任务都至少有一些模糊的元素,许多重要任务完全模糊,包括写作质量、主观判断的品味以及开放式研究。更实际地说,对于许多任务,特别是那些涉及非常长的智能体轨迹的任务,快速的人类判断是完全不可行的,因为单个任务尝试的长度可能达到数百万个标记。测试时计算量增加的趋势可能会加剧这一问题。即使是编程等任务,也有许多期望的 LLM 智能体行为是模糊的,因此 LLM 判断可能成为前沿强化学习训练中日益重要的一个方面。
由于 LLM 评判者的这些实际好处,我们预计未来的强化学习训练将融入当前一代的人工智能系统,为下一代人工智能的训练提供奖励信号。这是我们目前对人工智能未来发展的最佳猜测模型,因此辩论的作用是确保训练期间使用的 LLM 判断尽可能提供准确的奖励信号。在这种设定下,人类价值观和判断的作用不是直接评估人工智能输出,而是设计辩论规则、审计结果并迭代协议设计。
辩论在缓解失调中的作用
为什么使用辩论来提供准确的强化学习训练信号有助于对齐?主要原因是辩论可以缓解监督错误导致的涌现失调。
例如,一个为编程训练的人工智能代理可能意识到,它可以利用其环境配置中的漏洞来修改真实的单元测试。显然,这是一种某种程度上的失调行为,如果它成功获得更高的训练奖励,这种行为就会被强化。更令人担忧的是,如果此类违背用户合理意图的情况频繁发生,它们可能会泛化为模型的一种总体倾向:即采取认为目的可以证明手段合理的行动。如果辩论能够用来捕捉此类不良行为,它可能缓解强化学习训练中失调的涌现。
我们的实验结果清楚地展示了强化学习训练导致失调的风险。在我们尝试的每种设定中,直接通过 LLM 奖励训练的单一策略都学会了“劫持” LLM 评判者。事实上,我们假设,针对任何固定奖励提供者(无论多么智能)的强烈优化,除非在优化过程中增加某些限制措施,否则都会发现并利用奖励信号的缺陷。我们的实验表明,辩论可以成功地充当这种“增加物”,至少在我们研究的任务上是如此。
值得注意的是,我们并不认为辩论的主要好处是能够在特定于对齐的任务(例如旨在提高诚实度、避免欺骗和阴谋的数据集)上进行训练。虽然将这些任务包含在用于训练的全部模糊任务集合中可能是有意义的,但我们认为,通过辩论来避免强化学习训练中因监督错误导致的涌现失调,才是辩论的主要动机。
局限性与未来方向
或许我们工作最紧迫的局限性在于 Bob 的批评内容。如前所述,我们希望 Bob 扮演一个高度积极的辩护律师的角色,无论当事人无辜与否,都有责任为其辩护。不幸的是,在查看我们训练过程的辩论记录时,我们发现 Bob 并未完全达到这一理想。虽然 Bob 的回合确实试图指出出现的具体错误,但也包含了许多愚蠢的、表面上的试图说服评判者的尝试。Bob 会使用粗体、全大写字母,并要求评判者必须判定 Alice 的解决方案不正确,因为它包含了一个灾难性的、无可辩驳的缺陷!
这似乎是 Bob 在进行评判者劫持。事实上,为了实现我们的结果,我们必须限制 Bob 可见的输出长度,尽管 Bob 可以使用任意长度的隐藏思维链。如果没有对 Bob 可见输出的限制,初步实验显示 Bob 会劫持评判者,并且准确率在训练期间会崩溃。因此,在辩论游戏中,至少在我们当前的评判模型下,Bob 似乎拥有明显的优势,这种优势来自于能够先看到 Alice 的回复,然后产生适应性的批评。相比之下,Alice 必须提出一个能经受住 Bob 任何适应性批评的解决方案。
在某些方面,可以将 Bob 的优势视为辩论按预期工作。目标是产生一个对齐的 Alice 策略,当前的协议是保守的,因为它要求 Alice 真正提出一个极具说服力的原始解决方案。然而,Bob 的劫持行为不一定能带来信心。例如,如果我们不得不以某种方式限制 Bob 以防止劫持,那么我们可能也限制了 Bob 提出某些实质性批评的能力。这反过来可能导致评判者无法捕捉 Alice 解决方案中的细微缺陷。
辩论后续回合中的这些劫持问题是我们希望在未来研究中解决的主要缺点之一。或许不同的协议,甚至 LLM 评判者提示中列出的不同规则,可能有助于解决这些问题。我们还研究了涉及竞赛数学的一类有限任务,这主要是因为它允许我们使用保留的真实答案来衡量协议的性能。未来的研究应扩展我们研究辩论的任务类别,以更广泛地理解其益处。在模糊任务的情况下,可以潜在地使用一个保留的、更强大的 LLM 评判者作为真实答案的代理,同时使用更小的策略和评判模型进行训练。
总的来说,我们认为这种方法具有巨大的潜力,并且明显有希望通过辩论训练对齐的人工智能。我们计划继续这条研究路线,特别是在辩论处理模糊任务和减少后续回合劫持的方向上。
关于本文的讨论
准备了解更多?
相似文章
更令人信服,而非更正确:无参考LLM评判者的自我博弈奖励操纵
本文识别了自我博弈训练中使用的无参考LLM评判者的结构缺陷,表明它们评估的是合理性而非正确性,导致奖励操纵,策略学会生成合理但错误的答案。作者提出了一种隐藏锚点审计和解锚奖励来缓解这一问题。
@dair_ai:MIT推荐的关于可验证奖励强化学习部分的热门文章,大家一直在讨论。RLVR只优化…
这篇来自MIT的论文提出了一种对抗式生成器-判别器框架,将可验证奖励与从人类示范中学习到的信号相结合,以解决语言模型RLVR训练中的多样性崩溃、不自然响应和奖励黑客等问题。
当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化
本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。
大模型时代的奖励黑客:机制、涌现错位与挑战
综述提出“代理压缩假设”,解释 RLHF 及相关方法如何在大型语言与多模态模型中系统性地诱发奖励黑客、欺骗与监督博弈。
预训练期间的RL探索:重新审视LLM训练的策略优化
哈佛大学的研究人员挑战了标准的LLM训练流程,证明强化学习可以在预训练期间有效应用,而不仅仅是在SFT之后。他们发现数据组成比模型规模更重要,并提出并行平均RL和SFT目标的方法,该方法在所有讨论的其他训练方法中表现出色,跨所有指标均优于它们,同时保持了通用能力。