2026年4月14日 | 对齐研究 | 自动化对齐研究者:利用大语言模型扩展可扩展监督

Anthropic Research 论文

摘要

Anthropic 研究人员证明,Claude Opus 4.6 能够自主担任对齐研究者,以改进弱监督强技术,从而应对可扩展监督中的挑战。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/05/08 09:22

# 自动化对齐研究者:利用大语言模型扩展可扩展监督 来源:https://www.anthropic.com/research/automated-alignment-researchers 大语言模型日益加速的进步速度为对齐研究提出了两个尤为重要的问题。 第一个问题是对齐研究如何跟上这一步伐。前沿AI模型现在正在参与其后续模型的开发。但它们能否为*对齐*研究者提供同样的提升?我们的语言模型能否用于帮助对齐自身? 第二个问题是一旦模型变得比我们更聪明,我们该怎么办。对齐超越人类的AI模型是一个被称为"可扩展监督"(scalable oversight)的研究领域。可扩展监督此前主要被讨论于理论层面(https://arxiv.org/pdf/2211.03540),而非实践层面——但按照AI当前的进步速度(https://www.anthropic.com/glasswing),这种情况可能不会再持续太久。例如,模型已经在生成大量代码。如果它们的能力进步到能够生成数百万行极其复杂的代码,而我们自己无法逐一审阅,那么要判断它们是否按照我们的意图行事就可能变得(https://arxiv.org/pdf/2312.09390)非常困难。 在一项新的Anthropic Fellows研究中,我们同时探讨了这两个问题。 我们的新研究聚焦于一个被称为"弱到强监督"(weak-to-strong supervision)的问题,这个问题与监督超越人类的AI模型相呼应。我们从一个相对较强的"基础"模型开始——也就是说,一个具有潜在能力但尚未经过微调以提供其最佳答案的模型。然后,我们使用一个*弱得多*的模型作为"教师"来提供额外的微调,该教师通过向强基础模型展示*它*认为理想的输出。最后,我们评估强模型在经过这种弱微调后的表现。 在最坏的情况下,强模型只会和它的弱教师一样好。然而,理想情况下,强模型会从弱教师的反馈中学习——它将以一种有用的方式解读这些弱信号,利用这些反馈来提升自身表现。我们可以量化它的表现:如果强模型完全没有改善(即它的表现仅与弱教师相当),我们评分为0;如果它利用教师的反馈达到了理想结果——即强模型可能达到的最佳表现——我们评分为1。这一指标代表了"性能差距恢复"(performance gap recovered,简称PGR),即在弱模型与强模型上限之间的差距中恢复了多少。 作为可扩展监督的替代方案,弱模型代表人类,而强模型代表我们未来可能需要监督的远超人类的模型。如果我们能在弱到强监督方面取得进展,我们可能会发现这些方法有助于让那些超智能模型与我们的价值观保持一致。 我们的新研究测试了Claude能否*自主*发现提升PGR的方法。我们问:Claude能否自行开发、测试和分析对齐方面的想法?如果它能,这对当今AI模型能在多大程度上加速对齐研究意味着什么? ## 我们的设置 为了找到答案,我们从九个Claude Opus 4.6副本开始,并为每个副本提供了一些额外的工具。每个Claude都有一个工作和思考的地方(即沙盒)、一个与其他副本分享发现的共享论坛、一个上传代码的存储系统,以及一个远程服务器,在那里它可以为每个想法获得PGR评分。我们还提供了一些关于模型训练和推理的背景知识。我们将这些配备了工具的Claude模型称为自动化对齐研究者(Automated Alignment Researchers,简称AARs)。 为了防止每个AAR追求几乎相同的想法,我们为每个AAR设定了一个略有不同(但故意模糊)的起点:我们建议一个使用一些可解释性工具,另一个考虑对数据集中的数据进行重新加权,等等。¹除此之外,我们没有告诉AARs该做什么。它们需要自己提出想法、运行实验、分析结果,并相互分享发现和代码,以确定下一步尝试什么。 ## 结果 为了为AARs的结果提供基准,我们将它们的工作与人类基线进行了比较。我们的两位研究人员花了七天时间,对先前研究中最有前景的四种泛化方法进行了迭代。在我们测试的开源模型上(Qwen 3-4B-Base作为强模型,Qwen 1.5-0.5B-Chat作为弱教师),人类恢复了总性能差距的23%(即达到了0.23的PGR)。² Claude大幅改进了这一结果。在额外的五天(以及800个累积研究小时)后,AARs几乎弥合了剩余的全部性能差距,最终PGR达到了0.97。这花费了约18,000美元的token和模型训练费用,即每个AAR小时22美元。您可以在下图中看到每个AAR从人类基线(在0小时处)开始的进展。 *图表显示我们的自动化对齐研究者在提升聊天数据集上"性能差距恢复"方面的进展。红线代表九个并行运行的自动化对齐研究者在累积研究小时上的性能差距恢复,灰色方块代表人类调优基线。1.0分意味着该方法完全匹配基于真实标签训练的模型。* 因此,Claude表现异常出色。但它的方法有多新颖,它们能否应用于实际场景?为了找出答案,我们进行了两项进一步测试。 首先,我们测试了AARs的想法能否在*留出*数据集上恢复性能差距——即在AARs尚未见过的任务上。我们选取了AARs表现最好的两种方法(在聊天任务数据集上)并将它们应用于数学和编码任务。在这里,我们的结果相对有希望:AARs最有效的方法成功泛化到了两个新数据集,数学上的PGR为0.94,编码上为0.47(这仍然是人类基线的两倍)。AARs第二好的方法结果参差不齐:它在数学上有效(0.75),但在编码上无效,甚至使情况更糟。这些结果表明,AARs的研究*某些*泛化是可能的,但这并非必然。我们鼓励其他尝试自动化研究的人也针对留出数据集对AARs的想法进行压力测试。 *图表显示AAR发现的想法在多大程度上迁移到数学和编码的留出数据集。红色和蓝色代表两个AAR发现的想法在这些数据集上的性能差距恢复。虚线表示我们用作基线的最佳人类调优方法。* 接下来,我们测试了AARs的想法是否能在生产规模上工作。我们在Claude Sonnet 4上尝试了AARs最有效的方法,使用我们的生产训练基础设施。然而,在这里我们不太成功。AARs的方法没有带来统计学上显著的改进。我们认为这可能反映了这次早期试验的局限性,而非更根本的问题:我们的评分方法相当简单,而且我们只评估了一个想法。尽管如此,这确实说明了AARs的一个局限性(至少在当前能力下):AARs倾向于利用给定模型和数据集特有的机会,这意味着它们的方法可能在其他地方无效。为了缓解这一点,我们建议允许AARs在研究过程中针对多个领域和数据集进行测试。这是未来AARs实验可以探索的一个领域。 实验的几个迭代让我们更多地了解了如何让AARs最有效。例如,我们发现给每个AAR不同的起点帮助很大,即使那个起点很模糊。当我们尝试*不*让AARs朝不同方向出发时,它们都很快集中在类似的想法上,整体进展少得多(尽管它们仍然达到了几乎三倍于人类基线的PGR)。另一方面,我们发现给AARs*太多*结构会严重损害它们的进展。当我们规定了特定的工作流程("提出想法,然后生成计划,然后编写代码……")时,我们发现这最终限制了Claude的工作。让它自主发挥时,Claude的适应性要强得多,设计廉价实验来测试想法,然后再投入更密集的测试。 ## 启示 我们的AARs在两个开源模型之间恢复性能差距的成功,当然*不是*前沿AI模型现在已成为通用对齐科学家的标志。我们故意选择了一个特别适合自动化的问题,因为它有一个单一的、客观的成功衡量标准,模型可以据此优化。大多数对齐问题远没有这么简洁。而且,正如我们在下面提到的,即使在这种设定下,我们的AARs也尽其所能地"钻空子":人类监督仍然必不可少。 但我们确实认为这些结果有一些重要的启示。 **跟上步伐。** 这项研究表明,Claude可以有意义地提升对齐研究中实验和探索的速度。人类研究者可以大规模地将问题委托给AARs;Claude可以承担开发新假设和迭代自身结果的任务。 此外,在弱到强监督方面取得进展本身*可能*帮助我们构建更通用的自动化对齐研究者,这也是我们为这个研究选择这个问题的原因。在这项研究中,我们将弱到强监督问题框定为一种"清晰"的任务,具有可验证的结果(提高PGR分数)。我们这样做是因为我们需要一种自动且可靠的方法来评估AAR是否取得了进展。然而,如果AARs发现了在多个领域泛化的更好弱到强监督方法,我们可以使用这些相同方法来训练AARs评估"更模糊"的任务上的进展,这些任务更难验证。(例如,我们可以对Claude规划研究项目的能力进行弱到强监督。)这很重要,因为对齐研究——与能力研究不同——经常需要解决"更模糊"的问题。 **品味与多样性。** 对AARs这类工具的一个可能反驳是,当今的前沿模型仍然缺乏"研究品味"(行业术语,指对哪些想法可能有效、哪些不会有的直觉)。但AARs在这次实验中的成功表明,想法的数量之多可能弥补"品味"的不足。如果AARs能以非常低廉的成本运行大量实验,它们有可能通过"蛮力"找到高品味研究者可能得出的发现,或者在这些研究者可能放弃的方向上取得成功。 反过来,这意味着对齐研究的核心瓶颈可能变成*评估*(确保实验设置得足够好,让我们对结果有信心),而非*生成*(依赖人类研究者提出有前景的想法)。 **异类科学。** 这项工作可能还有一些更奇怪的启示。AARs就其性质而言,旨在发现人类可能未曾考虑到的想法。但我们仍然需要一种方法来验证它们的想法和结果是否可靠。目前,我们仍能理解AARs做了什么以及为什么这样做。但情况可能并非总是如此:随着时间的推移,模型的想法可能变得更难验证,或以人类难以解析或发现的方式被"污染"。这可能意味着创造一种"异类科学"。 **防止钻空子。** 即使在这种高度受限的环境中,我们也观察到模型"奖励(https://www.anthropic.com/research/emergent-misalignment-reward-hacking)黑客(https://www.anthropic.com/research/reward-tampering)"——即试图对我们的设置钻空子。例如,在数学任务上,一个AAR注意到每个问题最常见的答案*通常*是正确的,所以它完全跳过了教师,指示强模型总是选择最常见的那个。在一个编码任务中,模型需要预测一段代码是否正确,该AAR发现它可以针对一些测试运行代码,然后直接读出正确答案。这类钻空子行为并不使我们的结果无效(我们检测并取消了这些条目),但它们确实提供了警示。任何自动化研究者的部署都需要AAR无法篡改的评估——以及对它们结果和方法的人工检查。 要阅读完整的研究,请参见我们的Alignment Science博客(https://alignment.anthropic.com/2026/automated-w2s-researcher/)。这项工作的代码和数据集已公开可用,见此处(https://github.com/safety-research/automated-w2s-research)。 ## 相关内容 ### 自然语言自编码器:将Claude的思维转化为文本 像Claude这样的AI模型用词语交流,但用数字思考。在这项研究中,我们训练Claude将其想法翻译成人类可读的文本。 阅读更多(https://www.anthropic.com/research/natural-language-autoencoders) ### 捐赠我们的开源对齐工具 阅读更多(https://www.anthropic.com/research/donating-open-source-petri) ### Anthropic研究院的重点领域 在Anthropic研究院(TAI),我们将利用从前沿实验室内部可获取的信息来调查AI对世界的影响,并与公众分享我们的发现。在这里,我们分享驱动我们研究议程的问题。 阅读更多(https://www.anthropic.com/research/anthropic-institute-agenda)

相似文章

我们的对齐研究方法

OpenAI Blog

OpenAI 阐述了他们的对齐研究方法,强调了强化学习从人类反馈 (RLHF) 作为他们用于对齐已部署语言模型(如 InstructGPT)的主要技术。他们讨论了以最少计算量实现相比大 100 倍模型的显著偏好,但承认当前的局限性,并提出了一项长期战略,即利用 AI 系统来加速人类无法单独实现的对齐研究。

对齐(Alignment)

Anthropic Research

本文概述了Anthropic对齐团队的使命与研究重点,该团队通过评估、监督和压力测试等手段开发保障措施,以确保未来的AI系统始终保持有益、诚实和无害。