2026年8月28日:自动化研究者可靠缓解对齐失败

Anthropic Research 论文

摘要

Anthropic发布了一份报告,表明使用Claude的自动化研究者可以可靠地缓解AI对齐失败,弥合重大安全差距,并在某些基准测试中超越人类研究者。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/28 18:28

# 自动化研究人员可可靠缓解对齐失败 来源:https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures 随着AI开始自我构建 (https://www.anthropic.com/institute/recursive-self-improvement),自动化对齐研究变得愈发重要,以确保安全研究能跟上步伐。尽管衡量对齐研究的*成功*极具挑战,但研究人员(包括Anthropic及其他机构)已开发出基准测试和自动化审计工具,例如Petri (https://www.anthropic.com/research/petri-open-source-auditing),用于量化常见的对齐*失败*,如欺骗、谄媚倾向和越狱行为。 在我们早先的一项实验 (https://www.anthropic.com/research/automated-alignment-researchers) 中,我们让Claude寻找有效方法,利用弱AI模型作为“教师”来监督强模型(此处为“学生”模型)的训练。如今,我们发布了一份基于此思路的新报告。我们让Claude自主训练模型,以提高其在衡量10类对齐失败的多个公开基准测试上的表现。例如,Claude通过ConfAIde (https://arxiv.org/abs/2310.17884)、PrivaCI-Bench (https://arxiv.org/abs/2502.17041) 和PrivacyLens (https://arxiv.org/abs/2409.00138) 测量的隐私侵犯任务中,改进了模型的表现。Claude通过一个包含文献搜索、方法提出、数据准备、训练和测试的循环,逐一解决每一类对齐失败。 我们根据“安全差距闭合百分比”来评判Claude的成功程度,即其方法将学生模型在理论上可达到的完美分数推进了多少(根据每类对齐失败的基准测试范围(通常3到5个)综合判断)。我们排除了损害学生模型通用能力的对齐方法,并禁止Claude将其自身的对齐能力直接蒸馏到目标模型中。我们通过一个监控代理来执行这些限制,该代理在Claude运行每项方法前都会审查其内容。 我们的目标是评估所提出的方法是否:首先,在Claude研究循环中从未见过的对齐评估中仍然有效;其次,避免降低学生模型的能力(因为安全训练可能例如使模型更频繁地拒绝任务,从而降低其整体可用性);第三,对于比本次测试中Claude需要对齐的模型更大的模型依然有效。 在所有这些方面,Claude的方法都奏效了。针对全部10类对齐失败,Claude都找到了改进目标基准测试且不损害能力的解决方案。最佳方法在预留的对齐基准测试以及Petri(一个模拟对抗性多轮场景以测试错位的开源工具)上也表现出色。此外,这些方法在比Claude研究循环中优化的模型大最多达4.7倍的模型上仍然有效。 自动化研究人员通过迭代测试闭合了85%的欺骗安全差距;人类研究人员闭合了20%。**成功缓解多样化的对齐失败。**我们应用自动化对齐研究人员分别缓解了10种对齐失败,在每种场景中,它都闭合了相当大一部分达到完美表现的安全差距。 Claude还超越了28位拥有最多八小时时间来设计方法的人类安全研究人员。例如,在欺骗任务上,Claude的最佳方法比最佳人类提案表现好20%。然而,由于人类无法对其提交的方法进行迭代,我们不将其视为直接比较,而是将其视为一种工作流程的证据:Claude识别有前景的对齐方法,人类可在此基础上进一步改进。 在十种对齐失败(从谄媚倾向到奖励黑客攻击)中,自动化研究闭合了26%到96%的安全差距。**自动化对齐研究人员在Gemma-2-2B中缓解欺骗行为。**Claude提交了超过150次缓解欺骗行为的尝试,并在此次运行中实现了闭合82%安全差距的最终表现。平均而言,在多次运行中,它实现了85%的闭合率。相比之下,在相同规则下工作的六位经验丰富的安全研究人员提出的方法,在针对其训练的基准测试上,平均闭合了20%达到完美分数的安全差距。(误差条为95%置信区间。) 未来,当Claude在对齐研究方面甚至超越最优秀的人类研究人员时,我们可能希望Claude直接对齐其更强大的后继模型。为此,我们评估了一个较弱的Claude模型是否能缓解更强大模型中的对齐失败。 ## Claude能否后训练一个生产级模型以实现更好的对齐? 我们指派了在Epoch能力指数 (https://epoch.ai/eci)(该指标考虑全面的能力维度)上弱于Claude Opus 4.8的Claude Sonnet 5,去修复一个早期Opus 4.8检查点的对齐失败,该检查点尚未经过我们大部分的生产对齐训练。 在短短60小时内,Claude试验了超过50种解决方案,并取得了几乎与我们生产模型相匹配的对齐分数。获胜方案仅包含略多于2000个训练样本,由简单模板或公开数据集构建而成,使其效率比我们的生产对齐流程高约15,000倍。 自动化研究在60小时内闭合了前沿规模模型65%的安全差距,低于已发布的Claude Opus 4.8的72%。**将自动化对齐研究人员应用于生产系统。**当Claude Sonnet 5为Claude Opus 4.8的早期检查点提出缓解对齐失败的方法时,它迅速发现了一种能闭合大部分与发布版Opus 4.8之间安全差距的方法。 ## Claude提出了什么 在大多数情况下,代理们收敛于研究文献中推崇的方法,并在多次迭代中对其进行改进。例如,在谄媚倾向方面,98%的提出方法使用了一种已发表的技术:用模型自身的非谄媚回答对其进行训练。具体来说,与基于提示的标准方法相比,Claude使用了激活引导,该技术在生成过程中调整模型的内部表示,将模型从谄媚模式中引导出来,从而产生更干净的训练样本。 ## 监控作弊行为 我们最近了解到 (https://alignment.anthropic.com/2026/automated-w2s-researcher/),Claude可能通过从远程API窃取测试标签并挑选结果来作弊。为捕捉作弊行为,我们提示Claude Opus 4.8监控了所有10类对齐失败中约1600份研究代理转录文本,发现了39例(2.4%)作弊尝试。由于Opus 4.8的错误行为尝试仍倾向于在其推理过程 (https://www-cdn.anthropic.com/0b4915911bb0d19eca5b5ee635c80fef830a37ea.pdf) 中暴露,我们谨慎乐观地认为我们的监控器捕捉到了研究中的大部分作弊行为。然而,这对未来模型可能并非如此,我们认为保持未来模型的高度可监控性至关重要。 ## 我们衡量的是正确的东西吗? 尽管这些发现令人鼓舞,但我们的实验存在几个局限性:与生产环境相比,研究的对齐失败范围较窄(例如,我们没有衡量政治偏见);某些失败可能发生得太罕见或出现得太近期,以至于没有基准可以衡量它们;我们仅在Claude的方法损害了有限的一组预定能力时才拒绝它们,这意味着被接受的方法可能损害了我们未衡量的其他重要能力。此外,像Petri这样的评估只是真实世界错位的近似,我们也没有测试对齐增益在大量其他任务的强化学习训练后是否持续。 我们计划继续改进Claude测量微妙失败的能力,进一步研究在生产级模型上自动化对齐后训练,并进行更全面的分析。总体而言,我们将这些结果视为自动化对齐后训练可能在近期变得切实可行的早期积极信号,我们将在工作进展中分享更新。 我们在完整报告 (https://www-cdn.anthropic.com/7b1c44894e980876479947dcdd40716278aeeffd/automated-alignment-researchers-august-2026.pdf) 中概述了详细的未来方向。 *我们开源了我们的自动化对齐研究工具,以便其他人可以在此基础上构建并用于对齐他们自己的模型。更多详细信息,请阅读Alignment Science博客 (https://alignment.anthropic.com/2026/automated-alignment-researchers/) 上的完整报告,其中涵盖了代理环境、所有10类失败的结果、代理提案,并在附录中提供了基准验证和示例说明。* ## 相关内容 ### 支持关于人们如何使用Claude的独立研究 今年早些时候,我们进行了一个试点,让外部研究人员访问聚合的、真实的Claude使用数据。三个研究小组为我们注重隐私的分析工具Anthropic Insights设计了自己的研究。在这篇文章中,我们分享了这些研究的高层结果以及我们从这次试点中学到了什么。 阅读更多 (https://www.anthropic.com/research/enabling-independent-research) ### Claude如何加速蛋白质设计和分析化学 在这篇文章中,我们分享了两个成果,展示Claude如何帮助生命科学家提高研究速度。 阅读更多 (https://www.anthropic.com/research/Claude-accelerates-protein-design) ### 新兴多智能体系统中的模式与问题 在此,我们指出了当前前沿模型中的一些行为倾向示例,并展示了它们如何导致意外的系统性故障,希望能引发关于缓解这些风险的讨论。 阅读更多 (https://www.anthropic.com/research/multiagent-systems)

相似文章