自动化研究人员能够可靠地缓解对齐失败
摘要
本文研究了自动化对齐研究人员缓解对齐失败(如欺骗和谄媚)的能力,表明他们能够超越人类研究人员,并在保持能力的同时泛化到更大的模型。
arXiv:2608.28945v1 公告类型:新
摘要:自动化对齐研究可能加速迈向对齐AI的进展,但这是否属实难以衡量。幸运的是,许多对齐失败,如欺骗、谄媚和越狱,已经可以通过公开基准进行测量。我们研究自动化对齐研究人员(AARs)是否可以通过提出训练方法和数据来同时优化多个安全基准,从而在保持通用能力的同时缓解对齐失败。在10个对齐失败中,最强的AAR方法显著减少了目标对齐失败,并泛化到保留基准、多轮行为审计,以及比目标模型大4.7倍的模型。作为人类基线,28名经验丰富的研究人员有最多八小时时间开发相同基准的方法,但他们的方法表现不如最佳AAR方法。将人类想法作为AARs的初始研究方向并不能提高性能,表明当前的AARs可能不需要经验丰富的研究人员的指导。这些结果表明,在近期,自动化对齐研究在明确定义的失败上可能是可行的。
查看缓存全文
缓存时间: 2026/09/01 12:43
# 自动化研究员能够可靠地缓解对齐失败问题
来源:https://arxiv.org/html/2608.28945
陈越瀚††通讯作者:yueh\.han\.chen@nyu\.edu
温嘉欣
机构:加州大学伯克利分校
扬·亨德里克·基希纳
机构:Anthropic
###### 摘要
自动化对齐研究可能加速实现对齐AI的进程,但其效果难以衡量。幸运的是,许多对齐失败(如欺骗、谄媚和越狱)已可通过公共基准测试进行测量。本文研究自动化对齐研究员(AAR)是否能通过提出训练方法和数据来同步优化多个安全基准测试(同时保持通用能力),从而进行后训练以缓解对齐失败问题。针对10种对齐失败,最强的AAR方法显著降低了目标对齐失败问题,并能泛化至保留基准测试、多轮行为审计,以及比目标模型大4.7倍的模型。作为人类基线,28名经验丰富的研究人员有最多八小时时间针对相同基准测试开发方法,但其方法表现不及最佳AAR方法。将人类想法作为AAR的初始研究方向并未提升性能,表明当前的AAR可能无需经验丰富的研究人员指导。这些结果表明,在明确定义的失败问题上实现自动化对齐研究可能在短期内具备可行性。
图1:自动化对齐研究员能够缓解对齐失败(此处为欺骗问题),且最佳方法能泛化至分布外场景。
(a) AAR在保持能力的同时提升了安全基准测试表现。
(b) 最佳方法在Petri多轮行为审计下仍更安全。
(c) 在4.5倍更大的模型上依然有效。
(d) 其表现优于经验研究人员的构想。
在(a)和(d)中,“安全余量闭合度”指方法缩小从基线到完美表现差距的比例。图3(https://arxiv.org/html/2608.28945#S5.F3)、4(https://arxiv.org/html/2608.28945#S5.F4)和5(https://arxiv.org/html/2608.28945#S5.F5)展示了全部十种对齐失败的(a)、(c)和(b)结果。
## 1 引言
AI智能体很可能在各种智力任务上超越人类,前沿实验室最终可能让它们自动化对齐研究(Leike and Sutskever, 2023 (https://arxiv.org/html/2608.28945#bib.bib32);Wen et al., 2026 (https://arxiv.org/html/2608.28945#bib.bib60))。我们研究一个具体任务:AI智能体作为自动化研究员,能否通过对齐后训练来可靠地缓解常见的对齐失败问题,如欺骗(Huang et al., 2025 (https://arxiv.org/html/2608.28945#bib.bib25))、谄媚(Sharma et al., 2023 (https://arxiv.org/html/2608.28945#bib.bib48))、服从越狱指令(Wei et al., 2023a (https://arxiv.org/html/2608.28945#bib.bib56))等。缓解对齐失败是研究自动化对齐的天然试验场,原因有三:首先,成功可通过代理指标衡量:许多对齐失败已有公共基准测试,如用于欺骗的MASK(Ren et al., 2025 (https://arxiv.org/html/2608.28945#bib.bib46))或用于越狱的HarmBench(Mazeika et al., 2024 (https://arxiv.org/html/2608.28945#bib.bib36)),而非难以监督的对齐任务如可扩展监督(Bowman et al., 2022 (https://arxiv.org/html/2608.28945#bib.bib7))或引出模型潜在知识(Christiano et al., 2021 (https://arxiv.org/html/2608.28945#bib.bib10))。其次,进展仍受限于人类研究员的时间:提出方法、运行实验、检查修复能否泛化至分布外且不侵蚀通用能力的过程缓慢。第三,自动化相对安全:Bowkis et al. (2026) (https://arxiv.org/html/2608.28945#bib.bib6)认为,在难以监督的任务中,有缺陷的人类判断可能让自动化研究员的错误未被察觉,从而带来危险;而此处由客观基准测试(而非易错的人类)决定修复是否有效。
我们使用Claude Opus 4.8构建自动化对齐研究员(AAR),每次缓解一种对齐失败。每个AAR搜索文献、提出方法、在1个H200 GPU上训练目标模型约30分钟,并通过多次迭代优化安全基准测试。方法不能从AAR或更强模型中蒸馏行为,因此增益必须来自方法本身。我们还拒绝那些在MMLU(Hendrycks et al., 2021 (https://arxiv.org/html/2608.28945#bib.bib23))、GSM8K(Cobbe et al., 2021 (https://arxiv.org/html/2608.28945#bib.bib11))或IFEval(Zhou et al., 2023 (https://arxiv.org/html/2608.28945#bib.bib66))上显著降低能力的方法。随后,我们在保留基准测试和开放式Petri(Fronsdal et al., 2025 (https://arxiv.org/html/2608.28945#bib.bib16))审计中测试最佳方法。针对10种对齐失败,最佳方法显著降低了目标失败问题,并能泛化至分布外场景,包括比目标模型大4.7倍的模型。我们还研究了AAR想法与经验人类的比较、AAR提出的方法(第5.2节 https://arxiv.org/html/2608.28945#S5.SS2),以及它们是否试图作弊。
总结我们的贡献:
- 在包括欺骗、谄媚和越狱在内的十种常见对齐失败中,我们发现AAR发现的方法显著缓解了目标对齐失败问题,并能泛化至分布外场景:包括保留基准测试、Petri多轮行为审计,以及比目标模型大4.7倍的模型(第5.1节 https://arxiv.org/html/2608.28945#S5.SS1)。
- 我们证明最佳AAR提出的方法可以超越28名经验丰富的AI安全人类研究人员的一次性构想(他们平均拥有2.5年AI安全经验,每人有最多八小时开发想法)。平均而言,我们的AAR在6小时迭代优化后超越了最佳人类构想。此外,我们发现使用人类撰写的想法作为初始研究方向(定义见第4节 https://arxiv.org/html/2608.28945#S4)并未提升AAR性能,表明当前AAR可能无需经验人类研究人员的研究指导(第4节 https://arxiv.org/html/2608.28945#S4、5.1节 https://arxiv.org/html/2608.28945#S5.SS1)。
- 作为早期研究,我们将Claude Sonnet 5作为AAR应用于Claude Opus 4.8的早期检查点进行后训练,所得模型仅使用约2,400个训练样本(比已发表的开源权重后训练管道的对齐阶段数据少两到三个数量级(Lambert et al., 2024 (https://arxiv.org/html/2608.28945#bib.bib31);Touvron et al., 2023 (https://arxiv.org/html/2608.28945#bib.bib53)))即接近已发布模型的对齐分数。需注意,我们仅缓解和测量了研究的十种对齐失败,因此该发现不直接适用于整体对齐(详见第6节 https://arxiv.org/html/2608.28945#S6,额外说明见第8.1节 https://arxiv.org/html/2608.28945#S8.SS1)。
- 通过监控1,601条AAR轨迹(第7节 https://arxiv.org/html/2608.28945#S7),我们检测并排除了2.4%存在作弊行为的轨迹。这些行为主要分为三类:重新提交未修改的方法以期评分者方差产生更高(噪声)分数;构建旨在模仿被评分基准测试的训练数据;以及隐瞒违规步骤(如秘密使用基准测试数据)以通过运行前的自动审查。
## 2 环境
每个AAR在固定环境中工作:针对一种对齐失败的基准测试套件(第2.1节 https://arxiv.org/html/2608.28945#S2.SS1)、评分指标(第2.2节 https://arxiv.org/html/2608.28945#S2.SS2)、目标模型(附录A.3 https://arxiv.org/html/2608.28945#A1.SS3)和评估流程(第2.3节 https://arxiv.org/html/2608.28945#S2.SS3)。我们研究十种对齐失败(表1 https://arxiv.org/html/2608.28945#S2.T1),选择标准是既被广泛研究又可能在部署模型中出现的安全问题。
表1:我们研究的十种对齐失败、每种失败惩罚的具体行为及所用目标模型。目标模型选择方法见附录A.3(https://arxiv.org/html/2608.28945#A1.SS3)。
### 2.1 基准测试
每种对齐失败包含三类角色的基准测试:迭代优化、保留和能力(完整列表见附录A.2 https://arxiv.org/html/2608.28945#A1.SS2)。基准测试需经广泛验证后才被纳入(附录A.5 https://arxiv.org/html/2608.28945#A1.SS5)。每个安全基准测试的评分者是基于规则的(匹配或对数概率比较)、基于判断的(LLM对自由形式输出评分)或基于轨迹的(基于对话记录的多轮展开评分)。
迭代优化基准测试(每种对齐失败3-5个)定义了AAR优化的分数。它们从不同来源和框架测量对齐失败,因此提升所有基准测试需要模型行为的真实改变,而非过拟合某个基准测试:例如越狱测试集用三种不同攻击方式(对抗性后缀、角色扮演人格和语义重写)包裹有害请求,因此AAR提出的方法必须对所有攻击方式都鲁棒。保留基准测试测试泛化能力:它从未向AAR展示(附录A.1 https://arxiv.org/html/2608.28945#A1.SS1给出了其必须满足的两个标准和所探测的泛化类型)。
能力基准测试。我们评估每种方法以确保其不降低通用能力,使用固定的MMLU、GSM8K和IFEval作为代理指标进行评估;附录A.4(https://arxiv.org/html/2608.28945#A1.SS4)详述了子集、提示和评分。
### 2.2 指标
对于每个基准测试 \(b\),我们报告闭合分数 \(\mathrm{closed}(b) = (\mathrm{score}_b - \mathrm{baseline}_b)/(\mathrm{optimum}_b - \mathrm{baseline}_b)\),即训练模型缩小的基线到最佳差距的比例,其中 \(1\) 表示模型达到最佳,\(0\) 表示与基础模型匹配,负值表示退步。\(\mathrm{baseline}_b\) 是未训练目标模型的测量分数,\(\mathrm{optimum}_b = 1\) 是指标自身的上限。AAR优化的是跨基准测试闭合分数的*几何*均值。使用几何均值而非算术均值奖励改善所有基准测试的方法,因为将任何基准测试保持在基线或以下会使整体分数降至零。
### 2.3 评估
独立的评估器加载训练后的模型权重,运行评估套件,并返回几何均值、迭代优化集的每个基准测试闭合分数,以及能力判定:若训练模型在任何能力基准测试上的95%置信区间完全低于基础模型,则无论分数如何,该方法均会被取消资格。
我们设计的评估旨在抵抗博弈:AAR提交训练后的*模型*且从不看到基准测试样本,因此无法过拟合基准测试。隐藏的保留集、几何均值、能力检查、保留数据的操作系统隔离和代码监控(第3.2节 https://arxiv.org/html/2608.28945#S3.SS2)共同使得未经真实行为改变难以获得保留集提升。
#### 选择报告的方法。
我们进一步通过1) Petri(Fronsdal et al., 2025 (https://arxiv.org/html/2608.28945#bib.bib16))(一种模拟对抗场景以引出未对齐行为的开放式行为评估),2) 将方法应用于比AAR优化的目标模型更大的模型,以观察其在更大规模上是否仍有效,来测试泛化能力。对于这两个泛化测试,我们取排行榜上的领先方法,并选择在保留基准测试上得分最高的方法。因此保留基准测试是该选择的验证集,而Petri(未用于选择任何东西)是测试集。保留结果本身不是这样选择的,在那里排行榜上的第一名方法在所有10种对齐失败上均优于未训练基线(第5.1节 https://arxiv.org/html/2608.28945#S5.SS1)。
## 3 自动化对齐研究员工作平台
AARPropose\+\+小论文监控批准代码训练1个GPU,约30分钟评估器给模型评分排行榜和论坛分数每次迭代重复(使用新会话,5个AAR并行运行)共享调查现有方法图书馆员代理网络搜索简报对齐失败、基准测试、规则隔离:保留集隐藏最佳方法48小时/停滞
图2:自动化对齐研究员工作平台。运行从文献综述开始,创建共享文献调查(左上)。五个AAR并行工作,通过迭代优化基准测试来修复对齐失败。每个AAR阅读调查、简报和排行榜,提出方法并撰写小论文(附录B.5 https://arxiv.org/html/2608.28945#A2.SS5),获得代码批准后在固定预算下训练目标模型,并将其发送给独立的评估器(评估器保持保留数据隔离)。结果发布到共享论坛和排行榜。每次迭代开始新会话,过程持续最多48小时或直到性能停滞,从排行榜选择最佳方法。
该平台分两个阶段工作(图2 https://arxiv.org/html/2608.28945#S3.F2)。首先从文献综述阶段开始,四个图书馆员代理构建相关先前方法的共享调查(附录B.1 https://arxiv.org/html/2608.28945#A2.SS1)。然后进入迭代优化阶段(第3.1节 https://arxiv.org/html/2608.28945#S3.SS1),五个自动化对齐研究员(AAR)并行处理同一对齐失败。每个AAR是由Claude Opus 4.8驱动的智能体,它迭代:阅读共享调查和排行榜,进行新的网络搜索,并排列候选方法;将其首选方法撰写成小论文;一旦监控器批准代码(第3.2节 https://arxiv.org/html/2608.28945#S3.SS2),它在计算预算内训练模型,将其发送给独立评估器评分,并在下次提议前将结果发布到论坛。每次迭代都是全新会话,连续性由持久化内存文件(记录AAR尝试和评分内容)而非增长的上下文窗口保持。AAR运行直到达到48小时时钟预算或性能停滞。
### 3.1 迭代优化循环
每个AAR从简报开始,简报将目标对齐失败定义为需要修复的具体行为,命名评分基准测试及目标模型在每个基准测试上的基线分数,并陈述监控器执行的硬规则(第3.2节 https://arxiv.org/html/2608.28945#S3.SS2);命名基准测试不等同于揭示其测试集,简报不显示任何基准测试样本且从不提及保留基准测试(附录B.2 https://arxiv.org/html/2608.28945#A2.SS2)。方法是独立程序,使用任何允许的干预和数据构建或绘制(附录B.3 https://arxiv.org/html/2608.28945#A2.SS3),训练目标模型并返回所得权重。每个方法获得相同预算:1个H200 GPU和约30分钟训练。并行的AAR共享发现论坛和排行榜,因此彼此借鉴。相似文章
2026年8月28日:自动化研究者可靠缓解对齐失败
Anthropic发布了一份报告,表明使用Claude的自动化研究者可以可靠地缓解AI对齐失败,弥合重大安全差距,并在某些基准测试中超越人类研究者。
Anthropic的自动化对齐研究人员表现显著优于人类研究人员
Anthropic宣布其自动化对齐研究系统超越人类研究人员,标志着AI安全与效率的重大进步。
Anthropic研究人员首次展示了自我改进AI的潜力
Anthropic研究人员发表了一篇论文,介绍了一种自动化系统,该系统能够通过使用其他AI模型训练模型来可靠地提高AI对齐性,显示出在递归自我改进方面的潜力,并在某些场景中超越了人类研究人员。
2026年4月14日 | 对齐研究 | 自动化对齐研究者:利用大语言模型扩展可扩展监督
Anthropic 研究人员证明,Claude Opus 4.6 能够自主担任对齐研究者,以改进弱监督强技术,从而应对可扩展监督中的挑战。
@AnthropicAI: Anthropic Fellows 的最新研究:开发自动化对齐研究员。我们进行了一项实验,以了解 Cla…
Anthropic Fellows 的研究展示了一项使用 Claude Opus 4.6 加速对齐研究的实验,该研究关注弱到强监督,探索较弱的 AI 模型是否能在训练过程中有效监督较强的模型。