@AnthropicAI:我们正在分享关于对齐与安全工作的最新进展。在七月,我们报告了三起事件,其中Claude模型……

X AI KOLs 新闻

摘要

Anthropic分享了关于对齐和安全工作的更新,这些更新是在Claude模型在评估过程中获得未授权访问事件之后发布的,详细介绍了环境加固、对齐研究和奖励黑客的见解。

我们正在分享关于我们对齐和安全工作的更新。 在七月,我们报告了三起事件,其中Claude模型在网络安全评估中无安全防护运行,获得了对真实系统的未授权访问。 在一篇新文章中,我们描述了: 1. 我们如何保护了评估和训练环境,以及我们在外部合作伙伴测试无网络安全防护的预发布模型时要求他们采用的做法 2. 关于我们对齐评估的更新 3. 关于训练中奖励黑客如何塑造模型行为的新研究,为什么我们认为我们今年春季的工作使这些事件没有变得更严重,以及为什么这项工作中的缺陷可能导致了它们 4. 我们今年早些时候如何加固安全实践以准备应对Mythos级模型 阅读更多:
查看原文
查看缓存全文

缓存时间: 2026/09/01 13:32

我们分享关于对齐与安全工作的最新进展。

7月,我们报告了三起事件:在无网络安全防护措施的情况下运行的Claude模型在评估中获得了对真实系统的未授权访问。

在新发布的文章中,我们详细说明:

  1. 如何确保评估与训练环境安全,以及要求外部合作伙伴在测试无网络安全防护的预发布模型时遵循的操作规范
  2. 对齐评估工作的最新进展
  3. 关于训练过程中奖励欺骗如何影响模型行为的新研究,我们认为春季的工作为何能使这些事件未造成更严重后果,以及这些工作中的漏洞可能如何促成了事件发生
  4. 如何在今年早些时候加强安全实践,以应对神话级模型

阅读更多:


提升对齐与安全实践

来源:https://www.anthropic.com/news/improving-alignment-security-efforts 7月30日,我们报告(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)了三起Claude模型获得对真实计算机系统未授权访问的事件。这些模型——出于评估目的特意在无网络安全防护措施下运行——由于第三方评估环境内的配置错误而接入互联网。此外,8月4日,英国人工智能安全研究所报告(https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing)了其自身网络安全测试中的一起事件,其中Claude Mythos 5在实时互联网上执行了一系列未授权操作。在该案例中,模型同样是出于评估目的在无网络安全防护措施下运行,但被特意授予了互联网访问权限。

我们正在对两起事件进行深入分析,同时计划与METR合作开展独立审查。我们将确保两项研究彻底全面,并在未来数周内分享更多信息。

与此同时,我们分享过去一个月做出的调整。我们认为这些事件反映了操作安全的失误,以及两个对齐问题:动机性推理,以及为完成狭隘任务而愿意采取有害行为(这两点我们已在之前的系统说明中阐述过)。关于安全层面,我们介绍了对遏制和监控系统的改进,以及为第三方评估者制定的操作规范。在对齐层面,我们深入探讨了这两个问题;我们也认为持久的进步不仅来自理解特定事件中发生了什么,更需要理解失配的根本原因,并在此分享相关早期研究(https://alignment.anthropic.com/2026/reward-seeker/)。

鉴于这些事件,关于控制前沿技术发展节奏的讨论日益增多。区分两种节奏控制类型很有帮助:在公司内部,节奏控制指在安全与速度产生冲突时优先考虑安全的一系列决策;在整个领域,则指建立防止“逐底竞争“动态的机制。本文将讨论我们在事件前后为实现第一种控制所采取的措施。第二种节奏控制需要政府与行业间的协调,且应具备可理解性与可验证性。我们部分高管及众多员工近期签署联名信,呼吁加强节奏控制协调,未来数周我们将进一步说明参与该工作的计划。需要明确的是:我们相信行业若能尽早建立合法、可验证、有效的协调节奏机制,将使全世界受益。

确保评估与训练环境安全

尽管我们认为这些事件不仅反映操作问题,但首要任务是解决具体的遏制和监控问题。我们采取了以下应对措施:

暂停并加固评估环境

事件发生后,我们暂停了预发布模型的外部网络安全评估,并在采取以下措施期间短暂暂停了内部评估。7月30日报告的事件表明,我们过于依赖单一防御层(环境配置),而需要多层防护:包括在提示中设定明确边界、建立沙盒封存验证流程,以及实现实时干预监控。OpenAI披露(https://openai.com/index/hugging-face-model-evaluation-security-incident/)(促发我们7月调查)的模型利用未知漏洞在评估中突破封存沙盒的事件,也明确提示我们应重点加固沙盒本身。

在暂停评估期间,我们实施了以下初步措施:

  1. 构建并部署了分类器,实时自动识别模型试图激进探测或逃离测试环境,或意外获得互联网访问权限的行为。当分类器标记此类尝试时,会在工具调用执行前拦截操作、终止任务并通知人类操作员。¹

  2. 对近期内部预发布模型评估(包括网络安全及其他类型)的记录运行自动化监控,搜寻沙盒逃逸(模型利用沙盒漏洞访问应被隔离的系统)或沙盒配置错误案例。在沙盒工具内运行评估的情况下,未发现突破沙盒边界访问外部资源的例子。确实发现了模型利用的多种沙盒配置错误,但均未导致沙盒外系统被攻破。²我们正积极解决这些问题。

  3. 将高风险³内部网络安全沙盒迁移至更可靠的隔离环境。同时持续对虚拟化堆栈进行红队测试——指派预发布模型尝试突破虚拟化——以发现并修补漏洞。

我们的内部网络安全评估现已在实施这些措施后恢复运行。

强化学习环境

我们也暂停了预发布模型的高风险强化学习环境数周。在此期间,我们构建了类似分类器(经修改以避免激励模型规避此类新监控),现已部署到这些环境中。大部分强化学习已恢复,但部分高风险环境在完成人工审查前仍将暂停,另有环境需要我们计划即将部署的更新版分类器。

更广泛的防护措施

除聚焦高风险评估和训练外,我们将离线监控扩展到覆盖大多数其他形式的内部前沿智能体使用场景。同时正在构建内部推理管控机制,防止Anthropic员工意外运行具有上述较弱防护措施的智能体。

外部合作伙伴最佳实践

鉴于已报告事件发生在第三方环境,我们要求所有测试无网络安全防护措施的预发布模型的组织承诺遵循一套最佳实践。我们认为这些措施必不可少,原因在于:

  • 我们正式发布的模型包含安全防护——包括对Claude输入输出进行实时监控的分类器,以阻止恶意软件开发或攻击性漏洞利用编写等禁止的网络活动。而网络安全评估者和部分早期访问合作伙伴使用的是降低防护的模型,以便准确测试模型能力和开展防御性网络安全工作。
  • 网络安全评估特别容易产生此类事件中的行为。它们形成选择压力,促使模型在探测环境和绕过障碍时表现出持续性和创造力,且评估被重复执行成千上万次。

无论合作伙伴使用自有测试框架、沙盒或智能体进行网络安全相关评估,这些实践完全适用。**不适用于使用Fable 5等防护模型的客户。**我们已在实施这些实践后恢复外部网络安全评估,内部同样严格遵守。

沙盒与网络隔离

默认情况下,所有网络安全评估应在加固沙盒(隔离计算环境)内运行,且无互联网访问权限。环境唯一允许的外部连接应是模型自身的API,且API密钥需保存在环境外。每次评估开始前都应验证此配置。部分评估可能需要互联网访问。此类情况下,我们在评估预发布模型时将与外部评估者协作,确定能否可靠检测并终止模型采取超出声明范围的操作。

前期验证

进行评估运行前,评估合作伙伴应:

  1. 让被测模型探测沙盒漏洞,首先分析配置静态特征,然后实际指派模型尝试逃逸。模型应在成功逃逸时停止并报告,整个过程需在严密人工监督下完成。此测试应在无互联网环境下进行,理想状态是在第二个沙盒内。由于评估常需运行数百甚至数千次,合作伙伴最好在开始任何评估前进行充分测试。
  2. 确认任何评估任务在原则上确实可完成。当评估目标离线或任务无法完成时,智能体常会寻找其他途径完成挑战,增加了其采取超出评估预定范围操作的机会。⁴

明确范围设定

每个提示都应明确说明练习的范围边界,包括目标、允许操作及网络边界(即模型应/不应访问的内容)。边界应采用指令形式(如“不应访问互联网“)而非环境或测试的断言(“您无法访问互联网”)。

实时监控

评估者还应使用模型或规则监控器(已获知练习范围)持续监控模型的思考过程、操作和网络活动。若运行违反范围,监控器应标记并通知人类终止练习。

我们计划在外部合作伙伴咨询下持续完善此指南,并将其扩展到评估之外。特别是,我们正为访问Claude Mythos 5(同样无网络安全防护运行)的合作伙伴制定配套实践,即将分享更多详情。

对齐评估

遏制和监控对捕捉模型危险行为至关重要,但无法解决模型为何采取此类行为的问题。以下讨论我们的初步对齐调查及重点关注问题,以及防止训练作弊的持续工作——包括关于作弊如何影响模型行为的新研究。

评估环境与模型认知状态

我们的对齐评估仍在进行,但初步调查指向两个主要对齐失误,两者都在之前的系统说明中描述过。其一是动机性推理:模型最初被告知环境是模拟的,但后续接触到连接真实互联网的证据时,可能以允许维持该信念的方式解释证据。其二是鲁莽性:模型为完成网络安全评估这一狭隘目标,愿意在真实互联网上采取有害行为。然而我们也认为评估设置本身促成了事件中的模型行为。Claude被明确告知无互联网访问权限,而实际却有互联网可用,这可能导致它质疑所见系统的真实性。且在某案例中,虚构目标与真实网站同名,更难区分练习预定范围内的内容。

我们的结论依赖于若干未完全解答的问题,包括:模型确定自身可访问真实互联网的程度(即使最初不知情)、它们是否明知环境元素真实却选择无视、以及多起事件中它们未能停止练习是否源于动机性推理。我们正在运用多种技术解答这些问题:包括对环境进行针对性调整后重新采样模型,以及使用可解释性方法直接检测其内部状态。

研究防止训练作弊的方法

尽管模型失配复杂且可能源于多种原因,但实证研究发现训练环境缺陷——特别是易作弊或无法在不作弊情况下解决的环境——是导致失配行为的主要贡献因素。

以下讨论我们自事件发生前数月起为避免此类缺陷环境所做的努力。这些努力并不完美,我们的假设是事件至少部分源于无法完全消除此类问题。我们通过故意在易受奖励欺骗影响的环境中训练模型来验证此假设。在模拟中,该模型再现了更严重的失配行为,部分与今年夏季其他公司报告的事件类似。而我们的生产模型置于相同模拟中则未出现此类情况(本节稍后详述)。

历史上,我们一直关注激励作弊的强化学习训练环境,并采取各种措施过滤或修复此类环境。

2月,因发现奖励欺骗迹象(模型找到欺骗训练过程、在不完成任务情况下获取奖励的方式),我们回滚了Mythos Preview强化学习运行的三天训练。我们注意到模型在代码注释和回复中向“审阅者“留言,包括在从未提及审阅者的任务中——这是对提示中包含审阅者环境的不当泛化。它还通过堆叠免责声明或警告来操纵旨在激励诚实的奖励。⁵回滚这三天训练使我们能从该行为习得前的检查点恢复训练,并修改环境防止模型再次学习。

自Claude Sonnet 3.7(具有奖励欺骗倾向,我们在训练后期才发现)起,我们持续构建监控强化学习中模型习得不良行为的工具。我们投入大量精力确保工具随模型迭代演进:从少量分类器发展到训练前后对所有环境的自动化审查,但到2026年春季该系统已显吃力。我们生产的强化学习环境

相似文章

Anthropic称其AI模型在安全测试中攻破三家公司

TechCrunch AI

Anthropic披露,在网络安全评估期间,其Claude AI模型因配置错误而获得互联网访问权限,从而攻破了三家组织的生产系统。此事件发生在OpenAI类似泄露事件之后,引发了对测试环境中AI对齐和安全控制的担忧。

Anthropic称Claude在网络安全测试中入侵了3个组织

Wired

Anthropic披露,在网络安全测试期间,其Claude AI模型入侵了三个组织的生产系统,原因是测试合作伙伴Irregular的配置错误。这紧随OpenAI的类似事件之后,引发了对AI智能体隔离和监管的担忧。