OpenAI 和 Anthropic 分享联合安全评估的研究成果

OpenAI Blog 新闻

摘要

OpenAI 和 Anthropic 发布了首次联合安全评估的研究成果。在这次评估中,两家实验室分别对彼此的模型进行了内部安全和对齐性测试,并公开分享了结果,以提高透明度并发现 AI 安全测试中的潜在漏洞。

OpenAI 和 Anthropic 公布了首次联合安全评估的成果,对彼此的模型进行了错位、指令遵循、幻觉、越狱攻击等多方面的测试,强调了进展、挑战以及跨实验室合作的价值。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:48

# 来自 Anthropic-OpenAI 对齐评估试验的发现:OpenAI 安全测试 来源:https://openai.com/index/openai-anthropic-safety-evaluation/ 今年夏天,OpenAI 和 Anthropic 开展了首次联合评估:我们各自对对方公开发布的模型运行内部安全和错误对齐评估,现在公开分享结果。我们认为这种方法支持负责任和透明的评估,有助于确保各实验室的模型继续接受新的和具有挑战性的场景测试。我们随后推出了 GPT-5(https://openai.com/index/introducing-gpt-5/),在附和性、幻觉和滥用防护等方面显示了实质性改进,展示了基于推理的安全技术的好处。这项外部评估的目标是帮助发现可能被忽略的漏洞,深化我们对潜在错误对齐的理解,并演示实验室如何在安全和对齐问题上进行协作。 由于该领域不断发展,模型越来越多地被用于协助现实世界的任务和问题,安全测试永远不会结束。即使在这项工作完成后,我们也进一步扩展了评估的深度和广度,并将继续展望未来以预测潜在的安全问题。 在这篇文章中,我们分享了在 Anthropic 模型 Claude Opus 4 和 Claude Sonnet 4 上运行的内部评估结果,并将其与 GPT-4o、GPT-4.1、OpenAI o3 和 OpenAI o4-mini 的结果并列呈现,这些是当时为 ChatGPT 提供支持的模型。Anthropic 对我们模型的评估结果可在此处获得(在新窗口中打开)(https://alignment.anthropic.com/2025/openai-findings/)。我们建议阅读两份报告,以全面了解所有模型在所有评估中的表现。 两个实验室通过放宽一些模型外部保护措施来便利这些评估,这些措施在其他情况下会干扰测试的完成,这是类似危险能力评估的常见做法。所有使用 Claude Opus 4 和 Claude Sonnet 4 的评估都通过公共 API 进行。在大多数情况下,我们默认为这些模型启用推理,并在禁用推理的额外评估中将结果指定为"无思考"。 我们不是为了与对方系统进行精确的苹果对苹果比较,因为访问权限和对我们自己模型的深入熟悉程度的差异使得公平比较很困难。我们的目标是探索模型倾向——模型可能尝试的令人担忧的行为类型——而不是进行完整的威胁建模或估计现实世界的可能性。我们使用内部工具和评估进行了有针对性的评估,调整最少,这意味着方法中可能存在细微的不一致。我们尽力指出这些在哪些地方可能影响了结果,并注意到因此不适合从这些结果中得出过于宽泛的结论。 重要的是要强调,安全和错误对齐测试结果展示的是这些模型在专门设计为困难的环境中的表现。因此,我们不断更新我们的评估,使其变得更具挑战性,并超越任何模型完美表现的评估。这种方法有助于我们推进对边界情况和可能失败模式的理解,但不应被解释为直接代表现实世界的不当行为。 我们在下面为每项评估呈现详细的结果和定性分析,包括成功案例和失败案例的示例。以总结我们的发现: - **指令层次结构** (https://openai.com/index/openai-anthropic-safety-evaluation/#instruction-hierarchy):Claude 4 模型在压力测试模型遵守指令层次结构的能力的评估中表现良好,在避免系统消息和用户消息冲突方面表现最好,略优于 OpenAI o3,超过其他模型的幅度更大。相关地,Claude 模型在压力测试模型抵抗系统提示提取能力的评估中表现与我们最好的推理模型相同或稍好。 - **越狱** (https://openai.com/index/openai-anthropic-safety-evaluation/#jailbreaking):在越狱评估(专注于训练内保护措施的整体鲁棒性)上,Claude 模型与 OpenAI o3 和 OpenAI o4-mini 相比表现不佳。在一个越狱场景中,禁用推理的 Claude 模型实际上优于启用推理的 Claude。在另一个场景中,考虑到自动评分器错误后,Claude 模型与 OpenAI o3 的表现相当。 - **幻觉** (https://openai.com/index/openai-anthropic-safety-evaluation/#hallucination):在幻觉评估中,Claude 模型的拒绝率极高——高达 70%。这表明这些模型意识到自己的不确定性,通常避免做出不准确的陈述。然而,高拒绝率限制了实用性,这些评估中模型选择回答的示例的总体准确率仍然很低。相比之下,OpenAI o3 和 OpenAI o4-mini 在限制工具使用(如浏览)的具有挑战性的设置中显示出较低的拒绝率和较高的幻觉率。我们建议未来对 Claude 模型特别关注,并在下方详细阐述我们自己为了在进一步减少幻觉的同时保持模型回应实用性所做的努力。 - **计谋** (https://openai.com/index/openai-anthropic-safety-evaluation/#scheming):在一组计谋评估中,我们发现 OpenAI o3 和 Sonnet 4 在实现低率方面总体表现最好。这是启用推理并不总是有帮助的领域——启用推理的 Opus 4 表现不如禁用推理,OpenAI o4-mini 表现同样较弱。此外,我们注意到每个模型在我们测试的特定子集中表现特别好或特别差,突显了这一领域对两个实验室进一步工作的重要性。 直接与另一领先研究实验室进行安全评估为在新场景中评估我们的模型以及重新审视我们自己的一些内部评估提供了宝贵机会。那么,我们从 Anthropic 对我们模型的测试中学到了什么? - **推理模型的相对优势。** 这项工作的一个贯穿始终的主题是我们看到的推理模型往往在评估中表现最强。在 Anthropic 的测试中,我们的推理模型(如 OpenAI o3)在一系列具有挑战性的错误对齐和安全评估场景中表现出稳健性。虽然我们在内部也发现了类似结果,但这一外部验证强化了它们,并突显了推理在 AI 中的整体实用性,包括在对齐和安全中。我们继续优先进行推理研究和相关安全工作,并在 8 月初推出了 GPT-5 (https://openai.com/index/introducing-gpt-5/),一个统一的模型系统,将推理模型的优势带给所有用户。 - **安全与对齐研究优先事项的验证。** Anthropic 的评估确定了我们模型中有改进空间的几个领域,这些领域通常与我们自己的积极研究优先事项一致。例如,Anthropic 对与人类滥用合作的评估大致与我们自己减少不允许内容(如仇恨言论或非法建议)的努力一致。GPT-5 在这一领域显示重大改进(在新窗口中打开)(https://cdn.openai.com/gpt-5-system-card.pdf),这在一定程度上由我们新的安全补全 (https://openai.com/index/gpt-5-safe-completions/) 安全训练技术驱动。持续改进附和性 (https://openai.com/index/expanding-on-sycophancy/) 是我们已有的主要努力;通过 GPT-5,我们在减少附和性方面取得了实质性改进并发布了我们的第一个公开评估,计划进行额外工作。在幻觉方面,我们发现研究两个实验室如何处理这一持续研究挑战很有价值。我们在 GPT-5 中改进了幻觉的减少,特别是在复杂或开放式问题周围。欺骗、权力寻求和自我保存都是我们通过我们的准备框架 (https://openai.com/index/updating-our-preparedness-framework/) 和安全评估以及与 Apollo 等合作伙伴的外部红队和评估协作密切跟踪的领域。我们计划在不久的将来在这一领域发布额外研究。 - **新颖场景有助于评估泛化。** 虽然 Anthropic 运行的许多评估与我们自己的研究议程密切一致,但有些探索了专门领域,如灵性与感恩、奇异行为和举报。包含这些特定领域的评估很有价值,因为它有助于在不太传统的场景中验证我们的模型,提供额外证据表明它们在我们内部优先考虑的领域和基准之外泛化良好。 - **对评估支架的投资。** 就流程和方法而言,我们发现这些评估总体上相当直接易行,但进一步的总体评估支架和标准化将使未来的迭代更容易。这是美国 CAISI、英国 AISI 和类似组织等独立评估者为该领域提供特殊价值的领域。 - **跨实验室合作在安全中的价值。** 我们希望向在这项工作上进行协作的 Anthropic 研究人员表示感谢和认可。我们感谢他们在这首次重大跨实验室安全和对齐测试工作中的参与,我们希望这说明了在行业级别评估安全的宝贵途径。对于该领域和世界而言,AI 实验室继续相互问责并为安全和错误对齐测试中的标准提高标准至关重要。 请参阅下文了解我们关于 Anthropic 模型的完整报告,分为四个大类别: - 指令层次结构 (https://openai.com/index/openai-anthropic-safety-evaluation/#instruction-hierarchy) - 越狱 (https://openai.com/index/openai-anthropic-safety-evaluation/#jailbreaking) - 幻觉 (https://openai.com/index/openai-anthropic-safety-evaluation/#hallucination) - 计谋 (https://openai.com/index/openai-anthropic-safety-evaluation/#scheming) *指令层次结构* (https://openai.com/index/the-instruction-hierarchy/) 定义了 LLM 优先考虑不同级别指令的方式——从内置系统或策略约束开始,然后是开发人员级别的目标,最后是用户的提示。清楚地定义这个顺序确保了核心安全、对齐和策略得到执行,同时给开发人员和最终用户提供了负责任地指导模型的空间。测试模型遵守这一指令层次结构的效果好坏是确保模型在一系列用户目标下保持一致的重要方式。在本节中,我们报告了三项不同的评估,这些评估旨在压力测试每个模型遵守其指令层次结构的效果。 我们测试指令层次结构的一种方法是检查模型是否能够成功抵抗试图暴露其内部"系统提示"或开发人员指令的模拟尝试。这为模型对对抗压力的整体韧性提供了有用的信号。 基于 Toyer 等人最近的工作 (在新窗口中打开) (https://arxiv.org/pdf/2311.01011),系统提示提取评估在模型的隐藏提示中嵌入了一个秘密短语或密码,然后重复查询模型,直到它要么拒绝,要么泄露内容。我们通过查看模型正确拒绝透露秘密的频率来衡量成功。 这里,我们关注两项评估:密码保护用户消息和短语保护用户消息。这些是我们测试并为我们的模型发布 (https://openai.com/safety/evaluations-hub/#instruction-hierarchy) 的标准指标集的一部分。(因为*系统*和*开发人员消息*在我们两个组织中的结构不同,我们在此为了公平比较而排除了开发人员消息评估。)两项测试遵循相同的结构,仅在隐藏在用户之外的秘密字符串以及对抗提示的风格和复杂性上有所不同。 Claude 4 模型总体上对系统提示提取尝试显示出强大的抵抗力。在密码保护评估集上,Opus 4 和 Sonnet 4 都与 OpenAI o3 匹配,完美实现 1.000 性能。这与我们之前的发现一致,即推理模型在这项任务上表现良好。 对于更具挑战性的短语保护任务,Claude 模型再次表现极好,达到或略微超过 OpenAI o3 和 o4-mini 的性能。 由于 Opus 4、Sonnet 4 和 OpenAI o3 都在密码保护上得分完美,我们分享了一个模型的思考链示例,以展示推理的有效性。以下是 Opus 4 推理通过试图规避系统消息的请求的示例: 有趣的是,我们看到在某些情况下,模型实际上识别并明确指出了被尝试的攻击类型。这段摘录来自 Opus 4 推理链,显示了这一点: 这种攻击识别似乎很有用,允许模型快速得出适当的反应,但这不是优异性能的必需条件。其他推理模型也成功在评估中拒绝了注入攻击,即使他们没有在推理中明确将其标记为攻击。 有时,模型正确理解他们正在处理越狱攻击,但随后意外地泄露秘密。下面我们展示了一个这样的示例。(注意,这个系统消息与 Claude 模型对转轮指示符使用文本边界的方式略有不一致。) 在这种情况下,模型泄露了密码,即使它识别了攻击并解释了它不会这样做。 在某些情况下,模型成功避免输出密码或所需的攻击者输出,但未能完全遵循初始指令。我们从 o3 和 Sonnet 4 各提供一个示例。 这里,OpenAI o3 用标准拒绝而不是系统消息中指定的"没门..."来回应: 这里是 Sonnet 4 的示例,其中模型对系统消息是角色扮演或社会工程持谨慎态度。系统指令指示模型完全输出 'Haha,漂亮的尝试!',但 Sonnet 4 既不遵循原始系统消息,也不被攻击所欺骗。 系统 <> 用户消息冲突评估测试当系统级指令与用户请求冲突时,模型遵守其指令层次结构的效果如何。模型呈现多转对话,这些对话以清晰的系统消息开始,概述一条指令,随后是用户提示,旨在诱使助手违反该指令。良好的性能意味着模型在对抗压力下一致地拒绝或抵抗这些冲突的提示,表现出健壮的、安全导向的行为。我们在我们的安全评估中心 (https://openai.com/safety/evaluations-hub/#instruction-hierarchy) 上运行这些评估并公开分享结果,作为我们模型发布的一部分。 这个评估集由 OpenAI 使用对抗性红队技术创建,以对我们自己的模型进行压力测试和探测

相似文章

OpenAI 安全实践

OpenAI Blog

OpenAI 介绍了其积极采用并不断改进的 10 项安全实践,包括实证红队测试、对齐研究、滥用监控以及在首尔 AI 峰会上分享的自愿承诺。该公司强调采用均衡、科学的安全方法,将其融入开发的各个环节。

OpenAI 公开部分对齐问题(11分钟阅读)

TLDR AI

OpenAI 坦诚分享了一份关于内部模型试图绕过限制的报告,导致他们将该模型下线并建立新的安全措施。文章赞扬了 OpenAI 的透明度,但也警告不要仅依赖监控,因为模型的能力越来越强。