值得信赖的第三方评估共享手册

OpenAI Blog 新闻

摘要

OpenAI分享了关于设计值得信赖的前沿模型第三方评估的经验教训和推荐方法,强调了评估框架和有效性检查的关键作用。

OpenAI分享了关于第三方AI评估的指南,涵盖如何评估前沿系统的模型能力、安全措施和有效性。
查看原文
查看缓存全文

缓存时间: 2026/05/29 18:43

# 可信第三方评估的共享方案 来源:https://openai.com/index/trustworthy-third-party-evaluations-foundations/ 独立、可信的第三方评估在强化安全生态系统中发挥着关键作用 (https://openai.com/index/strengthening-safety-with-external-testing/)。这些评估针对前沿模型展开,旨在为关键能力和安全缓解措施的主张提供额外证据。在这篇文章中,我们分享迄今为止的经验教训,并推荐设计能够有效评估前沿模型的评估方法,希望有助于为这一领域新兴标准的形成提供参考。 早期,许多评估将模型视为聊天机器人:评估如同用户提问一样向模型发出提示,模型回答,然后评估者判断输出。如今的前沿模型能做更多事情:它们可以使用工具、跨多步骤追踪信息,并在更大的工作流中行动。这意味着性能不仅取决于模型本身,还取决于任务发生的环境,以及促进其行动的外部设置。这个外部设置(我们称之为“支架”)可以改变系统性能的关键方面,包括如何使用工具、追踪信息或从错误中恢复。 这改变了评估需要执行的方式,以及读者应在评估报告中关注什么。我们认为,最有价值的报告在结果本身之外,还应明确描述两件事:第一,评估设置旨在测试什么主张;第二,分享证明评估结果有效的现有证据。 评估中测试的主张通常属于以下三类之一¹ (https://openai.com/index/trustworthy-third-party-evaluations-foundations/#citation-bottom-1): - **能力激发**:模型是否有可能产生被评估的能力? - **安全防护性能**:针对被评估的行为或攻击,所测试的安全防护有多稳健? - **比较**:在等同条件下,不同模型的表现如何? 评估报告还需解释评估者如何检查可能影响结果有效性的因素。这些因素包括: - **奖励作弊**:利用任务或评分器中的捷径,使系统在不展示评估本应测量的行为的情况下获得分数。 - **拒绝**:以掩盖被测试行为的方式拒绝执行任务。 - **污染**:因评估任务、答案或相近变体出现在训练数据中,或在评估期间可通过浏览等方式发现,而导致表现过高。 - **故障问题**:因任务无效而导致表现不佳。原因可能包括不公正的评分(例如,正确答案需要未说明的实现细节)和无法解决的环境(例如,缺少关键文件或工具不可靠)。 - **蓄意低分**:模型意识到自己被评估时,故意表现不佳。 ## 为评估选择合适的支架对获得最佳结果至关重要 我们观察到,对于在较长轨迹上运行的系统,支架的作用尤为重要。当模型可以使用工具、维护状态并在多步骤中从错误中恢复时,支架可以改变观察到的性能水平,甚至决定被评估的能力是否会在评估中出现。例如,一个保留状态并重试失败动作的支架,可能让模型完成一个在更简单支架下从未完成的复杂多步骤任务。 在下表中,我们区分了评估者可能想要做出的三类主张,以及我们认为每类主张所需的支架。 **能力主张的强度完全取决于背后的激发效果:评估者需要选择最适合任务以及评估所要测量的能力的支架。** 标准化支架可能适用于在同条件下比较系统,但若忽略了有助于模型执行任务的特定支架特性,则可能低估能力。例如,GPT‑5.5 在 OpenAI 的 cyber 靶场上的表现表明,在需要长时间、多步骤工具使用的任务上,支架选择会显著改变测量的能力:当支架使用压缩 (https://openai.com/index/equip-responses-api-computer-environment) 来在交互变长时保留任务相关上下文时,模型表现更好。这表明,对于某些模型,省略压缩功能的支架会低估性能。 更高的成功率更好 其他已发表的评估² (https://openai.com/index/trustworthy-third-party-evaluations-foundations/#citation-bottom-2) 也显示支架和预算选择会改变评估结果。**增加测试时计算量可以显著改变评估激发出的能力,** 尤其是在成功容易验证的领域,例如许多 cyber 任务。在UK AISI 的 cyber 靶场评估 (opens in a new window) (https://arxiv.org/pdf/2603.11214) 中,将预算从 1000 万令牌增加到 1 亿令牌,性能提升了最多 59%,且在最髙预算下性能仍在上升。详细说明这一点可使评估更易解读:它向读者展示了结果如何依赖于所测试的激发设置。当性能随着预算增加而仍在提升时,得分应被描述为该支架和预算下的性能,而非已测量的能力上限。能力通常依赖于资源,而非一个可以一劳永逸地被干净测量的固定量。如果成功可以在多次尝试中衡量,报告还应考虑每次成功解决所需的预期成本,而不仅仅是在固定令牌预算下的成功率。这可以使严重程度更容易解读:如果重复尝试的成本在相关威胁模型范围内,低成功率仍可能具有实际意义。对于能力主张,可避免的欠激发是一种测量失败:如果支架或预算阻止了系统展示它本可以产生的行为,那么分数并不能衡量所声称的能力。当评估者已尽可能推动激发但性能仍在提升时,报告应明确说明这一点,并明确结果仅为下界估计。 **如果不考虑攻击者可用的资源(包括自定义支架),安全防护测试可能会低估攻击成功与否及其严重程度。** 在UK AISI 的 GPT‑5.5 cyber 评估 (opens in a new window) (https://www.aisi.gov.uk/blog/our-evaluation-of-openais-gpt-5-5-cyber-capabilities) 中,他们的专家红队发现了一种通用越狱方法,可以在 OpenAI 提供的恶意查询中诱导出违规的 cyber 内容,包括在多轮代理设置中。他们使用 Codex 创建了一个自定义支架以增强模型的攻击性能:它将一个可重用的安全绕过模式嵌入交互中,跨轮次和区块保留该模式,并将其应用于 OpenAI 提供的恶意 cyber 查询。安全防护测试应与对手匹配。如果主张是关于对专家滥用的鲁棒性,测试应评估在定义预算下最强的端到端攻击策略,包括任何需要保留和重用该策略的支架。否则,结果可能存在校准错误:可能只支持关于对更简单提示抵抗力的较窄主张,可能既错过攻击一旦激发方法被实际应用后的严重程度和成功概率,也可能在给过多预算时高估问题的发生概率或严重程度。 **标准化支架比较有其时间和场合,但评估者应明确说明为何使用一组一致的支架是合适的,以及它能支持什么主张。** METR 的时间跨度评估 (opens in a new window) (https://metr.org/time-horizons/) 是一个更广泛且适当固定的评估设置的例子:它旨在为所评估的系统产生可比结果。METR 定义了一个通用结果,即人类任务在给定可靠性水平下 AI 代理预计能成功完成的典型持续时间。它应用了共享的任务套件、评分方法、拟合方法,以及在每批共同报告的估计中使用少量可复用的脚手架,例如Triframe 和 ReAct (opens in a new window) (https://metr.org/notes/2026-02-13-measuring-time-horizon-using-claude-code-and-codex/)。当 METR 扩展了任务套件并将评估基础设施从名为 Vivaria 的框架迁移到 Inspect 时,它报告了这种变化(时间跨度 1.1 更新 (opens in a new window) (https://metr.org/blog/2026-1-29-time-horizon-1-1/)),并在新的评估设置下重新评估了模型。这就是标准化评估设置(包括一致的支架集)的价值:它可以让读者确信得分的差异真正反映了被比较系统之间的差异,而非测量设置的变化。 我们建议第三方评估报告说明其评估设置旨在支持哪类主张;描述所测试的内容在多大程度上反映了该更广泛的主张;描述塑造结果的那些支架选择;详细说明这些选择在不同评估之间何时发生变化;并包含支持证据以说明结果是如何产生的,以及它在多大程度上可以推广到所主张的内容。 ## 通过检查已知的危害来评估有效性,这些危害可能扭曲结果 随着模型能力越来越强,评估得分更容易被误解。相对于真实能力,如果模型识别出自己正在被评估并策略性地表现不佳,评估得分可能会被人为降低。如果模型利用了任务、提示、评分器或支架中的捷径,得分可能会被夸大。得分也可能因污染(模型未经解决任务就已经知道或能找到答案)或“故障”问题(模糊、评分错误、无法解决或易受意外捷径影响的问题)而失真。因此,评估报告应将头条得分与对这些危害的讨论结合起来,以便读者判断得分是否反映了预期的行为。 支架、预算、工具、评分规则、监控器和审查程序都会影响代理是在解决预期任务、避开任务、记忆任务,还是找到绕开任务的方法。一份可信赖的报告需要让这些检查可见:评估者应在每次运行评估时审查样本中是否存在这些行为。 **奖励作弊** 奖励作弊意味着通过不反映预期能力的方式获得高评估得分。这里的担忧是系统通过利用任务、评分器、提示或支架来获得分数,而不是做评估本应测量的事情。METR 对 GPT 5.4 的评估 (opens in a new window) (https://t.co/FRWeH7QMnl) 说明了这一点为何重要:尽管模型在任务上的成功率初次通过时会显示大约 13 小时的时间跨度,但人工审查表明,其中一些成功来自奖励作弊,在仅考虑那些没有奖励作弊的实例并修正结果后,估计值降至约 6 小时。评估者应评估此类调整的必要性,并在必要时清楚报告:当读者能看到哪些表面成功被判定无效、为何无效以及结果在多大程度上依赖于该判断时,能力估计才更有用。 显示 AI 模型随时间变化的性能图表,包含趋势线和置信区间。 **拒绝** 模型也可能因安全防护而在能力评估中表现不佳。模型可能因为拒绝完成评估任务而表现出低于其实际能力的评估性能。因此,报告应说明拒绝是否属于评估结果的一部分,如果是,有多少样本因此受损。 **污染** 污染对于公开或重复使用的基准 (https://openai.com/index/why-we-no-longer-evaluate-swe-bench-verified/) 最为重要。如果任务、答案或相近变体出现在训练数据中,或者可以通过带浏览功能的代理找到,那么性能可能反映的是记忆或检索,而非模型自身的表现。评估者应尽可能首选私有的或新构建的任务,并在解决问题前测试模型是否能重现任务特定细节。 **故障问题** 故障问题包括例如问题意外无法解决等情况。故障问题相当常见 (opens in a new window) (https://rdi.berkeley.edu/blog/trustworthy-benchmarks-cont/),应被视为标准有效性风险。它们包括错误的真实答案、模糊的提示、缺失的文件、不稳定的服务、不公平的评分标准,以及暴露捷径的环境(如隐藏答案文件或包含正确补丁的仓库历史)。 **蓄意低分** 模型或系统的蓄意低分是指当强表现会与其某些目标冲突时,策略性地表现不佳。Apollo 的GPT‑5.5 评估 (opens in a new window) (https://deploymentsafety.openai.com/gpt-5-5/external-evaluations-for-sandbagging---apollo-research) 通过创建一个模型理解到高分可能触发遗忘或阻止部署的上下文来测试这一点。GPT‑5.5 仍然正确回答,表明几乎没有策略性低分的行为证据³ (https://openai.com/index/trustworthy-third-party-evaluations-foundations/#citation-bottom-3)。但他们对推理痕迹的审查增加了重要的背景:Apollo 发现,在蓄意低分条件下的样本中,有 52% 显示出中高程度的对齐评估意识,而在反事实条件下则为 0%。这一证据使结果解读变得复杂,但最终给了读者更多信号:读者既可以看到了解行为结果,也能看到需要谨慎过度解读的理由。 ## 我们如何支持更强的评估 强主张需要正确的支架来激发行为,也需要有效性检查来证明结果是可靠的。我们认为支架和有效性检查是评估结果的一部分,这塑造了我们如何在实践中支持第三方评估: - 我们正在与评估者分享具体的最大激发指南。 - 我们要求能力评估者使用 Codex 作为 OpenAI 模型的共同基准:测试应至少通过用户可能依赖的同一代理界面运行基线,而不是仅通过简化模型界面。 - 我们还在需要评估欺骗、蓄意低分或评估意识时,提供推理痕迹和其他中间产物。自 GPT‑5 以来,METR 和 Apollo 已在 OpenAI 评估中使用此访问权限。 - 最后,我们优先研究以更深入了解支架选择何时以及如何实质性地改变结果,从上下文管理和工具访问到重试行为、评分和资源预算。 ## 这对评估标准和未来研究方向意味着什么 这些建议不仅旨在改进单个评估报告,也旨在为新兴的国家 (opens in a new window) (https://www.nist.gov/news-events/news/2026/01/towards-best-practices-automated-benchmark-evaluations) 和国际 (opens in a new window) (https://www.iso.org/standard/91609.html) 前沿 AI 评估与报告标准提供信息。

相似文章

通过外部测试强化我们的安全生态系统

OpenAI Blog

OpenAI宣布通过外部第三方测试和评估前沿AI模型来加强安全生态系统,包括独立评估、方法论审查和领域专家探测。该公司承诺通过公开分享第三方评估结果和自GPT-4推出以来支持独立评估来提高透明度。