统一AI安全阈值

arXiv cs.AI 论文

摘要

本文提出了一种方法,用于在领先AI公司之间推导统一的安全阈值,以解决现有阈值的不一致性,涵盖滥用风险和自动化AI研发,并指出了实证方面的不足。

arXiv:2607.16112v1 公告类型:新 摘要:前沿AI公司已发布的能力阈值存在显著差异,使得第三方难以验证某个阈值是否已被跨越,或在不同公司之间比较要求。此外,没有共同的最低阈值,风险缓解可能不一致,从而在安全标准方面形成潜在的逐底竞争。我们开发了一种方法,用于在三个风险领域推导统一的阈值。对于滥用风险(网络和生物),我们以预期危害作为关键基础,并采用显式风险建模方法,考虑风险渠道和模型发布条件。对于自动化AI研发,我们提出的阈值基于观察到的AI进展速度,而非预期危害。我们的分析扩展了先前的工作,并指出了现有的实证差距和局限性。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:23

# 协调AI安全阈值
来源:https://arxiv.org/html/2607.16112
Wilber Sean Anterola¹,Matthew Ball,Luis F. Lafuerza,Markov Grey²
¹布朗大学
²人工智能安全中心(CeSIA)

###### 摘要
前沿AI公司已发布的能力阈值差异巨大,导致第三方难以验证某个阈值是否被突破,也难以跨公司比较要求。此外,缺少通用的最低阈值可能导致风险缓解措施不一致,从而引发安全标准逐底竞争。我们开发了一种方法论,用于在三个风险领域推导协调一致的阈值。对于滥用风险(网络和生物),我们将预期危害作为关键基元,并使用显式风险建模方法,考虑风险渠道和模型发布条件。对于自动化AI研发,我们基于观察到的AI进展速度而非预期危害来提出建议阈值。我们的分析扩展了先前工作,并指出了现有的经验空白和局限性。

## 1 引言
多家前沿AI公司已制定了安全框架,定义了触发增强安全、安保或治理措施的危險能力阈值(Anthropic,2026d (https://arxiv.org/html/2607.16112#bib.bib7);Google DeepMind,2025 (https://arxiv.org/html/2607.16112#bib.bib16);OpenAI,2025b (https://arxiv.org/html/2607.16112#bib.bib36))。这些框架依据《首尔前沿AI安全承诺》(所有前沿AI公司均已采纳)作出承诺,并且正越来越多地被新兴立法所要求,包括欧盟AI法案和加利福尼亚州SB-53。特别是首尔承诺,呼吁AI公司“*设定阈值,当模型或系统带来的严重风险(除非得到充分缓解)被认为不可容忍时,触发相应措施*”(英国政府,2024 (https://arxiv.org/html/2607.16112#bib.bib44))。然而,AI公司以临时方式制定阈值,理由不充分,导致阈值格局碎片化。这些阈值在范围、特异性乃至其处理的风险类别上均存在显著差异¹¹¹多位研究人员已在结构层面对这些框架进行了编录和比较(Ziosi等人,2025 (https://arxiv.org/html/2607.16112#bib.bib48))。例如,METR对十二项已发布的安全政策中的共同要素进行了编录(METR,2025 (https://arxiv.org/html/2607.16112#bib.bib26));他们发现,12项政策中有9项存在能力阈值,9项存在停止部署的条件,8项存在停止开发的条件,9项存在评估频率要求,所有12项都存在问责机制。然而,METR指出,“尽管存在共性,但每项政策都是独特的,反映了不同的AI风险管理方法”。这些阈值的运作方式也各不相同。公司通常依赖内部的专有测试,使得第三方难以验证某个阈值是否已被突破。前沿公司还面临一个协调问题:如果其他公司不采取类似的保护措施,其自身的安全措施效果就会大打折扣²²²公司自身也承认这一点。Anthropic将安全描述为“一个集体行动问题”,其中“来自AI的灾难性风险总体水平取决于多个AI开发者(而非仅一家)的行动”(Anthropic,2026c (https://arxiv.org/html/2607.16112#bib.bib4))。Google DeepMind表示,其框架“只有在所有相关组织提供类似水平的保护时,才能为社会带来有效的风险缓解”(Google DeepMind,2025 (https://arxiv.org/html/2607.16112#bib.bib16))。OpenAI通过“边际风险”概念,将其风险评估条件于其他参与者的行为(OpenAI,2025b (https://arxiv.org/html/2607.16112#bib.bib36))。这些差异可能导致风险缓解措施不一致以及安全标准逐底竞争。困难不仅在于阈值不同。由于阈值通常无法比较或不可审计,一家公司可以在声称满足与其竞争对手类似的安全承诺的同时,为其特定的部署速度或访问模型提供理由。如果一家公司采用更弱或更难验证的触发条件,其他公司就会面临压力去效仿它,而不是维持更严格的安全保障。这迫切需要制定跨公司一致且可公开评估的最低阈值;共同的底线通过使最低触发点变得可比、可独立评估,并在存在执行机制时对可信后果开放,来减轻这种压力。本文旨在为定义共同风险阈值提出想法。我们用*协调*来指代一个共同的最低底线及其共享的测量程序。该程序允许现在跨公司比较和独立审计阈值,并在建立具有审计权和后果的监督机构后予以执行,同时仍允许任何公司采用更严格的内部阈值。我们聚焦于主要前沿公司追踪的三个风险类别:网络风险、生物风险和自动化AI研发。我们将前两个类别与第三个类别区别对待:网络和生物风险涉及特定的滥用路径,而自动化AI研发不与某个特定的危害路径相关联,但可能加剧其他前沿AI风险,例如权力集中、AI系统失控以及其他与对齐相关的风险。先前的工作已在结构层面编录和比较了前沿AI公司的框架,识别了已发布安全政策中的共同要素(Ziosi等人,2025 (https://arxiv.org/html/2607.16112#bib.bib48);METR,2025 (https://arxiv.org/html/2607.16112#bib.bib26))。我们的论文在此基础上,开发了一种方法论,用于将异构的阈值语言转化为共享的、可比较的形式,并将其应用于三个领域,评估协调在哪些方面当前是可行的,哪些方面需要进一步分析,以及哪些方面已经可以实现。我们的主要贡献在于这种转换框架:一种将异构的前沿公司阈值语言转化为可审计的定量底线的程序,以及每条底线所需的审计证据。这三个领域说明了该框架可能产生的输出范围。网络领域展示了一个可处理的预期危害应用,但存在我们明确指出的显著校准不确定性。在生物风险方面,该框架作为诊断工具运作:应用它识别出了目前阻碍制定合理底线的具体缺失证据,而非产生一个政策就绪的数字。对于自动化AI研发,我们得到了一个可操作的进展速度底线,该底线已经涵盖了所有三家主要公司的语言表述。结果是一种用于比较、审计和协调的方法,而非一套完整的、最终验证过的校准参数。下一节概述了核心方法论,包括如何应用该框架。第3节 (https://arxiv.org/html/2607.16112#S3) 和 第4节 (https://arxiv.org/html/2607.16112#S4) 将该方法论应用于网络和生物风险。第5节 (https://arxiv.org/html/2607.16112#S5) 详细说明了自动化AI研发的方法论。第6节 (https://arxiv.org/html/2607.16112#S6) 总结全文。

## 2 核心方法论
本节概述了推导协调一致的AI风险阈值的核心方法论。目标是比较前沿公司提出的各种表述,并提出一个能够涵盖它们的定量限制,或者一种更原则性地推导这类限制的程序。推导出的阈值应支持公司间的直接比较、第三方审计,并最终支持执行。我们对滥用风险和自动化AI研发采用不同的方法。

**滥用风险**是指AI系统协助人类行为者造成危害的风险,如网络攻击或生物武器开发。我们认为,这些风险的阈值应将预期危害作为关键基元,并使用考虑风险渠道和模型发布条件的显式风险建模。这种方法建立在现有工作的基础上。Koessler 等人 (2024 (https://arxiv.org/html/2607.16112#bib.bib24)) 推荐将预期危害作为滥用阈值的自然度量单位,而 Murray 等人 (2025 (https://arxiv.org/html/2607.16112#bib.bib34)) 的定量风险建模方法论提供了一条从场景定义到预期危害估计的结构化六步路径。在政策方面,诸如加利福尼亚州SB-53和纽约州RAISE法案等新兴立法要求公司缓解灾难性风险,这些风险被定义为对导致超过50人死亡或严重伤害或超过十亿美元损害有实质性贡献的风险(加利福尼亚州立法机构,2025 (https://arxiv.org/html/2607.16112#bib.bib10);纽约州立法机构,2025 (https://arxiv.org/html/2607.16112#bib.bib11))。我们将该方法应用于两个具体的滥用风险:网络和生物风险。对于每个领域,我们将风险分解为一组代表性场景,构建风险模型(区分没有AI的基线危害与AI带来的额外危害),识别作为AI能力代理的关键风险指标(如基准测试分数),并将这些指标映射到风险模型参数。输出是一个预期危害估计,该估计既依赖于模型能力,也依赖于部署条件,并且可以随着更好的数据和更强的评估出现而更新。对于网络领域,我们使用公开可用的事件数据、网络靶场评估和行动者-路径分解来校准此模型。对于生物领域,我们应用相同的结构,但发现现有证据基础过于薄弱,无法支持定量的底线——这一发现也是 Murray 等人 (2025 (https://arxiv.org/html/2607.16112#bib.bib34)) 自身所预期的。接下来的两个小节概述了每种情况的技术方法。

### 2.1 预期危害模型
对于滥用领域,我们对每个攻击路径 \(j\) 建模预期危害为:

\[
E[H_j] = N_j \times P_{\mathrm{success}, j} \times h_j
\]
(1)

其中 \(N_j\) 是每年预期的攻击等效量(即路径 \(j\) 每年独立攻击尝试或机会的次数),\(P_{\mathrm{success}, j}\) 是成功攻击的概率,\(h_j\) 是每次成功事件在预定义的、领域特定的危害单位中的预期危害。所有路径的总AI带来的额外危害为:

\[
\Delta E[H_{\mathrm{AI}}] = \sum_j \left( E[H_{j,\mathrm{AI}}] - E[H_{j,\mathrm{baseline}}] \right)
\]
(2)

当考虑不同的发布条件 \(r\)(开放权重、公共API、可信API等)时,我们做出以下简化假设:

\[
E[H_{\text{AI}, r}] = s_r \times E[H_{\text{AI}}]
\]
(3)

其中 \(s_r\) 是暴露标量:在发布条件 \(r\) 下相对于公共API访问的AI带来危害,公共API设置为1。受限条件低于1,而开放权重可能超过1,因为不受限制的访问允许复制、微调、移除安全层以及集成到自动化工具中,所有这些都可能放大超越公共API基线之上的暴露。该标量是一个无量纲的相对暴露乘数,而非有界于1的分数。

### 2.2 自动化AI研发
对于自动化AI研发,我们不对特定的危害路径进行建模。相反,我们提出一个程序来识别AI进展速度的显著提升。该程序包含三个步骤:(1) 量化AI进展;(2) 确定AI进展速度的基线趋势;(3) 确定某个模型是否打破了进展趋势。这些步骤详见第5节 (https://arxiv.org/html/2607.16112#S5)。

## 3 网络风险
本节将现有的公司网络阈值语言转化为预期危害这一通用单位。目的不是取代能力阈值决策,而是用不同发布条件下额外的预期年度危害来表达这些决策所隐含的内容。按照 Koessler 等人 (2024 (https://arxiv.org/html/2607.16112#bib.bib24)) 的说法,此计算属于风险阈值方法论的第(2)步:使用风险模型来为能力阈值应设置在何处提供信息,并明确审计要求。它不决定发布决策。所有参数值、路径分配、成功概率、攻击量和发布条件标量均为作者为演示目的校准的先验值。成熟的版本会将它们替换为通过IDEA启发获得的估计值、历史事件数据、网络靶场证据以及经过审计的安全防护性能测量值。

### 3.1 现有阈值语言
表I (https://arxiv.org/html/2607.16112#S3.T1) 复制了来自三家主要前沿AI公司的逐字网络阈值语言。

**表 I:主要AI公司的逐字网络阈值语言。**
来源:Anthropic RSP v3.0;GDM FSF v3.0;OpenAI PF v2。

由此可以得出三点观察。首先,Anthropic 没有网络阈值。RSP v2.2 推迟了其确定;RSP v3.0 完全删除了该类别。评估仍在继续,但缺乏触发安全措施的政策承诺。其次,OpenAI的“高”级别和GDM的单一阈值描述了大致相同的危害:为攻击防御目标提供有意义的能力提升,从而实现大规模攻击,这使得在此水平上进行协调是可行的。第三,OpenAI的“关键”级别没有GDM或Anthropic的对应项;目前无法实现“关键”级别的协调。GDM的阈值是面向结果的:它在额外危害达到严重规模时触发。OpenAI的阈值是面向能力的:它根据模型能做什么来触发。这种结构性差异意味着,相同的模型能力可能同时满足OpenAI的“高”级别,但尚未触发GDM的阈值。因此,本节其余部分将协调视为一个转换问题:必须将能力证据映射为指定发布条件下的预期年度危害。表II (https://arxiv.org/html/2607.16112#S3.T2) 记录了每家公司的这种阈值类型分类。

**表 II:网络安全领域的阈值类型分类。**

### 3.2 证据基础与校准选择
鉴于上述阈值结构,网络校准需要两个不同问题的证据:基线危害的大小以及可能合理增加该危害的模型能力。第一个问题涉及网络危害的全球基线,应锚定于全球网络犯罪损失的总估计值,而非仅已报告损失。2026年初的一项估计将全球网络犯罪损失定为每年约5000亿美元,90%置信区间为1000亿至1万亿美元(Lukosiute 等人,2026 (https://arxiv.org/html/2607.16112#bib.bib25))。该数字本身是综合性的。Lukosiute 等人 (2026 (https://arxiv.org/html/2607.16112#bib.bib25)) 调查了27项先前估计,并三角验证了三个独立来源:一项英国企业受害调查和一项美国个人受害调查(均按全球规模缩放),以及将全球网络安全支出作为防御成本代理。其危害构成涵盖直接损失、响应成本和防御支出,并排除了更难衡量的成本,如知识产权盗窃和声誉损害。这种构成与稍后用作基准的SB-53触发条件并不完全一致:它在某个方向上更宽泛(计入了防御支出),但在

相似文章

为什么负责任的AI开发需要在安全问题上进行合作

OpenAI Blog

OpenAI发布了一份政策研究论文,确定了四项战略来改进行业在AI安全规范方面的合作:传达风险/收益、技术协作、提高透明度和激励标准。该分析论述了竞争压力如何可能导致对安全性的投资不足,并提出了协调激励措施以促进安全AI开发的机制。

AI安全与对齐

Reddit r/artificial

文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。

前沿AI监管:管理新兴的公共安全风险

OpenAI Blog

OpenAI提议了一个针对可能造成公共安全风险的「前沿AI」模型的监管框架,倡导制定标准流程、注册/报告要求和合规机制,包括部署前风险评估和部署后监测。