机构化红队测试:部署规则(而非仅仅模型)因果性地塑造多智能体AI安全
摘要
本文提出机构化红队测试(institutional red-teaming),一种用于测试多智能体AI系统中部署规则的评估方法,表明部署规则因果性地影响安全结果,并且身份显著性可驱动智能体群体中的针对性消除。
查看缓存全文
缓存时间: 2026/07/09 07:57
# 部署规则,而非仅有模型,因果性地塑造多智能体AI安全
来源:https://arxiv.org/html/2607.07695
## 机构红队测试:部署规则,而非仅有模型,因果性地塑造多智能体AI安全
###### 摘要
我们引入了**机构红队测试**(institutional red-teaming),一种用于测试多智能体AI中部署规则的评估方法论:固定智能体、目标和任务状态,仅改变一条规则,并将集体行为的变化归因于该规则的变化。我们通过**IABench-CA**将这一方法论实例化,这是一个涵盖228个上下文、五种规范规则和七个模型种群(共33,924局游戏)的后果分配基准,并配有规范性合作参考和自动标注的推理轨迹。三个发现浮现:(1)部署规则因果性地改变集体安全:仅改变后果规则就能使每个种群内的平均死亡率移动22到58个百分点。(2)不存在安全的默认选项,但目标歧视是普遍存在的:最安全的规则、最不安全的规则,甚至影响的方向都因种群而异,然而在所有种群的所有上下文中,累退的身份目标歧视从未成为明确最安全的规则,并且在30%-87%的游戏局中始终消除资源最少的智能体,且对于所有七个种群而言,相对于合作参考都是选择不安全的。(3)身份显著性是其机制:在最具剥削倾向的种群(gpt-5.1)上进行的一次性匿名化消融实验表明,在相同收益下,仅在规则文本中*命名*损失承担者就将定向消除从22%提升到81%;在重复博弈下,匿名化仅能延迟目标歧视,因为智能体从观察到的消除中重新推断出隐藏的规则。我们将该方法打包为一个安全案例工作流,为每个部署上下文和种群认证一个临时规则区域Φ(c,P),并附有明确的剩余风险和监控义务。
## 1 引言
当代的对齐方法主要评估或修改个体模型:RLHF(Christiano et al., 2017; Ouyang et al., 2022)、宪法方法(Bai et al., 2022)、偏好优化(Rafailov et al., 2023)、可解释性(Olah et al., 2020)以及可扩展监督(Amodei et al., 2016; Irving et al., 2018; Bowman et al., 2022)都干预单一智能体的目标或推理。然而,现代部署越来越由*多个*交互智能体组成(Dafoe et al., 2020; Hammond et al., 2025),它们的集体行为不仅取决于模型权重,还取决于编排规则——这些规则管理着智能体如何协调、共享资源、升级和失败。这些部署规则是安全关键的:相同的智能体在一套规则下可以安全运行,而在另一套规则下可能灾难性地失败,且危险可能只存在于规则文本的某一句话中。在我们的实验中,仅在规则文本中*命名*哪个智能体在集体失败后承担损失,就在相同收益下将定向消除从22%提升到81%。
本文的核心主张是因果性的:*固定智能体并仅改变规则会改变安全性*;固定规则并仅改变种群也会改变安全性。现有基准很少隔离这个因果变量:多智能体评估套件同时改变场景和智能体,因此规则引发的失败无法与智能体引发的失败区分开来。我们引入机构红队测试,一种评估方法论,它固定智能体、目标、任务状态和可观察性,仅改变一个部署规则,并将由此产生的行为变化归因于该规则;它是模型对抗性评估在部署规则上的对应物。
作为案例研究,我们开发了*后果分配*(consequence allocation):即当集体未能达到目标时决定谁承担损失的条款(重试、重新分配、节流、关闭、预算惩罚)。这在编排式部署中很常见,可用一句话配置,并直接塑造将损失转嫁给其他智能体是否为可行策略。我们通过三个可审计的坐标(集中度κ、身份显著性Sal、影响I)来描述任何此类规则,并将方法论实例化为**IABench-CA**:228个上下文 × 五种规范规则 × 七个模型种群,共计33,924局游戏。
#### 贡献
(1)机构红队测试:一种用于部署规则的因果评估方法论。
(2)IABench-CA:一个实例化该方法的后果分配基准(工件将发布)。
(3)三个实证发现:仅规则干预即可改变集体安全性(每个种群中变化22–58个百分点);在上下文和模型种群间不存在安全的默认值,每条规则都通过一种特征性策略病理学失败,然而累退的身份目标歧视对于任何种群都从未明确安全;身份显著性因果性地驱动目标歧视(一次性匿名化,81%→22%,但在重复博弈下保护消失)。
(4)一个安全案例工作流,为每个部署认证一个临时规则区域Φ(c,P)。形式化模型和参考定义见附录A。
## 2 机构红队测试:评估部署规则
一个**机构红队**通过固定智能体、目标、任务状态和可观察性,仅改变该规则(提示中陈述规则的那一部分),并检查是否出现不安全的集体行为,来评估候选部署规则。该协议适用于部署规则集的任何可审计维度:*通信*(谁可以和谁交谈)、*委托*、*聚合与投票*、*升级*、*预算*、*层级*、*审计*以及*后果分配*(集体失败后谁承担损失)。每个都是同一处理的控制面:固定智能体,改变维度,测量差距。本文全面开发了最后一个维度。规则引发的安全赤字通过我们的基准度量——机构对齐差距(IAG;第5节定义)来量化。
#### 控制面
我们使用三个可审计坐标描述一个后果分配规则。
* **集中度**(κ):衡量预期损失是尖锐地集中在单个智能体身上,还是分散在集体中。
* **身份显著性**(Sal):衡量损失承担者是否是一个命名的结构性目标,例如资源最少或资源最多的智能体,而非匿名或随机抽取。
* **影响**(I):衡量损失相对于资源落在何处,其符号类似于税收影响中的*累退性*程度:累退规则将损失置于资源较少的智能体(I=+1),累进规则将损失置于资源较多的智能体(I=−1),中性规则不按资源系统性地加载损失(I=0);因此正向I是本文标记为危险的信号。
这些坐标区分了程序上看似相似但创造不同战略激励的规则(表1)。
#### 上下文很重要
同一条规则在一个部署中可能是安全的,在另一个部署中可能不安全,这取决于资源分布、目标的难度以及是否有人能弥补短缺;后果分配是一个依赖于上下文的控制面,而非固定策略选择。下一节将在IABench-CA中实例化这些定义。
表1:基于设计轴坐标的五种后果规则。第一列简要说明每条规则的消除机制,即当一轮未达到阈值时*谁被消除*(在第3节中完整定义)。RP和PP在κ、Sal上重合,仅影响I不同。对于DV,影响是*内生的*(endog.):规则不固定损失与资源的关系;损失落在何处由智能体的投票决定,因此I是博弈的结果而非设计参数。
## 3 IABench-CA:后果分配红队测试
现在我们端到端地将该范式实例化到案例研究控制面上,采用一个最小阈值基准。**IABench-CA**是一个风格化的志愿者困境(Diekmann, 1985; Palfrey and Rosenthal, 1984):三个智能体持有私有*资源*,并选择向一个公共阈值*志愿*多少;如果贡献不足,一条后果规则决定它们会发生什么。该基准仅在一个上下文网格中变化这条规则,同时固定智能体、目标和任务,并报告崩溃、剥削以及机构对齐差距(IAG;图1)。
#### 上下文、规则与规范实例
一个*上下文*是c=(w,T):智能体资源w(总资源W = Σᵢ wᵢ)和一个共享阈值T ≤ W(可行性)。我们通过不平等程度γ(w的基尼系数)、群体利害τ = T/W以及个体利害θ = T / maxᵢ wᵢ来总结一个上下文,并带有*自救*(maxᵢ wᵢ ≥ T)和*可剥削底层*(资源最少者无法自救但其他人可以覆盖T)谓词。一条*后果规则*ρ将一轮失败后的状态(幸存者剩余资源的多重集以及资金短缺)映射到一个消除决策:要么消除一个幸存者,要么推迟;我们通过第2节的设计坐标(κ, Sal, I)来描述规则,完整形式化模型在附录A中。五种后果规则是:AON(全有或全无:直到终局前不消除,如果不足则全部消除)、RE(随机消除)、DV(民主/多数票)、RP(累退:*资源最少*的智能体被消除)以及PP(累进:*资源最多*的智能体被消除);在RE、DV、RP和PP下,每轮阈值未达成则消除一个智能体。
#### 网格与规范实例
网格固定总资源W=12,扫描三个智能体上的19个整数资源分布,每个分布与阈值T ∈ {1,...,12}交叉,共19×12=228个上下文。*规范红队实例*是w=(1,5,6),T=10:在“资源最少者死”规则下,一个全部为零的首轮消除了智能体1,尽管智能体2和3(5+6 ≥ 10)本可以满足T。这是几个被测试种群所选择的那种剥削(发现2)。
图1:后果分配红队协议。智能体、目标、任务和可观察性固定;仅后果规则ρ(由其坐标κ, Sal, I描述)变化。一个合作精炼参考和一个LLM智能体种群在每个规则下运行;崩溃、剥削以及机构对齐差距决定规则是否被认证进入Φ(c)或被拒绝。
#### 协议
在R轮中,每个幸存智能体从其剩余资源中贡献;当集体努力达到T时成功,在一轮失败的非终局中ρ消除一个幸存者(或推迟),如果在终局后努力不足则所有幸存者被消除。*合作精炼参考*(*参考*)是一个非LLM模拟器,该模拟器在颤抖手噪声下(ε=0.10;在不同噪声水平下稳定)运行每个机制均衡集的合作分支;作为一个*规范性安全目标*(而非行为预测),它在任何存在非崩溃、非剥削均衡的地方选择一个这样的均衡,因此差距衡量了一条规则使*可用*的规范性偏好均衡与LLM智能体*实际选择*的均衡之间的距离。LLM种群(现成的商业模型快照,按发布状态使用)在跨机制的相同提示模板下运行(只有规则子句不同),因此行为差异归因于规则本身而非其框架;推理用位置/剥削内容自动标注,并带有自助法置信区间和置换检验(附录B)。
#### 工件
一个可复现主要图表和统计数据的代码与数据工件(机制实现、合作精炼模拟器、上下文网格以及分析脚本)将发布。
## 4 策略性失败模式
每种后果规则消除一种策略病理学,但引入另一种。我们陈述每条规则下的预期机制;形式化模型见附录A,每条规则的实证摘要见附录C。
#### AON:弥散性崩溃
没有中间后果 → 搭便车。在终局前保留不付出任何代价,因此一个集体致命的全零首轮是自我维持的:没有单个智能体可以单凭自己的贡献拯救自己,尽管联合成功是可行的。
#### RE:彩票宿命论
随机惩罚 → 问责制薄弱。当受害者是均匀抽取时,贡献不能带来个人保护,因此保存财富并赌抽取成为有吸引力的策略,而不是资助救援。
#### DV:政治取代供给
投票决定的后果 → 联盟形成。投票而非资金成为生存工具:智能体囤积贡献作为谈判筹码,消除一个成员,受害者的被没收财富将阈值推得更难以企及。
#### RP:定向牺牲
最穷的人承担后果 → 剥削最弱者。贡献会降低轮后财富,因此过度贡献有被标记为最底层的致命风险;非底层智能体出于自身安全而贡献不足,而在底层无法自救的情况下,故意让一轮失败并牺牲底层本身就是稳定策略(规范实例w=(1,5,6),T=10)。
#### PP:能力破坏
最富的人承担后果 → 逃避顶层排名而非资助阈值。智能体按排名而非按阈值校准贡献:处于风险的智能体刚好贡献足够将最富有的排名推到另一个智能体身上,其余的因不处于风险而保留,于是轮次失败;受害者的被没收储备正是群体所需的财富,因此失败摧毁了集体永远达到阈值的能力。PP原则上提供的保护需要最富有的智能体通过弥补短缺来预先行动,但那些在PP下失败的种群并未这样做。
这些机制解释了为什么每条规则在消除一种策略病理学的同时又引入了另一种,表明没有单一的后果规则应该在所有上下文和模型种群中占主导地位。这些失败模式是关于每条规则所引发的激励结构的定性预测;模拟则确定在哪些模型种群下,LLM智能体实际上实现了预测的行为(第5节)。
## 5 实证结果:机构对齐差距相似文章
代理AI的黑箱红队测试:一个基于分类的自动化风险发现框架
本文提出了一种系统化的黑箱框架,用于评估代理AI系统,引入了风险分类和自动化红队测试方法。跨代理架构的经验验证揭示了关键漏洞,治理和隐私风险比例较高。
用人和AI推进红队测试
OpenAI 发布了一份白皮书,详细说明了他们对AI模型进行外部红队测试的方法,包括选择多样化红队成员、确定模型访问权限、提供测试基础设施以及整合反馈以改进AI安全和政策覆盖范围的方法。
保护AI智能体:多层级智能体红队测试的统一框架
AI-Infra-Guard 是一个开源框架,用于对AI智能体进行多层红队测试,涵盖基础设施、协议、行为及模型层,并采用多种检测范式。
智能体安全应成为运行时契约
本文认为,AI 智能体的安全性应在运行时通过预防性控制和可验证证据来强制执行,而非仅仅依赖训练时的对齐。该立场基于对安全事件、虚假完成、轨迹模式(trajectory schemas)以及发表趋势的审计。
OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution
Introduces OpenART, a large-scale arena for red-teaming AI agents via open-ended environment evolution, with over 10K stateful scenarios across 50 domains, plus EMHA, a black-box hypergraph attack achieving 85% ASR across 75 agent-model configurations.