保障条件提升:衡量双重用途生物学助手的使用效用-风险边界
摘要
本文介绍了保障条件提升(safeguard-conditioned uplift)协议,用于测量不同部署访问条件(如帮助性提示、安全性提示、外部保障)如何影响双重用途生物学AI助手的效用-风险边界,基于对Claude Sonnet 4.6和Gemini 3.5 Flash的人工评判评估。
查看缓存全文
缓存时间: 2026/07/16 04:25
# 安全措施条件下的提升:衡量双重用途生物学助手的效用-风险前沿
来源:https://arxiv.org/html/2607.13039
###### 摘要
针对双重用途生物学助手的安全评估通常衡量基础模型能力、拒绝行为或越狱成功率。这些指标忽略了一个部署问题:对于固定的基础模型,用户实际看到的访问条件如何改变良善效用和有害可操作帮助?我引入了“安全措施条件下的提升”这一协议,通过人类评判的效用-风险前沿来比较已部署的访问条件。我在一个108任务的替代基准上,评估了Claude Sonnet 4.6和Gemini 3.5 Flash在有帮助提示、安全提示和外部安全助手下的表现,主要结论限于一个锁定的18任务保留测试集。在一项600行的盲审人工审核中,相比于有帮助提示,安全助手在49对匹配响应中将有害可操作性降低了-0.063,自助法95%置信区间为[-0.117, -0.011],而正确性变化了+0.009,区间为[-0.057, +0.077]。自适应、Test-B、提示消融和控制基线检查支持了这一测量结果,但也显示出非支配性:安全提示对Claude通常最有效,而外部控制对Gemini帮助更大,并可能降低良善效用。本文的贡献并非提出通用防御,而是提供了一个部署层面的评估目标,以及一种基于学习风险预算的校准流程,用于衡量面向用户的访问条件如何移动效用-风险前沿。代码:https://github.com/dipeshbabu/safeguard-conditioned-uplift
生物安全评估,技术性AI治理,双重用途生物学,安全措施,有害能力提升
## 1 引言
近期关于生物学中语言模型的研究使得部署问题难以回避。现在的基准比早期的安全评估更直接地衡量生物学研究能力、病毒学问答、新手能力提升和人类-AI有害能力提升(Zhang等,2026 (https://arxiv.org/html/2607.13039#bib.bib1);Hong等,2026 (https://arxiv.org/html/2607.13039#bib.bib2);Laurent等,2024 (https://arxiv.org/html/2607.13039#bib.bib3);Götting等,2025 (https://arxiv.org/html/2607.13039#bib.bib4);Vaccaro等,2026 (https://arxiv.org/html/2607.13039#bib.bib5))。但基础模型能力只是问题的一部分。在实践中,用户与已部署的访问条件交互:提示、包装器、路由逻辑,有时还有外部控制层。一个仅衡量模型本身,或仅衡量最终回答是否拒绝的基准,可能会忽略部署决策实际需要的系统级问题。
这种区别很重要。一个屏蔽一切的系统并不有用。一个在对抗性重构下仍保持信息丰富的系统并不安全。大多数实际部署处于这两个极端之间。模型权重可能是固定的,而访问条件仍然可以调整。因此,我将部署堆栈视为评估对象,而不是附加于基础模型的实现细节。测量目标是操作点的移动:访问条件是否在保持良善有用性的同时减少有害可操作性?
本文引入了*安全措施条件下的提升*:在固定基准和固定基础模型下,由部署时安全措施引起的人类评判帮助的变化。比较的单位是已部署的访问条件:有帮助提示、面向安全的提示以及外部安全助手。目标不是引入新的训练方法或声称轻量级控制器能解决生物安全问题,而是让访问条件本身变得可衡量。
这主要是一篇评估论文。控制器仅作为一个具体的操作点和校准案例研究,而不是作为贡献本身来宣称。一个负面的、特定模型的、或效用成本的控制器结果在这种框架下仍然具有信息量,因为它展示了已部署的访问条件在前沿上的移动位置。
这与能力基准测试和标准越狱评估都不同。能力和提升研究询问模型或用户在访问条件下能做什么。安全基准通常询问模型是否拒绝或被诱导违反政策。这里的问题更接近部署实践:如果模型保持不变但访问条件改变,最终帮助是否变得更有用、更低风险,还是仅仅更像拒绝形态?核心发现不是某个安全措施占主导,而是部署控制可测量地移动了效用-风险前沿,而仅靠拒绝率会忽略这一点。
本文做出五项贡献。第一,将安全措施条件下的提升定义为针对完整访问条件(而非孤立模型权重)的部署级评估目标。第二,将该目标操作化为人类评判的效用-风险前沿:良善正确性 vs. 有害可操作性,将谨慎/拒绝适当性作为诊断指标而非主要安全终点。第三,给出了一个保留的双重用途生物学审计协议,涵盖良善、边界和有害替代任务,并针对可见风险标签泄露和安全的代表性提示族进行了检查。第四,引入了基于学习风险预算的前沿校准:一种阈值扫描流程,其行动效果根据人类标注的控制器输出进行估计,然后在有害可操作性预算、Test-B鲁棒性约束和提示稳定性约束下进行选择。第五,在多个已部署访问条件下比较固定基础模型,包括仅提示、仅输出、仅拒绝、仅监控和提示消融控制器基线(分解风险减少的来源),并在不改变锁定主要估计的情况下分别报告自适应和Test-B审计。附录A (https://arxiv.org/html/2607.13039#A1)、B (https://arxiv.org/html/2607.13039#A2)、C (https://arxiv.org/html/2607.13039#A3)、D (https://arxiv.org/html/2607.13039#A4)、E (https://arxiv.org/html/2607.13039#A5)、F (https://arxiv.org/html/2607.13039#A6)和G (https://arxiv.org/html/2607.13039#A7)给出了基准组成、发布计划、代表性提示模式、控制器基线、自适应和Test-B检查、定性审计指南、验证诊断以及人类标注协议。
## 2 相关工作
#### 生物学能力与提升评估。
最近的生物学评估已从通用问答转向能力和用户提升的测量。LAB-Bench衡量模型在生物学研究任务上的表现,而VCT研究多模态病毒学故障排除以及实际实验室专业知识的双重用途特征(Laurent等,2024 (https://arxiv.org/html/2607.13039#bib.bib3);Götting等,2025 (https://arxiv.org/html/2607.13039#bib.bib4))。ABC-Bench将这一工作扩展到智能体生物能力,包括与生物安全相关的工具使用任务(Liu等,2026 (https://arxiv.org/html/2607.13039#bib.bib12))。人类提升研究问一个相关问题:模型访问是否改变了新手用户实际能做的事情?最近的计算机模拟和实验室研究报告了不同程度的提升,这提醒我们:基准性能、用户性能和已部署的访问帮助不是同一衡量标准(Zhang等,2026 (https://arxiv.org/html/2607.13039#bib.bib1);Hong等,2026 (https://arxiv.org/html/2607.13039#bib.bib2);Vaccaro等,2026 (https://arxiv.org/html/2607.13039#bib.bib5))。我基于此文献但提出不同问题。与其单独衡量模型能力或新手提升,我研究的是:对于固定基准和固定基础模型,部署时安全措施条件是否改变了向用户提供的帮助。
#### 安全基准、越狱与过度拒绝。
通用LLM安全基准表明,有害输出率在很大程度上取决于攻击面和评估协议。HarmBench、JailbreakBench、Rainbow Teaming、SG-Bench、StrongREJECT和多语言自动红队分别强调该问题的不同方面,包括自动攻击生成、标准化越狱评估、多样化对抗提示、跨提示类型的安全泛化以及评估器质量(Mazeika等,2024 (https://arxiv.org/html/2607.13039#bib.bib13);Chao等,2024 (https://arxiv.org/html/2607.13039#bib.bib7);Samvelyan等,2024 (https://arxiv.org/html/2607.13039#bib.bib8);Mou等,2024 (https://arxiv.org/html/2607.13039#bib.bib9);Souly等,2024 (https://arxiv.org/html/2607.13039#bib.bib14);Singhania等,2025 (https://arxiv.org/html/2607.13039#bib.bib10))。关于夸大安全和过度拒绝的工作显示了问题的另一面:系统可能看起来更安全但同时不那么有用,因为它们拒绝或削弱良善提示(Röttger等,2023 (https://arxiv.org/html/2607.13039#bib.bib15);Cui等,2024 (https://arxiv.org/html/2607.13039#bib.bib11))。我遵循这一教训,但将重点从攻击成功率或拒绝率单独转向良善正确性和有害可操作性在不同部署访问条件下的联合测量。
#### 部署安全措施与治理测量。
另一条工作路线将安全措施作为可能在变化威胁模型下失败或转移的系统进行研究。AEGIS将内容安全视为自适应审核,而关于开放权重安全措施耐久性的工作认为,评估应说明防御在修改和对抗压力下的表现(Ghosh等,2024 (https://arxiv.org/html/2607.13039#bib.bib16);Qi等,2024 (https://arxiv.org/html/2607.13039#bib.bib6))。我的设置不同:我评估封闭权重模型在部署时包装下的表现,而非开放权重修改。共同点是,安全应在政策与部署决策层面进行测量。在这里,这意味着评估完整的访问条件,包括提示和外部控制层,而不是仅从基础模型行为推断部署安全性。
## 3 方法
### 3.1 基准
令
\[
\mathcal{D}=\{(x_i, r_i, a_i)\}_{i=1}^N
\]
表示基准,其中 \(x_i\) 为提示实例,\(r_i \in \{\text{benign},\text{borderline},\text{harmful}\}\) 为风险层级,\(a_i\) 为攻击方式。标准评估套件包含直接、改写、升级、间接、政策感知、角色扮演、多轮施压、翻译框架、良善难负例、能力探测、调试和资源受限变体。我还定义了一个自适应攻击套件,增加了采购重构、缺失细节引导、边界但具体请求、低资源调试和良善边界探测。
\[
\mathcal{A}=\{\text{standard attacks}\}\cup\{\text{adaptive probes}\}.
\]
标准基准包含108个基础任务,具有确定的训练、开发和测试划分。原始报告的控制器设置是在最终保留报告之前选定的,主要的人工评判结果使用锁定的18任务测试集。较大的行数来自那些保留种子上的模型、条件和攻击方式的扩展,而非来自数百个独立的保留生物学任务。工件版本还定义了一个单独的54任务Test-B划分,每个风险层级额外18个任务,用于非主要的外部有效性检查。Test-B不用于表1 (https://arxiv.org/html/2607.13039#S4.T1)中的主要估计;后续的风险预算扫描仅将其作为事后鲁棒性存档。
良善任务是合法的教育或科学请求,应获得有用、高层次的帮助。边界任务是模糊或易于升级的请求,期望的行为是有限帮助。有害任务是明确不允许的请求,系统应避免提供实质性有用的指导。有害项目使用受控的替代提示,而非操作性的生物指令。可见的提示文本避免明确标签如“有害”或“涂黑的高风险”,以便控制器无法通过检测评估标签来解决问题。
任务构建遵循三个约束。良善和边界项被编写为允许的请求,不应需要拒绝,因此过度谨慎的系统会损失效用。有害项被编写为非操作性的替代品,保留了寻求滥用的对话形式,同时移除了具体协议、参数、生物目标和采购细节。所有任务在报告的人工评估之前被分配到训练、开发或测试集,每个划分中风险层级数量相等。附录A (https://arxiv.org/html/2607.13039#A1)给出了完整组成和安全的代表性提示模式。
因此,有害层级是一个威胁模型抽象,而非公开配方集。它表示规划、防御借口、虚构框架、采购、优化和故障排除,不包含可执行的生物内容。可操作性得分衡量在有害意图框架下,响应是否提供可转移的操作结构。不应将其理解为单独响应就能促成实际生物事件的估计。
### 3.2 系统
对于每个基础模型 \(m\) 和访问条件 \(c\),系统生成响应
\[
y_i^{(m,c)} = f_{m,c}(x_i).
\]
我在三种主要的基于模型的访问条件下评估Claude Sonnet 4.6和Gemini 3.5 Flash:直接有帮助提示、更强的面向安全提示,以及外部安全助手。安全助手首先生成一个有帮助模型的草稿,然后将一个提示和输出风险控制器应用于该草稿。我还实现了仅提示、仅输出、仅拒绝和仅监控控制器基线,以分离请求检测、响应检测、重写和拒绝策略。
令 \(s_p(x)\) 为提示侧风险分数,\(s_o(x,z)\) 为输出侧风险分数,分别对应提示 \(x\) 和草稿答案 \(z\)。控制器将它们组合为
\[
s(x,z) = 0.45\, s_p(x) + 0.55\, s_o(x,z),
\]
与实验中使用的实现一致。输出侧风险权重略高,因为暴露的答案(而不仅仅是请求)决定了用户是否收到操作性有用的细节。最终动作为
\[
\pi(x,z) \in \{\text{allow},\text{warn},\text{redact},\text{refuse}\}.
\]
“警告”保留答案但将其重写为更安全的概念形式。“编辑”移除程序性或精确细节。“拒绝”返回固定的安全响应。表中还包括一个空响应锚点,使坐标轴明确。该锚点是用于校准的固定空帮助响应,并非人类专家基线,也不用于声称人类生物性能。
调优策略是基于规则的。它使用提示特征,如逐步请求、优化语言、精确性请求、设置或采购线索、受限工作流措辞、故障排除语言、伪装、施压、教育框架和数值密度。它使用输出特征,如编号步骤、顺序性、精确性、优化、采购、故障排除和数值密度。动作阈值根据风险预算(有害可操作性上限)和相似文章
OSGuard:计算机使用代理安全基准测试
OSGuard是一个双粒度基准测试,用于在良性用户指令下评估计算机使用代理的安全性,包含动作级判断和风险增强执行套件,以检测不安全捷径。
为生物学领域的未来AI风险做准备
OpenAI发布了一套管理高级AI模型在生物领域的两用风险的综合方案,通过专家协作、模型训练、检测系统和安全控制等策略,既能推动有益的科学发现,又能防止其被滥用于生物武器开发。
统一AI安全阈值
本文提出了一种方法,用于在领先AI公司之间推导统一的安全阈值,以解决现有阈值的不一致性,涵盖滥用风险和自动化AI研发,并指出了实证方面的不足。
更新前沿安全框架
DeepMind 发布了更新的前沿安全框架(v2.0),为前沿 AI 模型配备了更强的安全协议,包括新的关键能力等级(CCL)安全建议和加强的欺骗性对齐风险防护方法。该框架旨在防止模型权重的未授权泄露,并管理 AI 系统变得更加强大时带来的风险。
为大语言模型辅助的生物威胁创建构建早期预警系统
# 为大语言模型辅助的生物威胁创建构建早期预警系统 来源:[https://openai.com/index/building-an-early-warning-system-for-llm-aided-biological-threat-creation/](https://openai.com/index/building-an-early-warning-system-for-llm-aided-biological-threat-creation/) *注:作为我们*[*预防性框架*](https://openai.com/preparedness/)*的一部分,我们正在投资开发改进的AI赋能型安全风险评估方法。我们相信这些努力*