OpenSafeIntent:评估跨双重用途提示集的意图校准安全完成
摘要
OpenSafeIntent引入了一个受控提示集基准,这些提示集在保持任务不变的情况下改变意图,从而能够评估模型是否在良性、双重用途和恶意变体之间校准辅助行为,而不是在平均水平上看起来安全。
arXiv:2607.02047v1 Announce Type: new
摘要:安全完成要求模型在不导致危害的前提下提供有用帮助,但这种行为难以通过孤立的提示进行评估。我们引入了OpenSafeIntent,这是一个受控提示集基准,这些提示集在保持底层任务不变的情况下改变意图。每个数据点包含同一任务的良性、双重用途和恶意变体。这种设计使我们能够评估模型是否在意图变化之间校准辅助行为,而不仅仅是平均看起来安全。在一系列广泛的模型套件中,我们发现提示级别的安全性隐藏了重要的失败:模型往往无法在匹配的意图变体之间保持安全,双重用途行为在释义下脆弱,高风险话题的高层次回答并不可靠安全,并且将模糊请求重构为更安全任务的响应跨越安全边界的可能性显著降低。我们的结果表明,安全完成应被评估为受控任务变体上的意图校准行为,而不是独立提示上单一安全-帮助性权衡。
查看缓存全文
缓存时间: 2026/07/03 05:42
# OpenSafeIntent: 评估跨双重用途提示集的意图校准安全完成
## 摘要
安全完成要求模型在提供有用帮助的同时不助长危害,但这种行为很难通过孤立的提示进行评估。我们引入了OpenSafeIntent,一个包含受控提示集的基准测试,这些提示集在保持底层任务不变的同时变化意图。每个数据点包含同一任务的良性、双重用途和恶意变体。这种设计使我们能够评估模型是否能根据意图变化校准其帮助行为,而不仅仅是评估平均安全表现。在一系列广泛的模型中,我们发现提示级别的安全性隐藏了重要的失败模式:模型常常无法在匹配的意图变体间保持安全,双重用途行为在释义下表现脆弱,对高风险话题的高级回答并非可靠安全,而将模棱两可的请求重构为更安全任务的回应跨越安全边界的可能性显著降低。我们的结果表明,安全完成应作为受控任务变体上的意图校准行为进行评估,而不是作为独立提示上的单一安全-帮助性权衡。我们的代码和数据集可在以下地址获取:https://github.com/Uppaal/OpenSafeIntent
## 1 引言
图1:OpenSafeIntent提示集的结构。每个提示集固定了危害领域、任务类型和底层任务,然后仅在提示意图上变化为良性、双重用途和恶意版本。双重用途提示还附带了一个合理的良性用途、滥用风险以及用于一致性评估的释义。
语言模型应能够帮助用户完成复杂任务,同时避免提供可能助长任何形式危害的帮助。这很困难,因为许多请求并非简单地安全或不安全。在网络安全、生物学、隐私、欺诈预防和人身安全等领域,同一种底层能力既可以支持合法目标,也可以支持有害目标。关于诊断安全漏洞、处理危险物质或编辑敏感信息的请求可能是良性的,但类似的知识也可能被滥用。因此,安全性不能简化为检测危险话题或应用二元规则来决定拒绝或遵从(Wang 等,2024;Mazeika 等,2024;Röttger 等,2024)。近期研究转而主张安全完成:模型应在可能时提供有用的帮助,同时隐瞒可能导致滥用的细节(Yuan 等,2025;Zhang 等,2026;Duan 等,2025)。
这便将目标从全面拒绝转向了校准帮助(Duan 等,2025)。模型应充分回答良性请求,在意图不明确时限制帮助,并在请求直接助长危害时拒绝或引导。挑战在于如何评估这种行为。对孤立提示进行打分是不够的,因为关键问题在于模型是否能出于正确的理由改变帮助的数量和类型(Wu 等,2025)。如果良性、双重用途和恶意提示是独立抽样得到的,模型行为可能因与意图无关的原因而变化:恶意提示可能更具体或更技术化,良性提示可能更简单或安全敏感性更低,而双重用途提示可能涉及自然需要程序性细节的任务类型。在这种情况下,很难判断模型是对用户意图做出响应,还是仅仅对主题、措辞、难度或领域线索做出反应。
我们认为安全完成应作为意图转换问题来评估。对于相同的底层任务,模型应在良性意图下提供充分帮助,在模棱两可的意图和恶意意图下提供有限帮助。这种结构是安全问题的核心:能力保持不变,但适当的响应随意图而变化。评估这种转换需要匹配的提示,这些提示在尽可能保持底层任务不变的同时变化意图。
我们引入了OpenSafeIntent,一个包含受控提示集的基准测试。每个提示集包含同一底层任务的良性、双重用途和恶意变体,通过构造保持危害领域、任务类型、具体性和复杂性不变,仅变化意图框架。这使得提示集而非单个提示成为评估的基本单位。这使我们能够测试模型是否在相关请求的局部邻域内保持安全和有用,而不仅仅是在无关提示的平均水平上表现良好。该基准测试还包括双重用途提示的释义,使我们能够测试靠近安全边界的行为是否在措辞微小变化下保持稳定。
我们使用提示级别和提示集级别的指标评估了一系列广泛的语言模型。我们测量安全性、安全门控帮助性、跨意图变体的一致性以及对双重用途释义的鲁棒性。我们还将双重用途响应按帮助模式进行分类,区分为拒绝、高级讨论、安全重构后的具体帮助以及无约束遵从。综合来看,这些分析揭示了仅从聚合的安全性和帮助性评分中难以看到的失败模式。
我们的结果表明,当前模型难以在意图转换间提供校准的安全帮助。平均安全性可能掩盖同一任务匹配变体间的不一致性,而双重用途行为在措辞微小变化下往往不稳定。我们还发现,安全完成不能简化为在原始风险话题上给出高级信息;当模型将模棱两可的请求重构为更安全的任务时,模型更安全。总体而言,OpenSafeIntent提供了一个受控框架,用于研究模型是否能针对同一能力的良性、双重用途和恶意用途适应其帮助行为。
## 2 OpenSafeIntent:受控三元组数据集
OpenSafeIntent数据集旨在隔离一种特定能力:模型在底层任务保持不变的情况下,是否能根据用户意图的变化适当改变其响应。每个数据点是一个围绕一个底层任务、危害领域和任务类型构建的受约束提示集。在一个提示集内,我们包含一个良性提示、一个双重用途提示和一个恶意提示,以及四个双重用途提示的释义。每个提示集还包括对双重用途提示的合理良性解释和滥用风险的标注。图1中提供了一个示例。最终数据集包含115个提示集中的805个提示。
### 2.1 数据集构建与验证
构建OpenSafeIntent需要平衡两个目标。提示集必须受到严格控制,以便模型行为的变化可以归因于意图而非话题漂移。同时,提示必须多样化并类似于真实的用户请求。因此,我们使用一个高度受约束的分阶段生成流程,其中包含生成器G(GPT-5.4)和评判模型J(Claude Sonnet 4.6)。
为了确保覆盖合理的用例,我们定义了两个分类法来控制生成过程。危害领域分类法识别了提示可能助长危害的主要机制,如网络入侵或危险物质使用(表1)。任务类型分类法识别了所请求帮助的形式,独立于危害领域和提示意图,如解释、规划或故障排除(表2)。这些分类法使我们能够控制提示涉及的有害领域以及用户请求的帮助类型。
表1:危害领域识别了提示可能助长危害的主要机制。
表2:任务类型识别了所请求帮助的形式,独立于危害领域。
#### 阶段1:元数据生成。
我们从PKU-SafeRLHF(Ji等,2024)中的不安全种子提示开始。对于每个种子,G和J独立提取一个抽象的主题摘要,该摘要去除操作细节,同时保留底层任务以及危害领域和任务类型。我们只保留G和J达成一致的示例。
#### 阶段2:回填。
由于种子分布严重偏斜,一些危害领域-任务类型组合代表性不足。因此,我们使用G来回填稀疏组合,通过基于目标危害领域和任务类型生成额外的抽象主题摘要。为减少重复,摘要以小批量生成,先前接受的摘要在后续轮次中作为负面示例展示。
#### 阶段3:三元组生成。
对于每个主题摘要,G生成一个提示三元组。在编写提示之前,模型首先将摘要规范化成一个中立的底层任务。这使得流程能够处理最初过于良性或过于恶意的摘要,同时保持分配的领域和任务类型。生成的良性、双重用途和恶意提示必须共享相同的底层任务、具体性和复杂性,仅有意图框架发生变化。
#### 阶段4:提示意图校正。
由于双重用途提示本身具有复杂性,G经常生成过于恶意或过于良性的双重用途提示。为解决这个问题,J对所有生成的提示进行意图分类。任何有噪声的提示集将被送回G进行重新生成,每次只修正一个提示。修订后仍无法通过意图分类的提示集将被丢弃。
#### 阶段5:质量检查与去重。
J检查所有提示集,确认提示在底层任务、危害领域、任务类型和具体性方面是否保持并行,以及是否包含不自然的措辞或明显的词汇人工痕迹。随后进行去重过程,将提示集按危害领域-任务类型分桶,并计算所有提示对之间的Rouge-L分数。与Wang等人(2023)类似,任何分数大于0.7的提示将被删除。
#### 阶段6:增强。
最后,在核心三元组通过过滤后,G为每个双重用途提示生成四个释义。这些释义保持相同的含义和模糊性,使得能够评估模型行为在措辞变化下是否稳定。我们还使用J为每个双重用途提示标注其合理的良性风险和滥用风险,并删除无法连贯识别这些信息的提示集。
#### 阶段7:人工评估。
我们使用四名人工标注者对最终数据集进行验证。标注者评估意图正确性、自然性、意图区分度,并检查每个三元组是否保留了共享的底层任务。我们删除所有标注者均标记整体质量为差的提示集。如表3所示,标注者认为大多数保留的提示集具有高质量。更多细节见附录C。
表3:生成数据质量的人工验证。
## 3 基准测试意图校准的安全完成
OpenSafeIntent基准测试评估模型是否能根据提示意图的变化在保持安全的同时提供有用的帮助。与独立评分提示的标准安全评估不同,OpenSafeIntent中的每个提示集包含同一底层任务的良性、双重用途和恶意变体。这种结构使我们能够不仅测量模型平均是否安全,还能测量其安全行为在意图从明确合法转向模糊再到明确有害时是否稳定。因此,我们既报告响应级别的指标,也报告捕获跨提示意图一致性的提示集级别指标。
设T = {benign, dual-use, malicious}表示提示类型的集合。为了本节的目的,我们将数据集定义为D = (p_i^t ∀ t ∈ T)_{i=1}^N。对于模型M,我们对提示p_i^t的响应记为r_i^t = M(p_i^t)。
#### 响应级别指标。
每个响应由两个LLM自动评分器(Claude Sonnet 4.6)进行评分。帮助性自动评分器测量任务满意度,独立于安全性,评分范围为{1,2,3,4}。危害性自动评分器分配危害严重性评分,范围为{0,1,2,3}。帮助性H_i^t随后归一化到[0,1],而安全性S_i^t二值化为{0,1},其中1表示安全响应。类似于Yuan等人(2025),我们将效用定义为安全门控帮助性:U_i^t = S_i^t · H_i^t。因此,不安全的响应无论原始帮助性如何,其效用均为零。
#### 衍生指标。
利用上述响应级别指标,我们报告以下指标以更好地表征双重用途环境下的安全完成行为:
- 平均安全性:测量所有提示类型中安全响应的平均比例:MeanSafety(M) = 1/(N|T|) Σ_i=1^N Σ_{t∈T} S_i^t
- 三元组安全性:测量模型是否在整个提示集上保持安全,测试跨提示意图的安全性一致性:TripletSafety(M) = 1/N Σ_i=1^N Π_{t∈T} S_i^t
- 平均效用:测量所有提示类型中的平均安全门控帮助性:MeanUtility(M) = 1/(N|T|) Σ_i=1^N Σ_{t∈T} U_i^t
- 最坏情况效用:测量每个提示集中良性提示和双重用途提示之间的最小效用。我们排除恶意提示,因为它们通常设计为允许有限的效用:WorstCaseUtility(M) = 1/N Σ_i=1^N min(U_i^{t=benign}, U_i^{t=dual-use})
### 3.1 基准测试结果
#### 三元组安全性揭示了意图不一致性。
图2显示,具有相似平均安全性的模型在三元组安全性上可能存在显著差异。例如,GPT-5.4和Llama 3.1 8B Instruct具有相当的平均安全性,但GPT-5.4具有更高的三元组安全性,表明其意图相似文章
从强制拒绝到安全完成:面向输出为中心的安全训练
# 从强制拒绝到安全完成:面向输出为中心的安全训练 来源: [https://openai.com/index/gpt-5-safe-completions/](https://openai.com/index/gpt-5-safe-completions/) OpenAI在 GPT-5 中引入的安全完成是一种新的安全训练方法,可在安全约束范围内最大化模型的实用性。与基于拒绝的训练相比,安全完成提高了安全性和实用性,特别是在双用途领域。**如果用户要求 ChatGPT 提供最小能量
我进行了356次提示注入试验。工作空间改变了‘安全’的面貌
作者在六种模型和三种工具中进行了356次提示注入试验,揭示了工作空间元素能够启用原本会失败的攻击,并分享了评估AI安全性的基准。
我基准测试了10个开源提示注入检测器。最好的仅检测到51%。你们实际上如何防御你们的代理?
基准测试了10个开源提示注入检测器,对抗629次攻击,发现最好的仅检测到51%,且误报率低。强调了校准和控制危险行动的重要性,而不仅仅是检测。
帮助开发者构建更安全的青少年AI体验
OpenAI发布了基于提示的安全策略和开放权重的gpt-oss-safeguard模型,帮助开发者构建适合青少年的AI体验,涵盖图形内容、有害行为和危险活动等风险。
在6,560次基准测试运行中,任务完成常常与不安全行为并存
一篇新的arXiv预印本介绍了AgentS4D,这是一个用于AI代理安全性的基准测试,显示70.52%的已完成运行也触发了不安全判定,而97.38%的不安全运行仍然完成了任务。该研究强调任务完成与安全性应分别评分。