安全回应至关重要:输出感知安全护栏缓解多模态大语言模型过度拒绝问题

arXiv cs.LG 论文

摘要

本文提出了一种面向多模态大语言模型的输出感知安全护栏方法,利用隐藏状态表示和多实例对比学习在生成前预测不安全输出,大幅减少过度拒绝同时保持安全性。该方法仅在实际回答可能有害时进行干预,从而保留模型的实用性。

arXiv:2607.09697v1 公告类型:新 摘要:现有的多模态大语言模型(MLLMs)安全机制面临安全性与实用性之间的根本权衡。模型微调实现了稳健的安全性,但损害了通用实用性。输入侧安全护栏提供了一种轻量级替代方案,然而它们存在严重的过度拒绝问题,不加区分地阻止良性查询或那些模型本可以通过拒绝或建议性回答安全处理的问题。我们识别出过度拒绝的根本原因在于输入感知范式:安全护栏在做出安全决策时,未考虑模型自身是否能生成安全回答。通常,MLLMs已具备内在的安全机制,可将有害输入转化为无害输出,但输入侧安全护栏覆盖了这一能力,降低了用户体验。基于这一洞察,我们提出向输出感知安全护栏的范式转变。我们的方法在模型的隐藏状态空间中运行,在生成完全完成之前预测即将生成的输出是否不安全。通过在隐藏状态表示上使用多实例对比学习训练一个轻量级分类器,我们的方法能够区分会导致不安全输出的输入和不会导致不安全输出的输入,即使输入本身包含风险元素。这仅在模型实际回答可能有害时允许精确干预。大量实验证明,我们的输出感知安全护栏在安全性上与现有方法相当,同时大幅减少过度拒绝,保留了模型的实用性和内置安全能力。代码见:https://github.com/kunzhan/OutGuard
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:13

# 安全回应至关重要:输出感知安全护栏减轻MLLMs中的过度拒绝问题
来源:https://arxiv.org/html/2607.09697
11institutetext:兰州大学###### 摘要

现有的多模态大语言模型(MLLMs)安全机制面临安全性与实用性之间的根本权衡。模型微调虽然实现了稳健的安全性,但却牺牲了通用实用性。输入侧安全护栏提供了一种轻量级替代方案,但它们存在严重的过度拒绝问题,不加区分地阻止良性查询或那些模型能够通过拒绝或建议性回应安全回答的查询。我们确定了过度拒绝的根本原因在于输入感知范式:安全护栏在做出安全决策时,并未考虑模型本身是否具备生成安全回应的能力。通常,MLLMs已经拥有内在的安全机制,能够将有害输入转化为无害输出,但输入侧安全护栏会覆盖这一能力,从而降低用户体验。受此洞察启发,我们提出向输出感知安全护栏的范式转变。我们的方法在模型的隐藏状态空间内运行,以预测即将生成的输出是否不安全,甚至在它完全产生之前就能做出判断。通过在多实例对比学习框架下,对隐藏状态表示训练一个轻量级分类器,我们的方法能够区分哪些输入会导致不安全输出,哪些不会,即使输入本身包含风险元素。这使得我们只有在模型的实际回应会带来危害时才能进行精确干预。大量实验表明,我们的输出感知安全护栏在安全性方面与现有方法相当,同时大幅减少了过度拒绝,保留了模型的实用性和内置安全能力。代码可于以下地址获取:https://github.com/kunzhan/OutGuard

## 1 引言

多模态大语言模型(MLLMs)在各种应用中的快速集成使得其安全性成为关键要务,特别是在防御有害内容的生成方面。为了解决这些漏洞,安全护栏提供了一种更灵活且非侵入式的解决方案,因为它们独立于模型参数运行,并保留了模型的原始实用性[20 (https://arxiv.org/html/2607.09697#bib.bib20),38 (https://arxiv.org/html/2607.09697#bib.bib38),13 (https://arxiv.org/html/2607.09697#bib.bib13),39 (https://arxiv.org/html/2607.09697#bib.bib39),18 (https://arxiv.org/html/2607.09697#bib.bib18),15 (https://arxiv.org/html/2607.09697#bib.bib15),23 (https://arxiv.org/html/2607.09697#bib.bib23),36 (https://arxiv.org/html/2607.09697#bib.bib36),26 (https://arxiv.org/html/2607.09697#bib.bib26),29 (https://arxiv.org/html/2607.09697#bib.bib29),5 (https://arxiv.org/html/2607.09697#bib.bib5),2 (https://arxiv.org/html/2607.09697#bib.bib2),30 (https://arxiv.org/html/2607.09697#bib.bib30),7 (https://arxiv.org/html/2607.09697#bib.bib7),10 (https://arxiv.org/html/2607.09697#bib.bib10),12 (https://arxiv.org/html/2607.09697#bib.bib12)]。它们评估输入查询中潜在的有害风险,并在估计风险达到一定水平时触发拒绝,以防止输出。

参考图注图1:输入风险与输出危害性之间的差异。MLLM的回应包括四个示例:无害输入产生无害输出,有害输入导致拒绝式输出,有害输入生成带有警告声明(引用法律法规)的告诫回应,以及有害输入生成真正有害的输出。这些示例表明,并非所有来自有害输入的输出本身都有害,但防御机制一旦检测到输入有害,便会拒绝所有输入。过度拒绝的根本原因在于依赖输入风险而非评估输出的实际危害性。然而,现有安全护栏的一个显著局限性是过度拒绝问题。通过主要基于输入提示做出安全决策,这些安全护栏经常阻止良性查询或模型本可以安全处理的交互。这种保守方法对用户体验产生了重大影响,往往使模型不那么有用,并限制了其在现实场景中的实际可用性。尽管技术实现各不相同,但这些方法都遵循一种输入感知范式,即安全判断完全基于对输入图像-文本对的分析。这种仅依赖提示的做法忽略了一个关键因素:模型的实际回应。通过忽略生成阶段,这类护栏无法区分高风险输入是否确实会导致有害输出,或者是否会被模型的内部防御机制成功中和。这种输出层面上下文的缺失是过度拒绝的主要驱动因素,因为它迫使安全护栏对每个查询都采取最坏情况的假设,从而为了安全性不必要地牺牲了模型的实用性。

参考图注图2:看似有害但实际上良性的查询示例。样本取自XSTest[24 (https://arxiv.org/html/2607.09697#bib.bib24)],该数据集先前已被用于LLM过度拒绝研究。由于原始数据集仅包含文本输入,我们使用SD 3.5 Medium[1 (https://arxiv.org/html/2607.09697#bib.bib1)]为每个提示生成语义对齐的图像,以实现多模态评估。随着安全护栏变得日益严格,即使是这种表面上存在风险但实际良性的查询也会导致被拒绝的输出。随着对防御机制和价值对齐的持续研究,当前的MLLMs通常在训练期间纳入对齐目标。如图1 (https://arxiv.org/html/2607.09697#S1.F1)所示,对于明确的有害查询,模型在推理时经常表现出自我引导行为,将高风险请求转化为包含风险警告、伦理或法律指导、劝诫性劝阻或明确拒绝的回应。从生成的输出来看,这类回应通常

参考图注图3:输入侧安全护栏中的过度拒绝。对于生成的回应,我们使用精心设计的提示模板来引导LLMs判断输出是否构成拒绝回应。不太可能对用户或社会造成实际伤害。然而,当在部署时引入安全护栏时,现有机制通常会在输入被判定为有害时中止生成并发出拒绝,而不再进一步评估潜在的输出是否实际上安全。这种严格基于输入的限制忽略了模型内在的对齐能力。

随着安全护栏变得越来越保守,一个意料之外的副作用出现了:没有明确有害意图的良性查询也被拒绝,图2 (https://arxiv.org/html/2607.09697#S1.F2)展示了这类案例的代表性示例。尽管这些查询的输出并不有害,但输入侧安全护栏可能由于提示中感知到的潜在风险而阻止它们。在此类数据上,我们测量了在LLaVA 1.6[16 (https://arxiv.org/html/2607.09697#bib.bib16)]上部署几种先进安全护栏前后过度拒绝率的变化,如图3 (https://arxiv.org/html/2607.09697#S1.F3)所示。结果表明,现有的安全护栏显著增加了过度拒绝,即使是对于看似可能有害但实际良性的提示,这降低了用户体验,浪费了推理资源,并限制了模型在需要深度推理的任务上的有效性。为了解决这些挑战,本工作将安全护栏范式从输入感知转向输出感知,并提出了一种输出感知安全护栏(OutGuard)框架。该方法使用隐藏层表示作为特征,将内部状态与最终输出联系起来,并采用基于多实例对比学习(MICL)的分类器进行有害内容检测。OutGuard作为一个独立模块进行训练,不会干扰基础MLLM的推理或生成。此外,OutGuard与MLLM推理过程同时进行安全检测,使得安全决策能够在输出生成之前,在单次推理过程中完成,而无需引入额外的查询或延迟开销。与现有的SOTA护栏相比,OutGuard在保持检测性能的同时减轻了过度拒绝,从而提高了可用性和用户体验。

我们的贡献总结如下:

1.  我们揭示了SOTA MLLM安全护栏方法由于其输入感知性质而遭受严重的过度拒绝,并提议将安全评估范式转向输出感知。
2.  我们提出了OutGuard,一种新颖的框架,它利用推理过程中的隐藏状态表示作为特征,并设计了基于多实例对比学习(MICL)的分类器来直接评估模型输出的安全性。
3.  实验表明,OutGuard在分布内和分布外测试集上、在各种越狱攻击下以及在看似有害但实际良性的数据集上,均能大幅减少过度拒绝,同时保持强大的有害内容检测性能,并在安全性和可用性之间实现了更好的平衡。

## 2 相关工作

参考图注图4:MLLM结构与数据流。根据安全护栏的潜在特征提取点,数据流分为五个阶段:预输入(S1)、编码后(S2)、投影后(S3)、推理(S4)和输出后(S5)。MLLMs整合视觉和文本模态以支持多模态理解和响应生成[16 (https://arxiv.org/html/2607.09697#bib.bib16)]。如图4 (https://arxiv.org/html/2607.09697#S2.F4)所示,输入图像首先由视觉编码器处理以获得视觉嵌入。然后,这些嵌入通过投影层映射到与语言嵌入对齐的语义空间。投影后的视觉嵌入与文本提示一起被输入到大语言模型(LLM)中,该模型自回归地生成输出文本。

MLLM防御。MLLM防御策略分为三类。第一类通过在训练阶段进行微调来增强安全性,将伦理约束直接嵌入模型参数[31 (https://arxiv.org/html/2607.09697#bib.bib31),17 (https://arxiv.org/html/2607.09697#bib.bib17),40 (https://arxiv.org/html/2607.09697#bib.bib40),37 (https://arxiv.org/html/2607.09697#bib.bib37)]。第二类在推理时应用引导,保持参数不变,同时影响生成行为,并可能影响用户体验[25 (https://arxiv.org/html/2607.09697#bib.bib25),11 (https://arxiv.org/html/2607.09697#bib.bib11),27 (https://arxiv.org/html/2607.09697#bib.bib27),3 (https://arxiv.org/html/2607.09697#bib.bib3),4 (https://arxiv.org/html/2607.09697#bib.bib4)]。第三类采用安全护栏机制,评估输入风险并在必要时阻止输出[20 (https://arxiv.org/html/2607.09697#bib.bib20),38 (https://arxiv.org/html/2607.09697#bib.bib38),13 (https://arxiv.org/html/2607.09697#bib.bib13),39 (https://arxiv.org/html/2607.09697#bib.bib39),18 (https://arxiv.org/html/2607.09697#bib.bib18),15 (https://arxiv.org/html/2607.09697#bib.bib15),23 (https://arxiv.org/html/2607.09697#bib.bib23),36 (https://arxiv.org/html/2607.09697#bib.bib36),26 (https://arxiv.org/html/2607.09697#bib.bib26),29 (https://arxiv.org/html/2607.09697#bib.bib29),5 (https://arxiv.org/html/2607.09697#bib.bib5),2 (https://arxiv.org/html/2607.09697#bib.bib2),30 (https://arxiv.org/html/2607.09697#bib.bib30),7 (https://arxiv.org/html/2607.09697#bib.bib7),10 (https://arxiv.org/html/2607.09697#bib.bib10),12 (https://arxiv.org/html/2607.09697#bib.bib12)]。这些安全护栏独立于底层模型运行,保留原生性能的同时实现轻量级部署。

安全护栏。由于安全护栏依赖于从MLLM执行过程中的中间表示提取的特征,识别与风险相关信号出现的表征位置有助于更好地理解这些信号是如何产生的。为此,我们将MLLM前向处理过程中的数据流分解为五个阶段(见图4 (https://arxiv.org/html/2607.09697#S2.F4)),每个阶段代表安全护栏的一个潜在特征提取点:(1) 预输入,评估原始图像-文本对[5 (https://arxiv.org/html/2607.09697#bib.bib5),2 (https://arxiv.org/html/2607.09697#bib.bib2),30 (https://arxiv.org/html/2607.09697#bib.bib30),36 (https://arxiv.org/html/2607.09697#bib.bib36),23 (https://arxiv.org/html/2607.09697#bib.bib23),6 (https://arxiv.org/html/2607.09697#bib.bib6)];(2) 编码后,使用编码后的视觉和文本特征进行风险评估[18 (https://arxiv.org/html/2607.09697#bib.bib18)];(3) 投影后,投影层输出作为检测特征[39 (https://arxiv.org/html/2607.09697#bib.bib39)];(4) 推理,利用骨干LLM的隐藏状态进行安全评估[15 (https://arxiv.org/html/2607.09697#bib.bib15),12 (https://arxiv.org/html/2607.09697#bib.bib12),10 (https://arxiv.org/html/2607.09697#bib.bib10),7 (https://arxiv.org/html/2607.09697#bib.bib7),38 (https://arxiv.org/html/2607.09697#bib.bib38),29 (https://arxiv.org/html/2607.09697#bib.bib29),26 (https://arxiv.org/html/2607.09697#bib.bib26)];(5) 输出后,检查最终输出的安全风险[20 (https://arxiv.org/html/2607.09697#bib.bib20),13 (https://arxiv.org/html/2607.09697#bib.bib13)]。

HiddenDetector[10 (https://arxiv.org/html/2607.09697#bib.bib10)]从推理阶段提取特征,构建一个拒绝向量,并测量隐藏状态与拒绝向量之间的余弦相似度以评估输入安全性。QGuard[12 (https://arxiv.org/html/2607.09697#bib.bib12)]为有害提示类别生成守卫问题,查询MLLM以从推理阶段获取是/否响应的logits,并应用基于PageRank的过滤来计算检测有害提示的风险分数。LoD[15 (https://arxiv.org/html/2607.09697#bib.bib15)]从推理阶段选择隐藏状态特征,为骨干LLM的每一层训练一个独立的有害内容分类器,并使用自编码器重构以实现高效检测。

过度拒绝发生在防御机制阻止了实际上无害的输出时。LLM-Pipeline[6 (https://arxiv.org/html/2607.09697#bib.bib6)]首先发现了MLLMs中的过度谨慎问题;它应用了一个视觉无关的检测器(通过重新利用已建立的LLM安全护栏构建,并可选地通过图像标题或场景提示增强),对MLLM输入进行安全检查。然而,它并不评估输出的危害性,而这是过度拒绝的根本原因。MOSR[35 (https://arxiv.org/html/2607.09697#bib.bib35)]也研究了MLLMs中的过度拒绝问题,它通过对骨干LLM进行微调来更新模型。

## 3 OutGuard方法

本节介绍我们的方法。我们首先定义问题并概述OutGuard框架。然后,我们详细阐述轻量级MICL分类器(OutGuard的核心)的结构和训练。最后,我们描述选择与每个MICL分类器对应的有效层的过程。

### 3.1 问题定义与OutGuard结构

MLLM生成的每个输出文本,记为O={t1,t2,...,tN}\mathcal{O}=\{t^{1},t^{2},\ldots,t^{N}\},由NN个令牌组成,其中NN可能因输出而异。骨干LLM

相似文章

从强制拒绝到安全完成:面向输出为中心的安全训练

OpenAI Blog

# 从强制拒绝到安全完成:面向输出为中心的安全训练 来源: [https://openai.com/index/gpt-5-safe-completions/](https://openai.com/index/gpt-5-safe-completions/) OpenAI在 GPT-5 中引入的安全完成是一种新的安全训练方法,可在安全约束范围内最大化模型的实用性。与基于拒绝的训练相比,安全完成提高了安全性和实用性,特别是在双用途领域。**如果用户要求 ChatGPT 提供最小能量

CR4T:基于重写的青少年大语言模型安全护栏

arXiv cs.CL

本文提出CR4T,一种模型无关的安全防护框架,将不安全或拒绝式的大语言模型输出重写为适合青少年的、具有指导性的回应,为传统以拒绝为中心的安全护栏提供了更以人为本的替代方案。

当选择成为风险:多选题约束下大语言模型的安全失效

arXiv cs.CL

# 当选择成为风险:多选题约束下大语言模型的安全失效 来源:[https://arxiv.org/html/2604.16916](https://arxiv.org/html/2604.16916) Yuheng Chen1 Zhiyu Wu2 Bowen Cheng3 Tetsuro Takahashi1 1鹿儿岛大学 2复旦大学 3中国石油大学(北京) [email protected] ###### 摘要 大语言模型(LLMs)的安全性对齐主要在开放式生成环境进行评估,模型可通过拒绝回应来规避风险……

SingGuard: 策略自适应多模态LLM护栏与动态推理

Hugging Face Daily Papers

SingGuard是一种策略自适应多模态LLM护栏模型,用于文本、图像和多语言安全审核,具备动态推理能力,并包含新基准SingGuard-Bench。它在多个数据集上取得了最先进的结果。