PolicyShiftGuard:基准测试与改进策略自适应图像防护栏

Hugging Face Daily Papers 论文

摘要

本文介绍了PolicyShiftBench(一个用于策略自适应图像防护栏的基准测试)以及PolicyShiftGuard(一个通过两阶段方法训练的紧凑模型,在安全策略变化时能提升性能)。

图像防护栏通常基于固定的安全策略进行训练和评估,这隐含地将安全性视为图像的内在属性。实际部署场景却有所不同:同一图像在一个产品中可能被允许,在另一个产品中受限,而当策略边界发生变化时,又可能被新禁止。我们研究了策略自适应的图像防护——模型必须判断图像是否违反当前提供的策略,并泛化到未见的策略定义上。我们引入了PolicyShiftBench,这是一个综合性的基准测试,包含265张图像上的2000个策略判别实例,每张图像平均配有7.55个策略条件提示,用于测试模型是否根据当前策略进行调整,而非依赖图像级别的安全先验。接着,我们提出了PolicyShiftGuard,这是一个紧凑的策略条件防护栏,采用两阶段训练方案,结合了随机策略监督微调(RP-SFT)与边界对策略适应(BP-Adapt)。BP-Adapt利用标准标签监督和成对比较损失,针对同一图像和风险类别训练匹配的提示,从而将阻止策略与通过策略区分开。实验表明,现有视觉语言模型和专用防护栏在策略变化时表现脆弱,而PolicyShiftGuard显著提升了策略敏感性能。7B模型在PolicyShiftBench上达到了76.9平均F1分数和72.1平均PSS分数的当前最优性能,能很好地迁移到UnSafeBench和SafeEditBench,并通过简洁的输出格式改善了延迟-性能权衡。消融实验证实,匹配的通过/阻止边界对对于稳定的策略适应至关重要。
查看原文
查看缓存全文

缓存时间: 2026/07/16 05:42

论文页面 - PolicyShiftGuard: 基准测试与改进策略自适应图像护栏

来源: https://huggingface.co/papers/2607.05910

摘要

图像护栏通常在固定安全策略下进行训练和评估,隐含地将安全性视为图像的固有属性。实际部署情况不同:同一张图像可能在一个产品中被允许,在另一个产品中被限制,并在政策边界变化时被新禁止。我们研究策略自适应图像护栏,即模型必须判断图像是否违反当前提供的策略,并泛化到未见的策略定义。我们引入了PolicyShiftBench,一个包含265张图像上2000个策略区分实例的全面基准,每张图像平均与7.55个策略条件提示配对,以测试模型是否适应当前策略而不是依赖图像级安全先验。然后我们提出PolicyShiftGuard,一种采用两阶段训练方案训练的紧凑型策略条件护栏,该方案结合了随机策略SFT (RP-SFT) 与边界对策略适应 (BP-Adapt)。BP-Adapt针对相同图像和风险类别训练匹配的提示,使用标准标签监督和成对比较损失,将阻止策略与通过策略分离。实验表明,现有视觉语言模型和专用护栏在策略变化下仍然脆弱,而PolicyShiftGuard大幅提升了策略敏感性能。7B模型在PolicyShiftBench上达到了平均F1为76.9、平均PSS为72.1的最优性能,良好迁移到UnSafeBench和SafeEditBench,并通过简洁的输出格式改善了延迟-性能权衡。消融实验证实,匹配的通过/阻止边界对对于稳定的策略适应至关重要。

查看arXiv页面 (https://arxiv.org/abs/2607.05910)查看PDF (https://arxiv.org/pdf/2607.05910)项目页面 (https://policyshiftguard.github.io/)GitHub20 (https://github.com/ssmisya/PolicyShiftGuard)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05910)

引用此论文的模型0

没有链接此论文的模型

在模型的README.md中引用arxiv.org/abs/2607.05910以从此页面链接。

引用此论文的数据集0

没有链接此论文的数据集

在数据集的README.md中引用arxiv.org/abs/2607.05910以从此页面链接。

引用此论文的Spaces0

没有链接此论文的Space

在Space的README.md中引用arxiv.org/abs/2607.05910以从此页面链接。

包含此论文的收藏集1

相似文章

SingGuard: 策略自适应多模态LLM护栏与动态推理

Hugging Face Daily Papers

SingGuard是一种策略自适应多模态LLM护栏模型,用于文本、图像和多语言安全审核,具备动态推理能力,并包含新基准SingGuard-Bench。它在多个数据集上取得了最先进的结果。

SafePyramid:面向上下文策略护栏的分层基准

Hugging Face Daily Papers

SafePyramid 是一个分层基准,包含跨10个领域的1,000轮多轮对话和3,000条策略,用于评估护栏系统通过上下文策略规范识别安全违规的能力。对10个前沿大语言模型的测试显示,即使是在最简单的层级上,GPT-5.5也只能正确识别所有违规策略的54%,突显了可靠上下文策略护栏面临的挑战。

开源安全防护模型基准测试:全面评估

arXiv cs.CL

本文对14个开源安全防护模型进行了全面评估,在包含79331个样本的精选基准数据集上覆盖了NIST的8个安全类别,发现模型大小与检测性能无关,且Qwen Guard(4B)取得了最高的召回率。