PolicyShiftGuard:基准测试与改进策略自适应图像防护栏
摘要
本文介绍了PolicyShiftBench(一个用于策略自适应图像防护栏的基准测试)以及PolicyShiftGuard(一个通过两阶段方法训练的紧凑模型,在安全策略变化时能提升性能)。
查看缓存全文
缓存时间: 2026/07/16 05:42
论文页面 - PolicyShiftGuard: 基准测试与改进策略自适应图像护栏
来源: https://huggingface.co/papers/2607.05910
摘要
图像护栏通常在固定安全策略下进行训练和评估,隐含地将安全性视为图像的固有属性。实际部署情况不同:同一张图像可能在一个产品中被允许,在另一个产品中被限制,并在政策边界变化时被新禁止。我们研究策略自适应图像护栏,即模型必须判断图像是否违反当前提供的策略,并泛化到未见的策略定义。我们引入了PolicyShiftBench,一个包含265张图像上2000个策略区分实例的全面基准,每张图像平均与7.55个策略条件提示配对,以测试模型是否适应当前策略而不是依赖图像级安全先验。然后我们提出PolicyShiftGuard,一种采用两阶段训练方案训练的紧凑型策略条件护栏,该方案结合了随机策略SFT (RP-SFT) 与边界对策略适应 (BP-Adapt)。BP-Adapt针对相同图像和风险类别训练匹配的提示,使用标准标签监督和成对比较损失,将阻止策略与通过策略分离。实验表明,现有视觉语言模型和专用护栏在策略变化下仍然脆弱,而PolicyShiftGuard大幅提升了策略敏感性能。7B模型在PolicyShiftBench上达到了平均F1为76.9、平均PSS为72.1的最优性能,良好迁移到UnSafeBench和SafeEditBench,并通过简洁的输出格式改善了延迟-性能权衡。消融实验证实,匹配的通过/阻止边界对对于稳定的策略适应至关重要。
查看arXiv页面 (https://arxiv.org/abs/2607.05910)查看PDF (https://arxiv.org/pdf/2607.05910)项目页面 (https://policyshiftguard.github.io/)GitHub20 (https://github.com/ssmisya/PolicyShiftGuard)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.05910)
引用此论文的模型0
没有链接此论文的模型
在模型的README.md中引用arxiv.org/abs/2607.05910以从此页面链接。
引用此论文的数据集0
没有链接此论文的数据集
在数据集的README.md中引用arxiv.org/abs/2607.05910以从此页面链接。
引用此论文的Spaces0
没有链接此论文的Space
在Space的README.md中引用arxiv.org/abs/2607.05910以从此页面链接。
包含此论文的收藏集1
相似文章
SingGuard: 策略自适应多模态LLM护栏与动态推理
SingGuard是一种策略自适应多模态LLM护栏模型,用于文本、图像和多语言安全审核,具备动态推理能力,并包含新基准SingGuard-Bench。它在多个数据集上取得了最先进的结果。
SafePyramid:面向上下文策略护栏的分层基准
SafePyramid 是一个分层基准,包含跨10个领域的1,000轮多轮对话和3,000条策略,用于评估护栏系统通过上下文策略规范识别安全违规的能力。对10个前沿大语言模型的测试显示,即使是在最简单的层级上,GPT-5.5也只能正确识别所有违规策略的54%,突显了可靠上下文策略护栏面临的挑战。
PolicyGuard:面向LLM代理政策遵从性的对话基础子代理验证器
PolicyGuard是一种子代理验证器,通过在多轮交互中提供上下文推理和对话特定反馈,增强LLM代理的政策遵从性,在tau^2-BENCH基准上取得了显著改进。
开源安全防护模型基准测试:全面评估
本文对14个开源安全防护模型进行了全面评估,在包含79331个样本的精选基准数据集上覆盖了NIST的8个安全类别,发现模型大小与检测性能无关,且Qwen Guard(4B)取得了最高的召回率。
安全护栏需要推理吗?LeanGuard:一种快速轻量的鲁棒审核方法
本文介绍了LeanGuard,一种基于轻量级双向编码器的安全护栏,在匹配更大规模推理式护栏精度的同时,速度提升约100倍,挑战了“链式推理对于有效审核必不可少”的假设。