为了谁的安全?拒绝话题的正确子集,而非整个话题

Hugging Face Blog 新闻

摘要

这篇文章讨论了人工智能模型中话题级别安全防护的局限性,并介绍了一篇新论文,提出了边界感知自蒸馏用于控制LLM的安全拒绝,重点在于拒绝话题内的特定有害子集,而不是整个话题。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/08 18:11

安全是为了谁?拒绝主题中的特定子集,而非整个主题

来源:https://huggingface.co/blog/MultiverseComputingCAI/safety-for-whom 大多数安全对齐工作将伤害视为主题的属性。一个提示之所以不安全,是因为它属于武器、欺诈或自残等一般类别,而LlamaGuard-3 (https://huggingface.co/meta-llama/Llama-Guard-3-8B) 这样的守护模型正是基于此类主题层级分类进行编码。XSTest (https://arxiv.org/abs/2308.01263) 和OR-Bench (https://arxiv.org/abs/2405.20947) 等基准测试旨在探测这种分类所导致的失败模式:模型会因为提示中包含危险词汇而拒绝安全的提示,而拒绝校准工作则试图将这种过度拒绝的比例降低。

实际部署很少符合主题层面的图景。同一个基础模型可能被适配为通用助手、教育产品、企业系统或公共服务,而每个场景都需要在同一主题内设定不同的边界。公民课程导师和公共服务助手可以共享一个模型,但在政治问题上却需要相反的行为:两者都应回答关于选举的事实性问题,但只有后者可能需要拒绝撰写针对性政治操纵的请求。主题层面的守护无法表达这种区别。例如,LlamaGuard-3 仅将选举涵盖为“关于选举制度和流程的事实错误信息”,这排除了说服和操纵,同时也排除了部署中必须继续回答的事实性提示。

我们最新的论文《安全是为了谁?面向可控LLM安全拒绝的边界感知自蒸馏》(https://huggingface.co/papers/2609.04482) 直接研究了这个更窄的问题。问题不在于是否应该拒绝整个主题,而在于该主题的哪个子集与给定的部署策略不兼容,以及如何针对该边界进行模型训练和衡量。

窄边界安全

我们将场景形式化为一个主题空间(在我们的实验中是所有政治提示),其中包含一个部署方希望拒绝的目标有害子集。预期策略并非拒绝所有政治内容,而是拒绝有害子集,同时继续回答良性的补集部分。理想行为是一个清晰的阶梯:在子集内拒绝,在主题的其他地方回答。

窄边界安全。政治提示的主题空间包含一个较小的部署方应拒绝的子集,而良性的补集部分仍应被回答。理想的拒绝是一个清晰的阶梯,但经过训练的模型的拒绝概率更为平滑,并且可能在边界附近过度延伸到良性区域。(https://cdn-uploads.huggingface.co/production/uploads/668e37fd9c9aa124a3c867e8/g_Xngr05EUhlIBNT-mG8s.png)

窄边界场景。部署方可能只需要拒绝那些要求进行操纵或针对性说服的政治提示,而不是拒绝所有政治提示。经过训练的模型的拒绝行为比理想的划分更平滑,并且在边界附近可能侵入良性区域。来源:论文图1。

一个训练好的模型永远学不会那个清晰的阶梯。它学到的是一个仅近似目标拒绝概率的拒绝分布,而在有害子集上提高拒绝率的交叉熵训练也可能将拒绝行为向外推入良性补集。因此,真正的问题不仅在于提高对有害提示的拒绝率,还在于塑造边界附近的行为本身。我们将该边界操作化为共享主题锚点但意图不同(一个应被拒绝,一个应被回答)的提示对。

我们选择政治说服作为试验平台,因为操纵性说服可能造成实际伤害,而事实性政治信息保持合法,这正是主题层面拒绝过于粗放的场景。

自生成安全调优的局限

在这里构建训练数据的自然方式是自生成:让目标模型在每个有害提示上引导产生拒绝行为,并保留守护模型验证为真实拒绝的痕迹。这是像ThinkSafe (https://arxiv.org/abs/2601.23143) 等方法背后的做法,我们将其作为参考,应用于政治提示,并逐组件进行衡量。将问题视为边界而非主题,暴露了该标准流程的三个弱点。

第一个是覆盖缺口。一次引导尝试并不总是能产生被接受的拒绝,这些提示会从训练集中被静默丢弃。在我们的审核库中,单次生成丢弃了19.88%的提示(8,009个),而这些失败的提示很可能也是最难的例子。我们修复而非丢弃它们:一种升级重试策略,通过逐步增强的引导对同一提示进行重新采样,将残余失败率降至0.20%(79个提示)。覆盖修复留下了40,293个有害训练提示,而朴素流程会丢弃数千个。

第二个是负面反应。安全调优往往会在表面看起来危险的良性提示上产生错误拒绝。为此,我们构建了分布内良性数据,包括跨越18个语义类型、经验证的11,955个表面危险的良性提示,这样模型在训练期间(而不仅仅是在评估时)就能看到具有危险措辞的安全提示。

第三个是,普通的有害/良性划分完全没有衡量边界的形状。一个模型可以通过将拒绝扩展到附近被允许的提示来简单地提高其有害拒绝率,而主题层面的指标会将其视为改进。保留的有害-良性对(每侧1,539个)让我们能够直接衡量边界的两侧。

权衡及其隐藏的陷阱

在政治拒绝数据上训练在显而易见的意义上有效。在Qwen3-8B (https://huggingface.co/Qwen/Qwen3-8B) 上,升级覆盖的模型将分布内政治拒绝率从9.47%提高到84.75%,并且它也能迁移:在三个更广泛的危害性基准测试(HarmBench (https://www.harmbench.org/)、StrongREJECT和WildJailbreak (https://arxiv.org/abs/2406.18510))中,由LlamaGuard-3评分的平均不安全响应率,在最强配置下从26.26%降至0.14%。

单独报告这些数字看起来像是一次干净的胜利。但事实并非如此。在同一检查点,XSTest上的过度拒绝率从2.00%上升到74.00%。有害响应率最低的配置,也是拒绝近四分之三明显安全提示的配置。它是一个生硬的拒绝机器,而不是一个更安全的模型,除非你衡量良性方面,否则你看不到这一点。这是核心信息:数据组成决定了检查点在安全与过度拒绝空间中的位置,因此这两个轴必须一起报告。

我们数据组件中的两个可以在不放弃安全增益的情况下降低过度拒绝率。将外部采用的合规响应替换为目标模型自身生成的经验证响应,在单次生成下将XSTest过度拒绝率从15.20%降至5.20%,代价是适度的危害性增加。而有害-良性边界对则完成了所有工作中最精确的部分。

成对边界数据减少了边界处的过度拒绝。添加边界对的良性一侧将合规侧过度拒绝从大约0.49降至0.03至0.08,而有害侧拒绝仅略有下降,从大约0.92降至0.88。(https://cdn-uploads.huggingface.co/production/uploads/68db932961906f42259438b7/6W8oCYwy3TnSfdaBsH74C.png)

左图:在保留边界对的合规侧的过度拒绝率,越低越好。使用良性边界数据(PB)的运行结果降至0.03至0.08;未使用时,该数字上升至接近0.49。右图:在有害侧的拒绝率,越高越好,仅略有下降。来源:论文图6。

具体而言,添加良性边界数据将保留对合规侧的过度拒绝从32.94%降至4.16%。有害侧的拒绝仅从91.88%降至87.72%。换句话说,边界附近的大多数错误拒绝消失了,而几乎所有的真正拒绝都得以保留。确实存在召回率的损失,但它很小且可衡量,而这正是重点:只有当你衡量了两侧,你才能有意识地对其进行权衡。

这带来的改变

实际要点是,安全调优不应仅通过有害拒绝率来评估。一个拒绝更多的模型并不自动更安全,在窄边界上,提高对有害提示拒绝率的同一举措,可能会悄无声息地使模型在紧邻的合法提示上变得无用。训练数据的组成、覆盖修复、分布内补偿和边界对是控制这种权衡的关键,必须对预期边界的两侧进行评估,这些数字才有意义。

这项工作是Multiverse Computing (https://multiversecomputing.com/) 研究的一部分,旨在使模型行为在实际部署所关心的层级(而非宽泛的主题类别层级)上变得可控和可衡量。相同的生成流程可扩展到政治以外的其他主题,论文报告了上述结果背后的完整数据组成消融实验集。

想要了解完整的技术细节,包括覆盖修复策略、将有害交叉熵与良性前向KL保持分离的损失路由机制,以及完整的保留边界评估?请阅读完整论文,或与我们团队联系,探讨针对您自身模型的部署特定安全方案。

相似文章

AI安全争论聚焦于错误的边界

Reddit r/AI_Agents

本文认为,AI安全辩论的方向有误,其关注点在于模型对齐和内部控制,而非关键的边界:对智能体执行的外部授权权限。文章警告称,能够自行授权高影响行动(如部署代码、转移资金)的系统构成了基本风险,日志记录和监控无法缓解这种风险。

“安全AI”是什么样的?[D]

Reddit r/MachineLearning

作者质疑研究针对发布后微调的防御(这种微调会削弱开放权重LLM的安全行为)的实用性,并询问如果模型可以快速被攻破,当前的安全训练是否值得投入。

When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

arXiv cs.AI

This paper identifies a refusal-cue shortcut in safety guard models, where inserting refusal expressions into harmful responses can flip their harmless classification. The authors audit datasets like WildGuardMix and GR-Train, show the issue persists in official models such as LlamaGuard3 and Qwen3Guard, and propose a post-hoc intervention to suppress shortcut-associated components.