为谁安全?边界感知自蒸馏用于控制LLM安全拒绝

Hugging Face Daily Papers 论文

摘要

本文介绍了边界感知自蒸馏,通过控制数据合成减少良性提示的误拒绝,同时保持真正的拒绝,从而改善LLM安全拒绝。

安全对齐通常被视为主题层面的问题:这个主题有害吗?部署时则提出更窄的问题。一个公民教育导师和一个公共部门助手可能共享一个基础模型,但在同一主题内需要不同的边界,拒绝有针对性的政治操纵,同时仍然回答关于同一选举的事实性问题。我们将此表述为窄边界安全,并引入一个离线自生成框架,结合受控主题生成、覆盖修复、分布内补偿数据以及有害-良性对,用于训练和评估。单次生成留下19.88%的提示没有可接受的拒绝痕迹,而逐步重试则留下0.20%。在使用Qwen3-8B进行政治说服实验时,通过Escalate完成的拒绝数据训练将目标域拒绝率从9.47%提高到84.75%,并将三个更广泛有害性基准上的平均不安全响应率从26.26%降低到0.14%,但使XSTest的过度拒绝从2.00%增加到74.00%。在另一个匹配比较中,将外部响应替换为经过验证的目标模型响应,将过度拒绝从15.20%降低到5.20%。边界对数据将保留对上的顺从侧过度拒绝从32.94%降低到4.16%,而有害侧拒绝仅从91.88%下降到87.72%。这些结果表明,数据合成控制了安全性和可用性之间的权衡,安全对齐应在预期拒绝边界的两侧进行评估。
查看原文
查看缓存全文

缓存时间: 2026/09/08 16:25

论文页面 - 为谁而安全?面向边界的自蒸馏实现可控大语言模型安全拒绝

来源:https://huggingface.co/papers/2609.04482

安全对齐通常处理话题层面的问题:该主题是否有害?而实际部署需面对更具体的场景。例如公民教育导师与公共部门助手可能共享同一基础模型,但仅后者需要拒绝撰写政治操纵内容的请求,同时两者仍需回答关于同一选举的事实性问题。完全拒绝所有政治话题并非可行方案。

在最新论文中,我们训练模型仅拒绝有害子集,并评估边界两侧的表现。关键发现在于:有害响应率最低的配置同时拒绝了74%明显安全的提示词。这种表面安全性源于无人审查良性侧数据。通过在训练数据中添加有害-良性边界配对,虚假拒绝率从32.94%降至4.16%,而真实拒绝率几乎保持不变。

拒绝更多的模型未必是更安全的模型。数据配比决定了平衡点,必须评估边界的两侧表现。

相似文章

CR4T:基于重写的青少年大语言模型安全护栏

arXiv cs.CL

本文提出CR4T,一种模型无关的安全防护框架,将不安全或拒绝式的大语言模型输出重写为适合青少年的、具有指导性的回应,为传统以拒绝为中心的安全护栏提供了更以人为本的替代方案。

使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税

arXiv cs.LG

本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。

低宜人性人格条件化实现安全LLM微调

arXiv cs.CL

本文介绍了一种基于人格驱动的重写流水线,通过将LLM微调条件化为低宜人性,以降低越狱敏感性和有害输出,同时保持对话温度,无需安全标签或改变训练目标。