为谁安全?边界感知自蒸馏用于控制LLM安全拒绝
摘要
本文介绍了边界感知自蒸馏,通过控制数据合成减少良性提示的误拒绝,同时保持真正的拒绝,从而改善LLM安全拒绝。
查看缓存全文
缓存时间: 2026/09/08 16:25
论文页面 - 为谁而安全?面向边界的自蒸馏实现可控大语言模型安全拒绝
来源:https://huggingface.co/papers/2609.04482
安全对齐通常处理话题层面的问题:该主题是否有害?而实际部署需面对更具体的场景。例如公民教育导师与公共部门助手可能共享同一基础模型,但仅后者需要拒绝撰写政治操纵内容的请求,同时两者仍需回答关于同一选举的事实性问题。完全拒绝所有政治话题并非可行方案。
在最新论文中,我们训练模型仅拒绝有害子集,并评估边界两侧的表现。关键发现在于:有害响应率最低的配置同时拒绝了74%明显安全的提示词。这种表面安全性源于无人审查良性侧数据。通过在训练数据中添加有害-良性边界配对,虚假拒绝率从32.94%降至4.16%,而真实拒绝率几乎保持不变。
拒绝更多的模型未必是更安全的模型。数据配比决定了平衡点,必须评估边界的两侧表现。
相似文章
为了谁的安全?拒绝话题的正确子集,而非整个话题
这篇文章讨论了人工智能模型中话题级别安全防护的局限性,并介绍了一篇新论文,提出了边界感知自蒸馏用于控制LLM的安全拒绝,重点在于拒绝话题内的特定有害子集,而不是整个话题。
从检测到拒绝:通过电路引导权重缩放实现更安全的LLMs
本文介绍了一种机理方法,通过描述一个用于拒绝行为的电路并使用电路引导的权重缩放来提升LLM安全性,在攻击下将安全率提升了26.5%,同时仅导致最小的准确率损失。
CR4T:基于重写的青少年大语言模型安全护栏
本文提出CR4T,一种模型无关的安全防护框架,将不安全或拒绝式的大语言模型输出重写为适合青少年的、具有指导性的回应,为传统以拒绝为中心的安全护栏提供了更以人为本的替代方案。
使用基于策略的自蒸馏方法降低LLM安全对齐中的安全税
本文介绍了OPSA,一种用于LLM安全对齐的基于策略的自蒸馏方法,该方法通过在模型自身的轨迹上进行训练,并使用教师翻转率激活潜在的安全推理,从而降低了安全税,在多个模型规模上实现了更强的安全-推理权衡。
低宜人性人格条件化实现安全LLM微调
本文介绍了一种基于人格驱动的重写流水线,通过将LLM微调条件化为低宜人性,以降低越狱敏感性和有害输出,同时保持对话温度,无需安全标签或改变训练目标。