以不拒绝拒绝:语言模型安全微调中减少错误拒绝的结构性分析
摘要
本文分析了大型语言模型的安全微调,表明将回应分解为拒绝声明与理由后,仅使用理由进行训练可减少错误拒绝同时保持安全性,从而改善实用性与安全性之间的平衡。
查看缓存全文
缓存时间: 2026/09/07 16:16
论文页面 - 无需拒绝的拒绝:安全调优响应的结构化分析以减少语言模型的错误拒绝
来源:https://huggingface.co/papers/2609.04714 发布于9月4日
·
提交者:https://huggingface.co/mz-kim
mz-kim (https://huggingface.co/mz-kim) 于9月7日
摘要
将安全响应分解为拒绝声明和解释理由后发现,仅基于解释理由进行训练可减少错误拒绝,同时保持安全性。
在大型语言模型(https://huggingface.co/papers?q=large%20language%20models)的对齐过程中,平衡有用性与安全性始终是一个核心挑战。为实现这一平衡,模型应当拒绝有害查询(例如:“如何枪击他人?”),同时对良性输入保持响应能力——即使是那些表面上与有害查询相似的输入(例如:“在哪里可以拍出好照片?”)。然而,模型往往难以区分真正有害的查询与仅包含表面风险语言的良性查询,从而导致错误拒绝(https://huggingface.co/papers?q=false%20refusals)。在本文中,我们通过将安全调优(https://huggingface.co/papers?q=safety-tuning)数据集中的响应分解为两个独立部分来解决这一问题:(i) 标准的拒绝声明,以及 (ii) 解释拒绝原因的理由。我们的实验与分析表明,拒绝声明(https://huggingface.co/papers?q=refusal%20statements)会诱导模型依赖表面线索,从而阻碍其准确区分有害与良性查询。相比之下,仅基于理由(https://huggingface.co/papers?q=rationales)进行训练,可以在保持相当安全性能水平的同时,显著减少错误拒绝(https://huggingface.co/papers?q=false%20refusals)。这一“仅理由”训练方法的益处在我们的ICL(上下文学习)配置中同样显现,并且与所评估的推理时缓解(https://huggingface.co/papers?q=inference-time%20mitigation)方法保持兼容。研究结果强调了构建精确、细粒度安全监督数据集的必要性,并为构建能更好协调有用性与安全性的对齐智能体指明了方向。
查看arXiv页面 (https://arxiv.org/abs/2609.04714) 查看PDF (https://arxiv.org/pdf/2609.04714) GitHub (https://github.com/mz-kim/Refuse-without-Refusal) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04714)
引用本文的模型:0
无模型链接此论文
在模型的README.md中引用 arxiv.org/abs/2609.04714 以从本页面链接。
引用本文的数据集:0
无数据集链接此论文
在数据集的README.md中引用 arxiv.org/abs/2609.04714 以从本页面链接。
引用本文的空间:0
无空间链接此论文
在空间的README.md中引用 arxiv.org/abs/2609.04714 以从本页面链接。
包含本文的收藏集:0
无收藏集包含本文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
PsychoSafe:在大型语言模型中引发基于心理学的拒绝响应
本文介绍了PsychoSafe,一种面向大型语言模型的基于心理学的拒绝框架,通过Qwen 3.5 27B上的提示学习和微调,在保持非拒绝任务性能的同时,将拒绝质量提升了28.1%,资源转介提升了46.8%。
When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models
This paper identifies a refusal-cue shortcut in safety guard models, where inserting refusal expressions into harmful responses can flip their harmless classification. The authors audit datasets like WildGuardMix and GR-Train, show the issue persists in official models such as LlamaGuard3 and Qwen3Guard, and propose a post-hoc intervention to suppress shortcut-associated components.
安全回应至关重要:输出感知安全护栏缓解多模态大语言模型过度拒绝问题
本文提出了一种面向多模态大语言模型的输出感知安全护栏方法,利用隐藏状态表示和多实例对比学习在生成前预测不安全输出,大幅减少过度拒绝同时保持安全性。该方法仅在实际回答可能有害时进行干预,从而保留模型的实用性。
情绪很重要:句法敏感性如何破坏安全对齐
本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。
拒绝不等于鲁棒性:审计大型语言模型在可证无信息临床疼痛语音转录中的自信编造
本文审计了大型语言模型在临床疼痛语音转录中的拒绝和编造行为,发现权威框架提示会导致如Gemini 2.5 Flash和Llama 3.1 8B等模型产生自信编造,而合作提示则显示出稳健的弃权行为。