以不拒绝拒绝:语言模型安全微调中减少错误拒绝的结构性分析

Hugging Face Daily Papers 论文

摘要

本文分析了大型语言模型的安全微调,表明将回应分解为拒绝声明与理由后,仅使用理由进行训练可减少错误拒绝同时保持安全性,从而改善实用性与安全性之间的平衡。

在大型语言模型对齐中,平衡实用性与安全性仍是一项根本挑战。为实现这种平衡,模型应拒绝有害查询(例如“如何射击他人?”),同时对良性输入保持响应,即使它们表面类似有害查询(例如“在哪里能拍到好照片?”)。然而,模型常难以区分真正有害的查询与包含表面风险语言的良性查询,导致错误拒绝。本文通过将安全微调数据集中的回应分解为两个不同部分来解决此问题:(i) 标准拒绝声明,(ii) 解释拒绝理由的说明。实验与分析表明,拒绝声明因诱导依赖表面线索而阻碍了对有害与良性查询的准确辨别。相比之下,仅使用理由训练可减少错误拒绝,同时维持相当的安全性能。仅用理由的方法在我们的ICL配置中同样受益,并与评估的推理时缓解方法兼容。结果强调了精确设计细粒度安全监督数据集的必要性,并为构建更好调和实用性与安全性的对齐智能体指明了方向。
查看原文
查看缓存全文

缓存时间: 2026/09/07 16:16

论文页面 - 无需拒绝的拒绝:安全调优响应的结构化分析以减少语言模型的错误拒绝

来源:https://huggingface.co/papers/2609.04714 发布于9月4日

·

提交者:https://huggingface.co/mz-kim

mz-kim (https://huggingface.co/mz-kim) 于9月7日

摘要

将安全响应分解为拒绝声明和解释理由后发现,仅基于解释理由进行训练可减少错误拒绝,同时保持安全性。

大型语言模型(https://huggingface.co/papers?q=large%20language%20models)的对齐过程中,平衡有用性安全性始终是一个核心挑战。为实现这一平衡,模型应当拒绝有害查询(例如:“如何枪击他人?”),同时对良性输入保持响应能力——即使是那些表面上与有害查询相似的输入(例如:“在哪里可以拍出好照片?”)。然而,模型往往难以区分真正有害的查询与仅包含表面风险语言的良性查询,从而导致错误拒绝(https://huggingface.co/papers?q=false%20refusals)。在本文中,我们通过将安全调优(https://huggingface.co/papers?q=safety-tuning)数据集中的响应分解为两个独立部分来解决这一问题:(i) 标准的拒绝声明,以及 (ii) 解释拒绝原因的理由。我们的实验与分析表明,拒绝声明(https://huggingface.co/papers?q=refusal%20statements)会诱导模型依赖表面线索,从而阻碍其准确区分有害与良性查询。相比之下,仅基于理由(https://huggingface.co/papers?q=rationales)进行训练,可以在保持相当安全性能水平的同时,显著减少错误拒绝(https://huggingface.co/papers?q=false%20refusals)。这一“仅理由”训练方法的益处在我们的ICL(上下文学习)配置中同样显现,并且与所评估的推理时缓解(https://huggingface.co/papers?q=inference-time%20mitigation)方法保持兼容。研究结果强调了构建精确、细粒度安全监督数据集的必要性,并为构建能更好协调有用性与安全性的对齐智能体指明了方向。

查看arXiv页面 (https://arxiv.org/abs/2609.04714) 查看PDF (https://arxiv.org/pdf/2609.04714) GitHub (https://github.com/mz-kim/Refuse-without-Refusal) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.04714)

引用本文的模型:0

无模型链接此论文

在模型的README.md中引用 arxiv.org/abs/2609.04714 以从本页面链接。

引用本文的数据集:0

无数据集链接此论文

在数据集的README.md中引用 arxiv.org/abs/2609.04714 以从本页面链接。

引用本文的空间:0

无空间链接此论文

在空间的README.md中引用 arxiv.org/abs/2609.04714 以从本页面链接。

包含本文的收藏集:0

无收藏集包含本文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models

arXiv cs.AI

This paper identifies a refusal-cue shortcut in safety guard models, where inserting refusal expressions into harmful responses can flip their harmless classification. The authors audit datasets like WildGuardMix and GR-Train, show the issue persists in official models such as LlamaGuard3 and Qwen3Guard, and propose a post-hoc intervention to suppress shortcut-associated components.

情绪很重要:句法敏感性如何破坏安全对齐

arXiv cs.CL

本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。