超越全球规范:无需重新训练的语言模型毒性敏感性个性化
摘要
本文首次对推理时无需训练的语言模型毒性敏感性个性化方法进行了比较评估,显示所有方法均能将对齐错误减少28-47%,但揭示了对齐效果、个性化与语言质量之间的权衡。
arXiv:2607.23175v1 公告类型:新
摘要:减少毒性通常被视为一个全局对齐问题,然而对有害语言的感知是主观且依赖上下文的。我们首次对三种推理时干预阶段的无需训练方法进行了比较评估,这些方法用于将语言生成与用户特定的毒性敏感性对齐:预解码(提示条件化和重写)、解码中(词元、logit和表示引导)以及后解码(候选重新排序)。根据从PRISM数据集推导出的毒性敏感性目标进行评估,所有方法均将对齐错误减少了28-47%。然而,结果揭示了对齐有效性、个性化和通用语言质量之间的根本权衡,表明毒性敏感性对齐本质上是一个多目标问题。
查看缓存全文
缓存时间: 2026/07/28 06:28
# 无需重新训练即可个性化语言模型毒性敏感度
来源:https://arxiv.org/html/2607.23175
Rares A. C. Diaconescu\*, Iulia Slănină\*, Alina Florea\*, Andrei B. Trache\*, Miruna E. Coroi\*, Anne Arzberger, Jie Yang, and Enrico Liscio 代尔夫特理工大学 \{r.a.c.diaconescu, i.slanina-1, a.florea-1, a.b.trache, m.e.coroi, a.arzberger, j.yang-3, e.liscio\}@tudelft.nl
###### 摘要
降低毒性通常被视为一个全局对齐问题,然而对有害语言的感知是主观且依赖上下文的。我们首次对无需训练的方法进行了比较评估,这些方法用于将语言生成与用户特定的毒性敏感度对齐,涵盖三个推理时干预阶段:预解码(提示条件化和重写)、解码中(词元、对数几率与表示引导)以及后解码(候选项重排序)。针对从PRISM数据集得出的毒性敏感度目标进行评估,所有方法都将对齐误差降低了28%至47%。然而,结果揭示了对齐有效性、个性化与通用语言质量之间的根本性权衡,表明毒性敏感度对齐本质上是一个多目标问题。
---
# 超越全局规范:无需重新训练即可个性化语言模型毒性敏感度
Rares A.C. Diaconescu\*, Iulia Slănină\*, Alina Florea\*, Andrei B. Trache\*, Miruna E. Coroi\*, Anne Arzberger, Jie Yang, and Enrico Liscio
代尔夫特理工大学
\{r.a.c.diaconescu, i.slanina-1, a.florea-1, a.b.trache, m.e.coroi, a.arzberger, j.yang-3, e.liscio\}@tudelft.nl
11脚注:同等贡献。
## 1 引言
大语言模型越来越多地调节着对话,在这种对话中,安全性不再是文本本身的属性,而是关于说话者、听众和语境的一种情境化判断 (Arzberger et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib1))。毒性调节使这一点尤其明显,因为它涉及那些含义依赖于社会语用语境的语言形式 (Balayn et al. 2021 (https://arxiv.org/html/2607.23175#bib.bib3))。全局的毒性标签无法可靠地捕捉到这些区分,因为对毒性的感知在个体和社群之间系统性地变化,反映出身份、经验和规范的差异,而非噪声 (Sap et al., 2022 (https://arxiv.org/html/2607.23175#bib.bib35); Kirk et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib20))。将语言模型优化至单一的可接受语言标准,有可能与用户的偏好和沟通语境不匹配,这便推动了个性化毒性对齐的需求。
现有的对齐方法,如 RLHF (Ouyang et al., 2022 (https://arxiv.org/html/2607.23175#bib.bib28)) 和 DPO (Rafailov et al., 2023 (https://arxiv.org/html/2607.23175#bib.bib32)),通常将异质的判断聚合成一个训练信号。这产生了有用的通用安全行为,但也将分歧转化为单一优化目标,通常以牺牲少数群体的观点为代价 (Plank, 2022 (https://arxiv.org/html/2607.23175#bib.bib30); Sorensen et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib37))。
**无需训练的对齐** 提供了一种有希望的替代方案,可以在不训练单独个性化模型的情况下适应用户偏好 (Pan et al. 2025 (https://arxiv.org/html/2607.23175#bib.bib29))。这种方法不是在推理时更新模型权重,而是引导模型行为。尽管它在安全对齐 (Wang et al. 2024 (https://arxiv.org/html/2607.23175#bib.bib38))、风格控制 (Scalena et al. 2026 (https://arxiv.org/html/2607.23175#bib.bib36)) 以及提高事实性或帮助性 (Lin et al. 2024 (https://arxiv.org/html/2607.23175#bib.bib24)) 等任务上展现出潜力,但其在个性化毒性对齐方面的有效性尚未得到系统评估。
本文对用于个性化毒性敏感度对齐的无需训练的方法进行了比较评估。利用 PRISM 数据集 (Kirk et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib20)),我们推导出每个用户的毒性敏感度概况,并评估不同方法如何在不对基础模型进行微调的情况下,使模型输出更接近用户概况。我们比较了七种方法,涵盖在生成前通过条件化提示进行干预的方法(预解码)、在生成过程中通过修改词元概率或隐藏状态进行干预的方法(解码中)、以及在生成后通过从生成的候选项中进行选择进行干预的方法(后解码)(Pan et al. 2025 (https://arxiv.org/html/2607.23175#bib.bib29))。这些阶段有不同的权衡:预解码只需要输入访问权限但控制间接;解码中直接控制但需要模型内部信息;后解码可审计但受限于候选池。
我们的结果表明,无需训练的对齐可以有效地将现成模型引导至反映个体对毒性敏感度的语言,而不需重新训练:所有七种方法都将与用户特定毒性目标之间的距离减少了28%至47%,但在不同毒性类别上的得分不同(在**严重毒性**和**威胁**上提升最大)。预解码实现了最佳对齐,尽管部分是通过向更安全文本的广泛转变以及一定程度上牺牲知识保留来实现的,而解码中和后解码方法则针对每个用户最敏感的类别实现了更集中的减少。此外,不同人口统计群体的结果各不相同,包括一种干预措施反而降低了对齐效果的情况。这些发现表明,毒性敏感度对齐是一个多目标问题,需要能够同时考虑用户偏好、语言质量和子群体效应的方法和评估。
## 2 相关工作
我们将我们的工作置于毒性建模、毒性缓解和无需训练的模型对齐的背景下。
### 2.1 NLP 中的毒性建模
毒性建模传统上侧重于通过监督分类识别有害语言 (Röttger et al., 2022a (https://arxiv.org/html/2607.23175#bib.bib33); Garg et al., 2023 (https://arxiv.org/html/2607.23175#bib.bib13)) 以及减少生成模型中的有毒输出 (Pozzobon et al., 2023 (https://arxiv.org/html/2607.23175#bib.bib31); Dan et al., 2026 (https://arxiv.org/html/2607.23175#bib.bib11))。基于对齐的方法通过针对收集到的人类偏好优化模型行为,扩展了这一缓解议程。诸如基于人类反馈的强化学习 (RLHF) (Ouyang et al., 2022 (https://arxiv.org/html/2607.23175#bib.bib28)) 和直接偏好优化 (DPO) (Rafailov et al., 2023 (https://arxiv.org/html/2607.23175#bib.bib32)) 等技术已被证明可以减少毒性和有害性 (Dai et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib10); Chaudhary et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib8)),改善多语言去毒化 (Li et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib23)),并提高跨对话中对有毒交互的鲁棒性 (Kim and Lee, 2024 (https://arxiv.org/html/2607.23175#bib.bib19))。
然而,毒性建模和基于对齐的缓解都倾向于将危害操作化为一个全局目标:一种需要检测、评分、减少或优化的属性。这一假设正日益受到研究的挑战,这些研究表明毒性判断是依赖语境且具有社会情境性的。注释反映了注释者的视角和社会经验 (Sap et al., 2022 (https://arxiv.org/html/2607.23175#bib.bib35); Arzberger et al., 2026 (https://arxiv.org/html/2607.23175#bib.bib2)),因指令范式而异 (Röttger et al., 2022b (https://arxiv.org/html/2607.23175#bib.bib34)),并且依赖于不同有害概念之间的区分 (Cercas Curry et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib7))。因此,仇恨言论模型可能继承其训练数据集所编码的定义,而不是捕捉客观的危害概念 (Khurana et al., 2025 (https://arxiv.org/html/2607.23175#bib.bib18))。
这种情境性给主流对齐流程带来了实际挑战。由于 RLHF 和 DPO 通常依赖于对聚合偏好数据的额外训练,它们产生的是单一优化模型,而不是一种轻量级的、用于使毒性阈值适应个体用户或上下文的机制。因此,它们非常适合通用安全行为,但不太适合用户对哪些语言在上下文中被认为有害、可接受或必要存在分歧的情况。这激发了无需训练的方法,这些方法可以在推理时引导毒性行为,而不需要重新训练模型权重。
### 2.2 无需训练的对齐
无需训练的对齐在推理时引导模型输出,而不更新权重。我们区分三个干预阶段 (Pan et al., 2025 (https://arxiv.org/html/2607.23175#bib.bib29))。
**预解码** 方法在生成之前通过提示条件化或重写修改输入 (Lin et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib24); Cheng et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib9))。它们兼容黑盒,但提供间接的个性化,因为模型可能忽略、重新解释或过度泛化用户特定的毒性阈值。
**解码中** 方法在生成过程中进行干预,通过使用外部分类器或判别器重新加权词元概率 (Krause et al., 2021 (https://arxiv.org/html/2607.23175#bib.bib21); Yang and Klein, 2021 (https://arxiv.org/html/2607.23175#bib.bib40)),或通过激活引导和表示工程修改内部表示 (Wehner et al., 2025 (https://arxiv.org/html/2607.23175#bib.bib39); Scalena et al., 2026 (https://arxiv.org/html/2607.23175#bib.bib36)),其中的引导向量也可以直接从偏好对中学习,而不是从激活差异中计算 (Cao et al., 2024b (https://arxiv.org/html/2607.23175#bib.bib6))。它们通过实时塑造生成来实现个性化,但需要访问对数几率、解码循环或模型内部信息,并且如果应用过强可能会降低流畅度。
**后解码** 方法保持生成不变,使用外部评判器、分类器或用户特定评分函数对完整的候选项进行过滤、重新排序或选择 (Cao et al., 2024a (https://arxiv.org/html/2607.23175#bib.bib5); Ji et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib17); Oak et al., 2025 (https://arxiv.org/html/2607.23175#bib.bib27))。它们可审计且兼容黑盒,但将个性化限制在生成的候选池的多样性范围内。
这些阶段在无需重新训练的情况下个性化生成时提供了不同的权衡。然而,目前尚不清楚它们在同一用户特定的毒性敏感度概况下如何比较,以及干预措施是否改善了个性化还是主要引入了更强的质量和稳定性成本。在本工作中,我们进一步描述(第3.2节 (https://arxiv.org/html/2607.23175#S3.SS2))并评估(第3.3节 (https://arxiv.org/html/2607.23175#S3.SS3) 和 第3.4节 (https://arxiv.org/html/2607.23175#S3.SS4))七种无需训练的对齐方法:两种预解码提示级方法、三种解码中方法,以及一种带有两个距离匹配器的后解码重排序器。
## 3 比较评估
我们在一个共享基准上比较了七种用于个性化毒性敏感度对齐的无需训练方法。我们将个性化对齐作为主要评估指标,同时报告知识保留和生成质量以衡量对齐的权衡。
### 3.1 个性化目标
PRISM 数据集 (Kirk et al., 2024 (https://arxiv.org/html/2607.23175#bib.bib20)) 将参与者、提示和评分联系起来,允许评估针对个体用户而非单一全局毒性阈值的对齐情况。对于每个用户,我们使用 Perspective API¹ 构建一个毒性敏感度概况,这是一个广泛使用的毒性分类器,可对文本在多个伤害相关属性上进行评分。我们使用以下六个毒性类别:**毒性**、**严重毒性**、**身份攻击**、**侮辱**、**脏话** 和 **威胁**。
每个数据集记录包括一个提示 \(p\),一组可用响应 \(R = \{r_1, \dots, r_n\}\),以及用户 \(u\) 分配给响应 \(r\) 的可接受性评分 \(\rho_{u,r} \in [0, 100]\)。我们将用户对提示 \(p\) 的首选响应(即得分最高的响应)记为 \(r^\star_{u,p}\),并将用户 \(u\) 注释过的所有提示的历史记录记为 \(P_u\)。首先,我们将评分转换为不喜欢权重,如下所示:
\[
d_{u,r} = 1 - \frac{\rho_{u,r}}{100},
\]
这样,强烈不喜欢的响应将对概况贡献更多。然后,设 \(\tau_c(r)\) 为 Perspective API 在类别 \(c\) 上对响应 \(r\) 的得分。用户在类别 \(c\) 上的敏感度计算为他们评分的响应的、以不喜欢权重加权的平均毒性:
\[
s_{u,c} = \frac{\sum_{r \in P_u} d_{u,r} \tau_c(r)}{\sum_{r \in P_u} d_{u,r}}.
\tag{1}
\]
高值表示用户反复低评的毒性维度。我们使用用户跨六个毒性类别的敏感度向量 \(\mathbf{s}_u\) 作为评估我们方法的个性化信号。图1 (https://arxiv.org/html/2607.23175#S3.F1) 显示了这些敏感度在 PRISM 用户和类别之间的广泛差异,进一步说明了个性化对齐的必要性。然而,我们要强调,由于我们是根据自动毒性分数而非直接向用户询问来推断概况,因此应将其视为用户特定敏感度的代理,而非对感知伤害的确定性说明。
**图1:** PRISM 数据集中三位用户在六个毒性类别上的毒性敏感度得分 (\(s_u\))。
### 3.2 方法
我们比较了七种无需训练的对齐方法(分为第2.2节 (https://arxiv.org/html/2607.23175#S2.SS2) 中描述的三个干预阶段),以引导语言模型生成与用户敏感度对齐的响应。我们用符号标记每种方法所干预的阶段:⚡ 表示预解码,🔄 表示解码中,🔍 表示后解码。具体来说,给定用户的敏感度向量 \(\mathbf{s}_u\) 和一个新的提示 \(p^\prime\),我们引导模型生成一个与用户敏感度对齐的响应 \(r^\prime_p\)(参见第3.3节 (https://arxiv.org/html/2607.23175#S3.SS3) 的评估流程)。在所有情况下,我们避免将 Perspective API 作为方法的一部分,以确保评估流程的有效性。附录A (https://arxiv.org/html/2607.23175#A1) 提供了额外的实现细节和控制参数(例如 \(k\)、\(\alpha\) 和 \(\gamma\))的值。
#### 3.2.1 预解码 (⚡)
我们比较了两种只需要输入访问权限的方法,以评估个性化效果,而无需访问解码内部。相似文章
多语言语言模型中有毒内容检测与缓解策略综述
本综述综合了关于多语言大语言模型中有毒内容检测与去毒化研究,梳理了威胁模型、任务形式、检测方法和缓解策略,同时指出了持续存在的挑战,如语言覆盖不均衡以及危害定义的文化依赖性。
大型语言模型中的毒性测量与缓解:一项全面的复制研究
这项复制研究评估了DExperts在缓解LLM毒性方面的效果,发现其对显式毒性几乎完美安全,但对隐式仇恨言论效果降低,并且存在显著的延迟权衡。
PSK@EEUCA 2026:利用合成数据增强微调大型语言模型以检测游戏聊天中的多类毒性
本文介绍了一个用于 EEUCA 2026 游戏聊天毒性检测共享任务的系统,该系统通过结合合成数据增强微调 Llama 3.1 8B 模型,获得了第四名。文章重点阐述了一种“验证陷阱”现象:由于数据分布偏移,较高的验证分数与测试集表现并不相关。
大型语言模型应学习个性化而非聚合的人类偏好
这篇立场论文主张,大型语言模型应从个性化而非聚合的人类偏好中学习,指出社会选择理论中的理论局限性以及人口多样性带来的实际问题。它提出了有边界的个性化框架,在尊重个体自主性的同时维护普遍的安全约束。
更难防御:面向中文的通过隐式增强与混淆重写实现的毒性攻击
本文提出了CITA框架,用于生成中文隐式毒性攻击,以评估和改进大语言模型的毒性检测器,在测试模型上实现了较高的攻击成功率。