漂白仇恨、抹黑无害内容:针对基于LLM的内容审核的注释者风格反驳攻击
摘要
本文研究了基于LLM的仇恨言论审核对注释者风格反驳的敏感性,表明此类攻击会降低性能,并揭示了漂白和抹黑操作之间的方向性不对称。
查看缓存全文
缓存时间: 2026/08/25 04:28
# 洗白仇恨言论,抹黑无害内容:针对基于大语言模型仇恨言论审核的标注式反驳攻击 来源:https://arxiv.org/html/2608.22230 作者:刘开元(大连理工大学、浙江大学) 康景怡、纪德义、张海龙、朱兰君(中国科学技术大学、腾讯、同济大学) 邮箱:[email protected],[email protected] 朱琪、许博、杨亮、林鸿飞 (通讯作者) #### 摘要 大语言模型(LLMs)日益用于仇恨言论审核,常嵌入人机协作流程——审核员提供反馈后再作出最终决策。这种反馈机制引入两种操纵方向:将仇恨内容洗白为正常内容,或将正常内容抹黑为仇恨内容。本研究考察了初始正确模型判断对标注式反驳攻击的易感性,并分析了不同操纵方向下攻击效果的差异。我们提出**重判断协议**,扩展了直接矛盾方法,结合决策边界扰动与对抗性理据。在仇恨言论数据集上的多种LLM实验表明,标注式反驳会显著降低审核性能,多轮交互下效果更明显。结果进一步揭示,洗白与抹黑攻击在不同设置下存在稳定的、模型特异性的不对称性,表明存在方向性脆弱模式。显式推理提示和防御指令可减少但无法消除这些影响。研究结果强调人机审核流程中需建立方向感知的防护机制,并开发专门针对反馈鲁棒性的评估方法。 **免责声明**:本文包含可能具有冒犯性的示例。 ## 1 引言 在线仇恨言论可能对个人与社群造成严重心理伤害(参考文献9,见 https://arxiv.org/html/2608.22230#bib.bib10),推动了自动仇恨言论检测研究的广泛开展(参考文献6,见 https://arxiv.org/html/2608.22230#bib.bib12;参考文献2,见 https://arxiv.org/html/2608.22230#bib.bib11)。近期大语言模型在标准仇恨言论基准测试中表现优异(参考文献23,见 https://arxiv.org/html/2608.22230#bib.bib4;参考文献8,见 https://arxiv.org/html/2608.22230#bib.bib5),并越来越多地被整合到审核流程中以提升审查效率(参考文献11,见 https://arxiv.org/html/2608.22230#bib.bib1)。常见工作流为**人机协同审核**,即模型判断与人工审核相结合(参考文献3,见 https://arxiv.org/html/2608.22230#bib.bib7)。在策略引导的审核中,LLM决策可能还依据明确规则或政策框架(参考文献16,见 https://arxiv.org/html/2608.22230#bib.bib8;参考文献14,见 https://arxiv.org/html/2608.22230#bib.bib9)。LLM首先生成初步判断,审核员随后提供表达同意或不同意的反馈,模型据此修订决策。诚实的反馈有助于纠正模型错误,但同一交互通道也创造了攻击面:错误或误导性反驳可能推翻原本正确的判断。鉴于仇恨言论检测的主观性与语境依赖性,模型判断可能特别易受此类反馈影响,导致标签错误反转,破坏审核系统的实际可靠性。参见图1注释。 **图1**:人机审核中的反驳攻击示意图。洗白将仇恨样本引向正常标签,抹黑则将正常样本引向仇恨标签。 具体而言,此类操纵可分为两个方向。在**洗白**中,仇恨内容被重构为幽默、引言或无害的群体内语言,促使模型将正确的仇恨判断改为正常。在**抹黑**中,正常内容被重构为隐含偏见或隐语式滥用,促使模型将正确的正常判断改为仇恨。这些攻击分别导致审核不足与审核过度。 现有针对LLM分类器的攻击主要操纵初始指令或输入(参考文献18,见 https://arxiv.org/html/2608.22230#bib.bib2;参考文献25,见 https://arxiv.org/html/2608.22230#bib.bib3),对审核员反馈的安全性以及洗白与抹黑的方向性差异研究尚不充分。 为研究此漏洞,我们引入**重判断协议**。模型首先提交初始仇恨言论判断,然后在收到伪造的标注员反驳后重新评估输入。除直接攻击外,我们沿两个维度设计攻击设置:决策边界与推理依据。**边界攻击**扰动与模型决策边界相关的语言线索,而**理据攻击**提供支持对抗标签的误导性解释。我们进一步评估结合两策略的**组合攻击**,并将协议扩展至多轮设置,依次引入反驳以考察其影响是否随轮次累积或持续。 我们在两个仇恨言论数据集上评估多种LLM。结果表明,标注式反驳普遍削弱初始正确判断,而误导性理据与决策边界扰动进一步增加决策反转的可能性。此漏洞在多轮设置中更为显著。Logit级定量分析进一步表明,翻转率低估了攻击影响,因许多预测虽保持正确但置信度显著下降。我们还发现洗白与抹黑对模型的影响存在差异。对大多数模型而言,这种方向性不对称在不同攻击设置下保持稳定,形成模型特异性的行为特征。防御实验显示,显式推理提示和防御指令可减少但无法消除这些影响,凸显人机审核流程中方向感知防护的必要性。 本文贡献总结如下: - 引入研究人机仇恨言论审核中**标注式反驳攻击**的**重判断协议**,涵盖洗白与抹黑在四种攻击设置及多轮交互下的表现。 - 通过在多种LLM与两个仇恨言论数据集上的实验,揭示模型对伪造审核反馈的普遍脆弱性,并识别洗白与抹黑之间持续存在的模型特异性不对称性。 - 提供logit级分析、决策归因、多轮分析与防御分析,揭示置信度侵蚀、反驳效果的持续性、决策偏移模式差异以及当前缓解策略的局限性。 ## 2 重判断框架 我们将伪造的审核员反馈视为人机协同审核中的决策后攻击。从洗白与抹黑两个方向考察攻击,并设计四种标注式反驳策略。随后详述攻击与评估设置。 ### 2.1 任务概述 给定输入文本 \(x\)(黄金标签 \(y \in \{\text{仇恨},\text{正常}\}\)),模型首先接收固定审核指令并生成初步判断 \(\hat{y}_1\)。随后引入对抗性标注式反驳以支持相反标签 \(\bar{y}\),影响模型决策。在重判断阶段,模型接收原始输入、先前判断与对抗反驳,生成修订判断 \(\hat{y}_2\)。此设计反映了审核员反馈用于重新考虑现有决策的协同审核工作流。 我们的主要分析聚焦于初始分类正确的样本(即 \(\hat{y}_1 = y\))。当修订判断变为相反标签(即 \(\hat{y}_2 = \bar{y}\))时,攻击视为成功。原始输入与审核指令在两阶段保持不变,以评估标注式反驳如何影响初始正确判断。111为对比,我们也分析初始错误预测以评估模型根据审核员反馈纠正判断的能力;见附录B.3(https://arxiv.org/html/2608.22230#A2.SS3)。 ### 2.2 攻击设计 #### 攻击方向 对抗反驳主张与黄金标注相反的标签,沿两个方向操作: - **洗白**针对仇恨内容,将其重构为幽默、群体内语言或无明确敌意的内容,促使模型将正确的仇恨判断改为正常,增加审核不足风险。 - **抹黑**针对正常内容,归因于隐含偏见、隐语式敌意、有害刻板印象或歧视意图,促使模型将正确的正常判断改为仇恨,增加审核过度风险。 #### 反驳策略 仇恨言论判断取决于输入解读方式以及仇恨与正常之间的边界定义。审核员反馈可通过转移审核标准或重定向语境与意图解读来操纵这两个来源。结合直接反对基线,这些机制产生四种反驳策略: - **直接反驳**:明确拒绝初步判断,以最少理由支持相反标签。 - **边界反驳**:将区分仇恨与正常内容的标准向对抗判断偏移。 - **理据反驳**:提供支持对抗解读的实例特定解释。 - **边界+理据反驳**:结合偏移的审核标准与实例特定的对抗解释。 ### 2.3 实现方式 我们采用人机协同流程构建反驳攻击。针对基于边界的攻击,我们邀请语言学家为洗白设计更严格的内容仇恨标签阈值,为抹黑设计更宽松的阈值。针对基于理据的攻击,GPT-5.1生成候选对抗反驳,随后经人工审核以确保与预期攻击方向的一致性及与输入的相关性。边界+理据策略结合相应的边界准则与经验证的对抗性理据。更多细节(包括生成提示与人工验证流程)见附录A.1(https://arxiv.org/html/2608.22230#A1.SS1)。 ## 3 实验设置 #### 数据集 我们在两个仇恨言论数据集上进行实验:社会偏见推断语料库(SBIC)和隐性仇恨语料库(IHC)。SBIC包含涉及刻板印象与社会偏见的社交媒体帖子,IHC涵盖显性与隐性仇恨,侧重于语境依赖的隐性表达。我们将两个数据集的原始标注映射为二元标签(仇恨与正常)。数据集统计见表1(https://arxiv.org/html/2608.22230#S3.T1)。 **表1**:所用数据集的统计信息。 #### 骨干模型 我们评估多种闭源与开源权重LLM。主实验包括GPT-5.1、Gemini-2.5、Qwen3-8B与Gemma4-E4B。附录A1(https://arxiv.org/html/2608.22230#A1.T1)进一步评估Claude-4.5、Llama-3.1-8B-Instruct与Qwen3.5-9B以覆盖更广模型范围。所有模型温度设为0以确保评估期间生成一致性。 #### 评估指标 我们报告模型接收对抗反驳前后的准确率(Acc)与宏观平均F1分数(F1)。同时报告黄金仇恨样本与黄金正常样本的类别准确率,以分别评估模型对洗白与抹黑的抵抗能力。 ## 4 反驳攻击评估 ### 4.1 总体攻击有效性 表2(https://arxiv.org/html/2608.22230#S4.T2)报告四种代表性LLM在SBIC与IHC上受四种标注式反驳攻击前后的分类性能(%)。基于结果,我们观察到以下关键发现: **表2**:四种代表性LLM在SBIC与IHC上受标注式反驳攻击前后的分类性能(%)。Acc<sub>h</sub>与Acc<sub>n</sub>分别表示黄金仇恨样本与黄金正常样本的类别准确率。下标报告相对于基线的相对变化。正值与负值分别表示相对改进与下降。粗体标记攻击后最低性能。 **(1) 模型表现出独特且一致的漏洞模式** 总体而言,四种反驳策略均降低大多数模型的分类性能,但模型对特定攻击策略的敏感性差异显著。同时,每个模型最有效的攻击类型在SBIC与IHC间基本一致。GPT-5.1、Qwen3-8B与Gemma4-E4B在边界+理据下表现最差,而Gemini-2.5始终对纯边界攻击最脆弱。结果表明攻击有效性与最具破坏性的策略均具有强烈模型特异性。 **(2) 分类性能不能反映对反驳攻击的鲁棒性** 例如,GPT-5.1与Gemini-2.5-Pro在SBIC上基线性能相似(Acc分别为83.88%与84.75%),但在各自最强攻击下,GPT-5.1的Acc相对下降24.5%,而Gemini-2.5下降48.5%,揭示性能衰退程度显著不同。这表明基线审核能力与对反驳攻击的鲁棒性是两个独立维度,应分别评估。 **(3) 反驳攻击倾向于诱导方向性决策偏移** 对大多数模型与攻击设置,正常样本性能下降远剧烈于仇恨样本。例如在IHC上,整体最强的边界+理据攻击下,四个模型Acc<sub>n</sub>平均相对下降69.7%,而Acc<sub>h</sub>仅下降23.1%。这表明这些模型更易受抹黑攻击误导,将正常内容错误分类为仇恨。相反,Llama-3.1-8B表现出对洗白的相反倾向(见附录B.1,https://arxiv.org/html/2608.22230#A2.SS1)。此发现表明这种不对称性方向取决于具体模型。 ### 4.2 置信度水平分析 我们进一步在置信度水平分析模型决策。具体追踪黄金标签概率 \(P_g\) 在攻击前后的变化,定义 \(\Delta P_g = P_g^{\text{post}} - P_g^{\text{pre}}\)。每次攻击将样本划分为三个互斥结果(总和100%): - *翻转率(flip%)*:攻击后预测错误; - *漂移率(drift%)*:预测保持正确但 \(|\Delta P_g| > 0.15\); - *稳定率(stable%)*:预测保持正确且 \(|\Delta P_g| \leq 0.15\)。 图2(https://arxiv.org/html/2608.22230#S4.F2)报告两个代表性开源模型(Qwen3-8B与Gemma4-E4B)在SBIC上的结果。IHC结果见附录B.2(https://arxiv.org/html/2608.22230#A2.SS2)。 **图2**:原始判断正确分类的样本在SBIC上的置信度水平响应。\(P_g^{\text{pre}}\) 与 \(P_g^{\text{post}}\) 分别表示攻击前后的黄金标签概率。
相似文章
多数票压制少数价值观:HateXplain中仇恨/冒犯边界的标注者分歧
本文发现,HateXplain中42.6%的标注者分歧集中在仇恨/冒犯边界,表明多数票压制了少数价值观,导致模型对有争议的输入输出错误但高度自信的预测。
默认极化:LLM 内容策展中的推荐偏差审计
本文对 OpenAI、Anthropic 和 Google 的基于 LLM 的内容策展推荐偏差进行了大规模审计,使用了来自 Twitter/X、Bluesky 和 Reddit 数据的 540,000 次模拟选择。研究发现 LLM 系统性地放大极化现象,在毒性处理方面表现出不同的权衡,并显示出显著的政治倾向偏差,倾向于左倾作者,尽管数据集中右倾作者占多数。
注释者立场作为信号:针对反自闭症能力歧视检测的心理测量加权
本文介绍了一种基于偏见意识的评估框架,用于检测大语言模型中的反自闭症能力歧视语言,该框架使用基于注释者立场的心理测量加权真实值。研究发现,大语言模型经常将社区重新赋予的语言错误分类为能力歧视,并依赖表面关键词匹配而非上下文。
使用多LLM代理模拟仇恨言论级联:经验基础、建模保真度与干预策略
本文研究了Bluesky上的仇恨言论级联,并使用多LLM代理进行模拟,发现此类模拟再现了立场单一文化和毒性增量方向等关键模式,且在密集网络上进行放大器定位可使仇恨内容减少7.5%–12.9%,且良性副作用较低。
懂的都懂(但AI不懂):自动内容审核未能捕捉社群对去污名化用语的多元态度
# 懂的都懂(但AI不懂):自动内容审核未能捕捉社群对去污名化用语的多元态度 来源:[https://arxiv.org/html/2604.16654](https://arxiv.org/html/2604.16654) Christina Chance [christinachance315@gmail\.com](https://arxiv.org/html/2604.16654v1/mailto:[email protected]) [0000\-0002\-8254\-0670](https://orcid.org/0000-0002-8254-0670) 加州大学洛杉矶分校 洛杉矶 加利福尼亚州 美国 Rebecca Pattichis 独立研究员 Alb