戳穿虚张声势:通过有序推理链正则化检测不断变化的恶意聊天对话
摘要
本文提出了BRACE,一种通过编码有序推理链来检测不断变化的恶意聊天对话的方法,在编码器和解码器骨干网络上均取得了较高的危害类型F1分数。
arXiv:2608.08451v1 公告类型:新
摘要:有害聊天对话通过类型转换和词汇规避不断变化,但我们发现它们共享不变的原则,即一个由循环主题、危害语言指标、严重性层级和类型特征组成的有序推理链(ORC),这有助于我们在频繁变化的词汇表达中捕捉关键信息。我们提出了BRACE,它将ORC编码为四个可微的阶段(主题 -> 指标 -> 严重性 -> 类型),并带有中间监督,作为与直接头部混合的结构化正则化器,同时得到基于原型的特征增强和特征路径解缠的支持。评估结果表明,在4个领域和5个危害类别中,BRACE实现了0.934的危害类型宏F1分数(RoBERTa-wwm-ext,3个种子的均值),解码器骨干(Qwen3-1.7B LoRA)则达到0.949。消融研究表明,所有组件都对BRACE有所贡献,且ORC的结构分解使BRACE能够区分具有语义模糊性的危害类型。免责声明:本文可能包含令某些读者不安的内容。
查看缓存全文
缓存时间: 2026/08/11 08:08
# 识破虚张声势:通过有序推理链正则化检测不断变化的有害聊天对话
来源:https://arxiv.org/html/2608.08451
郝杰宇1,2,3,姜子游1,2,3\\通讯作者,王俊杰1,2,3,李明阳1,2,3,黄跃凯1,2,3,黄杰1,2,3,王青1,2,3
###### 摘要
有害聊天对话通过类型转换和词汇规避而不断变化,然而我们发现它们共享不变的原则,即一个有序推理链(ORC),由反复出现的主题、有害语言指示符、严重性层级和类型特征组成,这有助于我们在频繁变化的词汇表达中捕捉关键信息。我们提出了BRACE,它将ORC编码为四个可微分阶段(Topic→\rightarrowIndicator→\rightarrowSeverity→\rightarrowType),并带有中间监督,作为与直接头(direct heads)混合的结构化正则化器,同时由基于原型的特征增强和特征路径解耦提供支持。评估结果表明,在4个领域和5个有害类别中,BRACE实现了0.934的有害类型宏F1(RoBERTa-wwm-ext,3种子均值),解码器骨干(Qwen3-1.7B LoRA)达到0.949。消融研究表明,所有组件都对BRACE有所贡献,且ORC的结构分解使BRACE能够区分具有语义歧义的有害类型。
免责声明:本文可能包含令部分读者不适的内容。
## 引言
在线聊天平台(如Slack、Freenode和Telegram)的激增对互联网舆论的产生和传播产生了巨大影响。由于恶意用户可以自由表达其观点,这些平台承载了多种有害类型,包括仇恨言论(Kiela et al.2020 (https://arxiv.org/html/2608.08451#bib.bib15))、骚扰和非法交易讨论,对用户安全和社区福祉构成紧迫风险(Khapre et al.2025 (https://arxiv.org/html/2608.08451#bib.bib13))。超过40%的美国成年人经历过网络骚扰,平台审核员面临日益增长的有害互动数量,这需要严格的监管和管理。一些研究者提出了自动方法(Huertas-García et al.2023 (https://arxiv.org/html/2608.08451#bib.bib7); Kang et al.2025 (https://arxiv.org/html/2608.08451#bib.bib12)),将预定义的恶意关键词纳入神经审核系统,以静态识别有害对话。
见图1:ORC用于有害对话检测的动机。
与在线帖子或文章等静态内容不同,聊天对话本质上具有对话性和不断变化的特点:恶意用户持续转换有害词汇表达,以保持有害意图并绕过互联网的内容监管,这一现象在内容审核研究中被称为词汇规避(Huertas-García et al.2023 (https://arxiv.org/html/2608.08451#bib.bib7))(图1 (https://arxiv.org/html/2608.08451#Sx1.F1))。如图1 (https://arxiv.org/html/2608.08451#Sx1.F1)所示,一名吸毒者发现“Drug”的明确中文术语被屏蔽,因此他们通过转换来规避关键词——采用俚语委婉说法“溜冰”(“ice skating”,甲基苯丙胺的常见街头术语);当“溜冰”被加入屏蔽列表时,他们改用其拉丁拼音拼写,对任何中文读者来说发音相同。一些近期工作利用思维链、检索或概念重现(Li et al.2025a (https://arxiv.org/html/2608.08451#bib.bib17),b (https://arxiv.org/html/2608.08451#bib.bib18); Mei et al.2025 (https://arxiv.org/html/2608.08451#bib.bib24); Jiang et al.2026a (https://arxiv.org/html/2608.08451#bib.bib10))来解决这一问题,但由于无法跟踪频繁变化的表达方式,这些方法无法识别此类有害对话,凸显了不断变化的有害对话检测的挑战。为解决这一问题,我们从“识破虚张声势”的扑克隐喻中汲取灵感:有害用户打赌检测器会被表面层面的词汇把戏所迷惑,然而他们潜在的交际意图——关于讨论了什么、有害信号出现在哪里、严重程度如何以及属于哪种类型的推理链——保持不变。因此,我们将有害检测分解为四阶段ORC(Topic→\rightarrowIndicator→\rightarrowSeverity→\rightarrowType)。无论有害用户写的是“溜冰”还是其他词,图1 (https://arxiv.org/html/2608.08451#Sx1.F1)表明推理链与“Drug”完全一致:主题仍然是Drug,因为上下文线索,即“价格”、数量单位和交易性措辞,无论使用哪个表面术语都将主题锁定为Drug;“溜冰”随后在该主题下激活为甲基苯丙胺委婉语,但在“运动”主题下则是惰性的。在上述案例中,我们可以看到ORC是有用的。然而,目前尚无工作正式定义ORC的结构,并通过实验结果解释其为何有效。因此,我们需要定义ORC的结构,并基于用户的对话交互模式推导其内容。此外,我们还需要说明ORC如何在对话语义模糊时准确区分不同有害类型,特别是第4节中的赌博(H2)和与欺诈相关的非法活动(H5)。
在本文中,我们提出了BRACE(混合推理链增强分类引擎,BlendedReasoning-chainAugmentedClassificationEngine)。受信息论中逐次细化思想的启发(Equitz and Cover1991 (https://arxiv.org/html/2608.08451#bib.bib2)),BRACE集成了三个组件。我们首先引入有序推理链(ORC),将有害检测分解为四个顺序步骤(Topic→\rightarrowIndicator→\rightarrowSeverity→\rightarrowType),并通过中间监督来正则化学习并解决语义歧义。然后,我们使用原型记忆库(Prototype Memory Bank)增强编码器表示,其中可学习的类别原型通过交叉注意力丰富特征,生成类别感知的表示以进行细粒度判别。最后,具有特征路径解耦的直接头(direct heads)将有害类型路由通过这些原型增强特征(70%)与链式推理混合(30%),而二分类和严重性从整体CLS嵌入中读取,从而消除任务间的梯度竞争。
我们在超过20个对话安全基准和3个额外领域特定来源上评估BRACE,涵盖不同的平台、语言和有害类别。使用RoBERTa-wwm-ext骨干,BRACE实现了0.934的有害类型宏F1和0.818的严重性准确率。二分类检测性能、逐类别诊断和跨骨干统计检验报告在表2 (https://arxiv.org/html/2608.08451#Sx4.T2)和技术补充材料中。解码器骨干进一步提升了性能,有害类型宏F1达到0.949。全面的消融研究证实ORC是主导机制,并验证了每个组件的贡献。可解释性分析表明,ORC产生了有意义的中间输出,即主题分布、指示符热图和证据片段,为审核决策提供了可审计性。
本文的贡献如下:
- •我们提出了BRACE,一种利用ORC来区分有害类型之间模糊边界的有害对话检测器,从而提高了对不断变化的有害对话的检测准确性。
- •我们在涵盖中文和英文平台的11个多样化对话来源上评估了BRACE,实现了0.934的宏F1,相比冻结编码器基线提升了+23.3%。
- •我们将发布代码和数据集,以促进BRACE的可复现性。
## ORC的定义
我们定义两个架构组件,它们共同指定了有害对话检测的结构属性。第3节描述其具体实现。
### ORC的基本结构
有害对话分析遵循自然的顺序结构,即识别讨论了什么主题、有害信号出现在哪里、危害有多严重以及属于哪种有害类型。这个四维结构被形式化为ORC的基本结构C=(f1,f2,f3,f4)\mathcal{C}=(f_{1},f_{2},f_{3},f_{4}),其中每个阶段以先前输出为条件,条件顺序为Topic→\rightarrowIndicator→\rightarrowSeverity→\rightarrowType。这种顺序分解建立了有害表达的深度依赖结构。**关键设计选择**:ORC用作结构化正则化器——即通过中间监督约束共享编码器——而非推理时的显式链式生成。这种设计避免了链式推理错误传播的高风险,同时保留了顺序分解的正则化益处。具体来说,我们引入一个链损失项Lchain\mathcal{L}_{\text{chain}},带有权重α\alpha。如果α≤0.5\alpha\leq0.5,模型严重依赖链路径进行预测,链充当主要分类器。如果α>0.5\alpha>0.5,直接头是主要推理路径。在我们的实验中,我们设置α=0.7\alpha=0.7,这反映直接头是主要推理路径。
### 原型记忆库:ORC的码本
原始编码器特征缺乏显式的类别级结构。我们定义一个原型记忆库P∈RC×K×D\mathbf{P}\in\mathbb{R}^{C\times K\times D},其中每个pc,k∈RD\mathbf{p}_{c,k}\in\mathbb{R}^{D}是类别cc的可学习语义锚点。原型记忆库包括以下三个功能:
- •特征增强。该库通过计算f\mathbf{f}与所有原型之间的相似度分数,将f↦faug\mathbf{f}\mapsto\mathbf{f}^{\text{aug}},聚合每个类别中匹配度最高的原型作为上下文向量,并通过交叉注意力与f\mathbf{f}融合。faug\mathbf{f}^{\text{aug}}编码了类别级语义,并作为有害类型分类的特征来源。
- •适应。原型通过基于动量的精细化来更新以匹配相近样本,并在现有原型无法充分表示某一样本时显式替换陈旧原型,从而确保对不断演变的表达模式的覆盖。
- •多样性保持。对比目标Lproto\mathcal{L}_{\text{proto}}将每个样本拉向其真实类别的所有KK个原型,同时推远其他原型;多样性项Ldiv\mathcal{L}_{\text{div}}惩罚类别内原型之间过高的成对相似度。
见图2:BRACE概览。
总之,这两个组件,即ORC和原型记忆库,构成了BRACE架构。预测头通过faug\mathbf{f}^{\text{aug}}路由有害类型分类,通过xcls\mathbf{x}_{\text{cls}}路由严重性或二分类检测。第3节规定了它们的具体实现。
## 方法论
我们现在将上述定义的每个架构组件实现为具体模块。有序推理链通过中间监督提供结构化正则化;直接头作为主要分类器,采用70/30混合;原型记忆产生类别感知特征;轻量级MoE路由器处理二分类检测。图2 (https://arxiv.org/html/2608.08451#Sx2.F2)提供了概览。
### 用阶段约束嵌入ORC
有序推理链使用可微分模块实例化C\mathcal{C}。如前所述,该链充当结构化正则化器,通过辅助监督约束共享编码器。
#### 阶段1:主题分析 f1f_{1}
(主题分析)将CLS表示xcls∈RD\mathbf{x}_{\text{cls}}\in\mathbb{R}^{D}映射到T=20\mathcal{T}=20个预定义对话主题上的分布,这些主题通过LLM辅助标注和人工审核得出:
z\displaystyle\mathbf{z}=softmax(MLPtopic(xcls)),\displaystyle=\text{softmax}\bigl(\text{MLP}_{\text{topic}}(\mathbf{x}_{\text{cls}})\bigr),(1)
MLPtopic\displaystyle\text{MLP}_{\text{topic}}:RD→RD/2→RT\displaystyle:\mathbb{R}^{D}\rightarrow\mathbb{R}^{D/2}\rightarrow\mathbb{R}^{\mathcal{T}}
主题分布作为下游推理阶段的上下文先验,支持主题条件下的歧义术语消解。
#### 阶段2:指示符检测 f2f_{2}
(指示符检测)接收标记级序列输出X∈RL×D\mathbf{X}\in\mathbb{R}^{L\times D}和来自f1f_{1}的主题分布z\mathbf{z},在I=32\mathcal{I}=32个有害语言指示符上产生标记级热图H∈RL×I\mathbf{H}\in\mathbb{R}^{L\times\mathcal{I}}(涵盖侮辱、威胁、毒品/赌博委婉语、自杀风险信号和基于身份的攻击;通过LLM辅助标注得出)。主题上下文通过Proj:RT→RD\text{Proj}:\mathbb{R}^{\mathcal{T}}\rightarrow\mathbb{R}^{D}投影,并在sigmoid激活前与每个标记的隐藏状态拼接:
Hl,:\displaystyle\mathbf{H}_{\ell,:}=σ(MLPind([xl;Proj(z)])),\displaystyle=\sigma\bigl(\text{MLP}_{\text{ind}}([\mathbf{x}_{\ell};\text{Proj}(\mathbf{z})])\bigr),(2)
MLPind\displaystyle\text{MLP}_{\text{ind}}:R2D→RD→RI\displaystyle:\mathbb{R}^{2D}\rightarrow\mathbb{R}^{D}\rightarrow\mathbb{R}^{\mathcal{I}}
主题条件化支持消歧:同一标记根据主题上下文激活不同指示符(例如,毒品委婉语在Drugs主题下激活,但在无关主题下不激活)。
#### 阶段3:严重性评估 f3f_{3}
(严重性评估)在五点量表上评估危害级别(L0:正常,L1:轻微,L2:中等,L3:严重,L4:极严重)。我们采用标记级隐藏状态上的注意力池化来产生严重性表示:
αl=softmax(MLPpos(xl)),vpool=∑l=1Lαl⋅xl\alpha_{\ell}=\text{softmax}\bigl(\text{MLP}_{\text{pos}}(\mathbf{x}_{\ell})\bigr),\quad\mathbf{v}_{\text{pool}}=\sum_{\ell=1}^{L}\alpha_{\ell}\cdot\mathbf{x}_{\ell}(3)
严重性logits为v^chain=MLPsev(vpool)\hat{\mathbf{v}}^{\text{chain}}=\text{MLP}_{\text{sev}}(\mathbf{v}_{\text{pool}}),其中MLPsev:RD→RD/2→R5\text{MLP}_{\text{sev}}:\mathbb{R}^{D}\rightarrow\mathbb{R}^{D/2}\rightarrow\mathbb{R}^{5}。
#### 阶段4:类型分类 f4f_{4}
(类型分类)将f2f_{2}的指示符特征与f3f_{3}的严重性上下文结合:
y^chain=MLPtype([Projind(h ̄);softmax(v^chain)])\hat{\mathbf{y}}^{\text{chain}}=\text{MLP}_{\text{type}}([\text{Proj}_{\text{ind}}(\bar{\mathbf{h}});\text{softmax}(\hat{\mathbf{v}}^{\text{chain}})]),
其中h ̄=1L∑lHl,:\bar{\mathbf{h}}=\frac{1}{L}\sum_{\ell}\mathbf{H}_{\ell,:},MLPtype:RD+5→RD→RC\text{MLP}_{\text{type}}:\mathbb{R}^{D+5}\rightarrow\mathbb{R}^{D}\rightarrow\mathbb{R}^{C},且C=5C=5。
#### 导览:为什么顺序推理是必要的
我们用来自语料库的一个具体例子说明链的顺序依赖性(图2 (https://arxiv.org/html/2608.08451#Sx2.F2),链路径)——一名玩家通过游戏术语(CS2 Discord)协调SWATing攻击:
> A:"这家伙偷窥了我们,我查了他的信息,搞到了完整装备"
> B:"不会吧,你已经有他的地址了"
> A:"还有他父母家,因为他最近表现得这么古怪,打算叫个健康检查"
> A:"在他直播的黄金时段,观众值得看到特别派送"
阶段1——主题(图2 (https://arxiv.org/html/2608.08451#Sx2.F2),阶段1)。f1f_{1}将对话锚定到TGaming Conflict(0.623)而非TGaming Social(0.148),从根本上重写了每个歧义术语:误分类主题会导致不可挽回的失败:每个下游阶段都会通过错误的框架进行解读。
阶段2——指示符。以TGaming Conflict为上下文,f2f_{2}激活了在TGaming Social下不可见的三个有害指示符:没有f1f_{1}的主题上下文,这三个指示符保持静默,f3f_{3}接收不到有害信号。
阶段3——严重性(图2 (https://arxiv.org/html/2608.08451#Sx2.F2),阶段3)。注意力池化集中在"addy"(0.187)、"parents' house"(0.154)和"wellness check"(0.141);组合信号将严重性推至L4 Critical(0相似文章
当答案未出,安全先溃:评测推理链中的有害行为检测
研究者发布 HarmThoughts 基准,含 1,018 条推理轨迹、56,931 句细粒度标注,用于逐步评估有害行为如何在推理过程中浮现,并揭示现有检测器对微妙不安全推理转折的盲区。
基于约束锚定的推理轨迹
提出CART,一种神经符号框架,将自然语言推理步骤与符号约束断言交织在一起,以在链式思维轨迹中早期检测并纠正多模态LLMs的错误。将雪球率从65%降低到14%,并在多个基准上提高了准确性。
隐藏于思维:可迁移的思维链痕迹诱导有害行为
研究受损语言模型中的有害思维链痕迹能否迁移不安全行为,并蒸馏为可复用的越狱攻击。结果发现,有害推理在痕迹和模式两个层面均可迁移,具备推理能力的模型脆弱性高出两倍以上。
AERIC:针对隐式有害对话的预期性隐藏状态监测
介绍AERIC,一种轻量级隐藏状态监测方法,用于检测LLM对话中的隐式有害内容,无需额外的前向传递,在强基线上实现了AUROC提升,且延迟开销极小。
风险链条:大型推理模型中的安全失效及通过自适应多原则引导进行缓解
本文研究了大型推理模型中的安全失效问题,即尽管最终答案安全,但推理轨迹中仍会出现有害内容,并提出了一种自适应多原则引导方法来缓解这些风险。