新词,新毒性:基于共识的中文新词毒性检测——通过搜索增强的大语言模型

arXiv cs.CL 论文

摘要

本文提出了SeTox,一种搜索增强的大语言模型框架,通过利用实时网络上下文和公众共识来检测中文新词中的隐性毒性。实验表明,即使是3B规模的模型,在此任务上也优于近期更大的模型。

arXiv:2608.12361v1 公告类型:新 摘要:新词,即在意义或形式上新兴的术语,可能成为有毒表达的新载体,例如“country girl”作为针对女权主义的污名化标签。这类有毒新词看似良性,但已在公众共识中演变为有毒用法,对审核系统构成挑战,且尚未得到充分探索。在本文中,我们研究如何检测通过新词表达的隐性毒性。我们首先提出一个分类体系,涵盖有毒新词的起源和共识验证标准,随后构建了一个涵盖广泛观察到的风险类别的词典。为了捕捉基于公众共识的毒性,我们引入了SeTox,一种搜索增强框架,使静态大语言模型(LLMs)能够整合实时网络上下文进行新词毒性检测。实验表明,即使使用3B规模的模型,SeTox也优于近期的大规模模型,展示了其在有毒新词检测中整合现实世界知识的可扩展性。免责声明:本文包含可能令部分读者不适的冒犯性内容。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:25

# 新词、新毒性:基于共识的中文新词毒性检测与搜索增强LLM  
来源:https://arxiv.org/html/2608.12361  

Shiyao Cui¹¹*、Qinglin Zhang¹¹*、Di Wang²、Yida Lu¹、Zhexin Zhang¹、Jinhua Gao³、Jinglin Yang⁴,⁵,⁶、Min He⁴、Han Qiu²,⁷、Minlie Huang¹†  

¹清华大学计算机科学与技术系CoAI研究组  
²清华大学  
³中国科学院计算技术研究所  
⁴国家计算机网络应急技术处理协调中心  
⁵中国科学院信息工程研究所  
⁶中国科学院大学网络空间安全学院  
⁷清华大学(INSC)JCSS——广州数字科技集团有限公司  
[email protected][email protected][email protected]  

###### 摘要

新词(在意义或形式上新兴的词汇)可以成为毒性表达的新载体,例如“田园女”作为针对女权主义的污名化标签。这类毒性新词表面上看似良性,但在公众共识中已演变为毒性用法,对审核系统构成挑战,且尚未得到充分研究。本文探讨如何检测通过新词表达的隐性毒性。我们首先提出一个分类体系,概括毒性新词的来源与共识验证标准,随后构建了一个涵盖广泛观测风险类别的词表。为捕捉基于公众共识的毒性,我们引入了 **SeTox**,一种搜索增强框架,使静态大语言模型(LLM)能够整合实时网络上下文进行新词毒性检测。实验表明,即使使用3B规模的模型,SeTox也能优于近期的大规模模型,显示出其在融合现实世界知识进行毒性新词检测方面的可扩展性。  
**免责声明:** 本文包含可能令某些读者不适的内容。

# 新词、新毒性:基于共识的中文新词毒性检测与搜索增强LLM

Shiyao Cui¹¹*、Qinglin Zhang¹¹*、Di Wang²、Yida Lu¹、Zhexin Zhang¹、Jinhua Gao³、Jinglin Yang⁴,⁵,⁶、Min He⁴、Han Qiu²,⁷、Minlie Huang¹†  

¹清华大学计算机科学与技术系CoAI研究组  
²清华大学  
³中国科学院计算技术研究所  
⁴国家计算机网络应急技术处理协调中心  
⁵中国科学院信息工程研究所  
⁶中国科学院大学网络空间安全学院  
⁷清华大学(INSC)JCSS——广州数字科技集团有限公司  
[email protected][email protected][email protected]  

## 1 引言

新词,即意义上或形式上新出现的词项(Huang 等,2025;Zheng 等,2024),是数字时代中文词汇创新的重要组成部分。“芭比Q”(意为“完蛋了”)“YYDS”(意为“永远滴神”)等词在网络论坛和游戏社区广泛传播,引发了学界对这类新兴语言现象的大量关注(Cornwall,2007;Liu 等,2020)。

广泛使用的新词能够通过逐步稳定共同意义和用法,形成新的*语言共识*,体现在公共交流规范中。这种共识通常体现为两个方面。**1)常规词的新意义**:既有词汇或表达发生语义扩展。如图1上半部分所示,“安卓”(Android)原指谷歌的移动操作系统,但由于社会刻板印象,已扩展出“低端”“劣质”的含义。**2)新兴概念的新提法**:指新出现的表达,其意图含义超越字面解读。例如,“田园女”(字面为“乡村女性”)看似指农村女性,却在网络话语中成为针对女权主义的污名化标签。

<figure>  
  <figcaption>图1:毒性新词表达示例。</figcaption>  
</figure>  

尽管新词丰富了表达方式,图1中的示例也说明它们可能成为隐性表达毒性的新工具。与依赖脏话或侮辱语的显性毒舌语言不同,这些表达在字面上往往良性、演化快速,因此难以预判。在包含此类隐性毒性新词的50个句子的试点研究中,主流审核服务的检出率低于20%,包括Google的Perspective API(Lees 等,2022)和百度的审核API(Team,2025a)。这些结果表明,通过新词表达的隐性毒性对内容安全系统构成了实质性挑战。

鉴于新词的普遍性及其承载毒性的能力,本文旨在研究**如何识别通过新词表达的隐性毒性**。为实现上述目标,我们的研究包括以下三个方面:

1. **构建新词分类体系及基于共识的毒性验证标准。** 为系统研究新词中介的毒性,我们首先对其来源和表达毒性的语义特征进行分类。为避免过度估计毒性,我们进一步引入基于公共语境的判据,验证该毒性承载意义是否已形成共识。

2. **设计从数据中筛选毒性新词的工作流程。** 鉴于此类数据资源的稀缺性,我们开发了一套从候选词收集、共识验证到人工审查的工作流,最终形成一个涵盖五种典型风险类别的毒性新词词表。

3. **提出基于现实世界信息增强的毒性(SeTox)检测方法。** 针对新词语义快速演化的特点,我们为LLM配备搜索能力,检索最新的在线上下文作为参考。这使得检测可以在测试阶段借助公共上下文进行扩展,适应快速的语言演化,而无需昂贵的重训练。

综上,我们率先系统探讨了新词的毒性承载能力。我们构建了包含974个毒性新词的词表,每个词都带有专业标注的元数据,包括传统含义、新兴用法和语义演化。在此基础上,SeTox为静态LLM配备搜索工具以实现实时适应,使轻量模型(如3B/7B)在检测新兴毒性表达时优于更强大的模型(如Qwen3-Max和Gemini-3-flash-preview)。鉴于在线审核注重效率且无法频繁重训练,SeTox为追踪快速演化的毒性表达提供了一种可扩展的解决方案,适用于现实部署。代码已开源:https://github.com/thu-coai/Setox。

## 2 分类体系

### 2.1 新词来源

我们首先探索新词的来源,识别出促进这类新型语言演化的4个主要类别。

1. **网络社区**:社交媒体平台、游戏评论区、在线论坛等数字网络论坛。例如,游戏社区产生了“菜狗”一词,广泛用于指“菜鸟”或“新手玩家”。

2. **媒体与娱乐**:电影、电视剧和直播节目常常普及具有新意义的表达。例如,电影《西虹市首富》中的“大聪明”成为对自以为是的天才的嘲讽。

3. **公共事件**:重大公共事件可以为语言赋予新的共识。例如,犯罪事件的曝光使“N号房”成为性暴力的代名词。

4. **文化与民俗**:文化符号或民俗活动可以产生广泛使用的表达。例如,“机车”被隐喻地用于形容某人“挑剔”或“难缠”。

### 2.2 毒性新词的特征

与传统毒性语言相比,新词在表达毒性时呈现出以下特征:

1. **字面良性**:表达在表面上中立或良性,能够掩盖毒性意图并绕过直接检测。

2. **动态演化**:新词含义随时间变化,使其具有高度适应性,难以用静态规则或模型捕捉。

3. **依赖共识**:只有当某个新词的危害含义已在社区共识中稳定下来时,才应将其视为有毒。否则可能导致过度估计毒性。

### 2.3 共识标准

鉴于新兴表达的快速演化,我们重点关注毒性含义已达成共识的词语。由于公共网络文本能够捕捉先前未见表达的频率和语义模式(Kilgarriff and Grefenstette,2003;Keller and Lapata,2003),它们自然可以作为共享语言使用和意义的证据。同时,搜索引擎通过聚合和排序公开可得内容,提供了一种大规模获取网络信息的有效方式,其结果能够反映公众对特定表达的显著性和可见性(Mellon,2014;Scharkow and Vogelgesang,2011)。因此,我们使用流行的搜索引擎(如Google)作为工具,检索多样化的网络上下文进行共识验证。如果能在搜索结果首页识别出毒性含义或用法,则该词被视为已形成公开的毒性共识。

### 2.4 风险类别

基于在线话语中常见的毒性,我们注意到毒性新词通常涉及以下5类:

1. **贬损攻击**:用于侮辱或嘲笑个人或群体的词语。例如,“安卓”被用来描述被认为“低端”或“缺乏品质”的人,带有歧视性。

2. **敏感话题**:对政治或社会敏感问题的间接指涉,例如“落榜艺术生”,含沙射影地暗指阿道夫·希特勒,暗示极端主义后果。

3. **不道德行为**:暗示违反主流伦理或社会规范的行为,例如“劈腿”指恋爱关系中的不忠。

4. **成人内容**:带有性暗示或露骨含义的委婉说法,例如“为爱鼓掌”指性行为。

5. **非法活动**:对暴力、毒品或赌博等犯罪行为的隐晦指涉。“开盒”一词指非法人肉搜索,获取他人隐私信息。

## 3 词表构建

<figure>  
  <table>  
    <caption>表1:所构建词表中的一个示例词条。</caption>  
  </table>  
</figure>  

我们构建了一个包含974个词条的词表,详细构建过程如下。

### 3.1 候选词收集

为构建一个较为全面的中文网络话语中潜在毒性表达词表,我们从三个来源收集候选词。

**众包平台。** 由于存在定期汇编网络新词的公共论坛,我们首先直接从“梗百科”(Ke,2025)、“梗VIP”(VIP,2025)和“萌娘百科”(moegirl,2025)等来源收集候选词。我们手动抓取这些来源中在现实用法中可能传达毒性、但表面形式看似良性的词。

**现有研究。** 为保证更广的覆盖范围,我们还梳理了中文毒性语言的现有研究。具体来说,从已有数据集(如State ToxicNL(Lu 等,2023)和ToxiCN(Bai 等,2025b))中提取词语。结合毒性新词的特点,我们识别出那些在毒性标注句子中被标注、但表面形式本身并非毒性的词。

**真实场景。** 为进一步扩充词表,我们从现实社交媒体话语中收集更多词条。微博(Sina,2025)是中文网络平台中最受欢迎的之一。为最大化覆盖毒性承载表达,我们抓取容易引发冲突或争议的话题(如性别相关讨论和食品安全问题)下的原始评论。利用之前收集的种子词和句子作为示例,使用Qwen3-8B(Team,2025b)从收集的评论中识别潜在的新词表达。该过程的详细指令见附录I.1。

<figure>  
  <figcaption>图2:词表构建与SeTox的简单示例。</figcaption>  
</figure>  

### 3.2 毒性承载词识别

基于上述候选词,我们旨在识别可能承载毒性的词。为避免过度估计毒性,我们依据从公开信息源获得的公共语义共识来验证其毒性。由于搜索引擎聚合并对来自不同公共来源的广泛传播解读进行排序(Vu 等,2024;Zhang 等,2025),其结果能够反映一个词的主导性解读和社会重要性。因此,我们根据某个词的前9条Google搜索结果(尤其是摘要信息)来判断每个候选词的安全性。将检索到的公开描述作为上下文证据,指示Qwen3-Max(Qwen-Team,2024c)判断一个词是良性的还是可用于预定义的风险类别(详细指令见附录I.2)。被判定为不安全的词被收录入词表,最终形成精选词表。

### 3.3 元数据获取

为便于深入理解语义演化,我们为每个词条构建结构化元数据,包括传统含义、当前含义、来源、语义漂移的解释和一个示例句。利用检索到的开放域信息作为上下文,再次指示Qwen3-Max为每个词条生成结构化元数据。该扩充过程的详细指令见附录I.3。由此得到的富化元数据为新兴表达如何及为何随时间演变为毒性提供了明确的上下文依据和解释证据。表1展示了一个完整填填元数据的词条示例。

### 3.4 质量控制

为确保词表质量,我们邀请本文作者及其同事作为标注者(详见附录D)。审查过程分两轮进行。首先,每位标注者被分配一批词条,检查其毒性和元数据。对有争议的毒性含义,集体讨论决定该词条应保留还是删除。元数据中发现的错误由人工修正。第二轮中,将词条重新分配给不同的标注者进行验证。经过质量控制,我们最终获得了包含974个词条的词表,每个词条都附带如表1所示的元数据。

相似文章

多语言语言模型中有毒内容检测与缓解策略综述

arXiv cs.CL

本综述综合了关于多语言大语言模型中有毒内容检测与去毒化研究,梳理了威胁模型、任务形式、检测方法和缓解策略,同时指出了持续存在的挑战,如语言覆盖不均衡以及危害定义的文化依赖性。