基于采样BPE标记统计的中文网络级语料库审计
摘要
本文介绍了Sampled-BPE,一个轻量级的标记级审计流水线,用于中文网络规模语料库,并应用它揭示了开放中文数据集和Common Crawl快照中广泛但不均匀的污染。文章还发布了一个包含超过63万条带上下文和解释的污染标记记录的分层数据集。
查看缓存全文
缓存时间: 2026/08/12 08:36
# 通过采样BPE词元统计审计中文Web规模语料库 1注意:本文可能包含冒犯性和令人不安的内容。来源:https://arxiv.org/html/2608.10678 Qingjie Zhang1, Ziqi Tang1, Jie Zhang2, Gelei Deng3, Jinfeng Li4, Yuefeng Chen4, Yitong Yang4, Hui Xue4, Tianwei Zhang3, and Han Qiu1\* 1清华大学 2SiliconProspect AI 3南洋理工大学 4阿里巴巴集团 邮箱:\{qj\-zhang24@mails\., qiuhan@\}tsinghua\.edu\.cn \*通讯作者
###### 摘要 中文网络污染已经在大语言模型中浮现,促使对上游中文语料库进行审计。然而,审计此类语料库面临三个挑战:(1)其网络规模的体量使得全面扫描成本高昂;(2)以往的分析往往过于粗糙,无法暴露词元级别的污染;(3)中文网络污染具有隐晦性和快速变化性。我们提出了Sampled\-BPE,一种轻量级的词元级审计流程,通过采样一小部分子集并训练BPE分词器来暴露受污染的词元。实验表明,Sampled\-BPE在显著降低运行时间和内存的同时保持了可用的估计:148.4×\times加速和35.8×\times内存缩减仅引入4.25%的污染类别相对误差。我们将该流程应用于11个开放中文语料库和2021年至2026年的6个中文Common Crawl快照。审计揭示了开放语料库中广泛但分布不均的污染,以及高度污染且随时间变化的中文网络内容。我们进一步发布了一个层级化中文网络词元数据集111https://github.com/qingjiesjtu/SampledBPE,包含63万+词元记录,每条记录包含网络上下文、类别和解释字段,组织为9.2万+棵树,以支持污染的审查和追溯。通过采样BPE词元统计审计中文Web规模语料库 1注意:本文可能包含冒犯性和令人不安的内容。Qingjie Zhang1, Ziqi Tang1, Jie Zhang2, Gelei Deng3, Jinfeng Li4, Yuefeng Chen4, Yitong Yang4, Hui Xue4, Tianwei Zhang3, and Han Qiu1\* 1清华大学 2SiliconProspect AI 3南洋理工大学 4阿里巴巴集团 邮箱:\{qj\-zhang24@mails\., qiuhan@\}tsinghua\.edu\.cn \*通讯作者
## 1 引言 中文网络污染已经在大语言模型中出现,包括ChatGPT词汇中的垃圾邮件和色情相关中文词元(Yang,2024 (https://arxiv.org/html/2608.10678#bib.bib46))以及Codex输出中的中文赌博内容(OpenAI Developer Community,2026 (https://arxiv.org/html/2608.10678#bib.bib47))。结合近期将受污染中文词元与语料库污染联系起来的工作(Zhanget al\.,2025 (https://arxiv.org/html/2608.10678#bib.bib39)),这些观察促使我们审计上游中文语料库,以了解此类污染源自何处、其普遍程度如何,以及它可能如何传播到下游数据集中。然而,审计上游中文语料库仍然困难。\*第一*,主流中文语料库通常是网络规模的,包含数百GB到TB级别的文本(Yuanet al\.,2021 (https://arxiv.org/html/2608.10678#bib.bib29); Chenet al\.,2023 (https://arxiv.org/html/2608.10678#bib.bib21); Heet al\.,2023 (https://arxiv.org/html/2608.10678#bib.bib12); Oepenet al\.,2025 (https://arxiv.org/html/2608.10678#bib.bib18))。全面扫描此类语料库成本高昂(Penedoet al\.,2023 (https://arxiv.org/html/2608.10678#bib.bib4),2024 (https://arxiv.org/html/2608.10678#bib.bib8); Abbaset al\.,2023 (https://arxiv.org/html/2608.10678#bib.bib37)),例如,在128核CPU节点上索引83TB数据需要99天(Xuet al\.,2025 (https://arxiv.org/html/2608.10678#bib.bib9))。\*第二*,现有的语料库分析往往停留在粗粒度层面,例如语言分布、来源域名或文档级别的质量分数(Dodgeet al\.,2021 (https://arxiv.org/html/2608.10678#bib.bib34); Kreutzeret al\.,2022 (https://arxiv.org/html/2608.10678#bib.bib35); Soldainiet al\.,2024 (https://arxiv.org/html/2608.10678#bib.bib10); Hagar and Bandy,2025 (https://arxiv.org/html/2608.10678#bib.bib40))。这些视图描述了语料库的整体构成,但无法揭示词元级别的细粒度污染。\*第三*,中文网络污染通常是隐晦且快速变化的(MacAvaneyet al\.,2019 (https://arxiv.org/html/2608.10678#bib.bib53); Jianget al\.,2021 (https://arxiv.org/html/2608.10678#bib.bib52); Zhanget al\.,2025 (https://arxiv.org/html/2608.10678#bib.bib39))。预定义的关键词列表可能遗漏新出现的受污染词元并迅速失效。这些挑战共同呼唤一种轻量级、词元级、可定期执行的审计流程。参见图1:海洋污染监测的启示:采样子集,训练分词器,映射词元级污染信号,并估计语料库概况。受海洋污染监测(如图1所示)的启发(Karydis and Kitsiou,2013 (https://arxiv.org/html/2608.10678#bib.bib51)),该方法通过采样观测来估计整体污染,我们提出了Sampled\-BPE,一种在全面检查成本过高时审计网络规模中文语料库的简单而有效的流程。具体来说,我们采样一小部分子集,训练字节对编码(BPE)分词器(Sennrichet al\.,2016 (https://arxiv.org/html/2608.10678#bib.bib49))以揭示并统计高频词元,利用互联网搜索证据将这些词元映射到内容类别,并将词元统计聚合为语料库级别的概况。这种设计避免依赖固定的关键词列表,保持词元级审计,并使得随着中文网络污染的演变进行重复审计成为可能。实验表明,Sampled\-BPE在显著降低运行时间和内存的同时保持了可用的词元级和类别级估计。使用该流程,我们发现污染在开放中文语料库中广泛但分布不均。我们进一步表明,中文Common Crawl(Common Crawl,2011 (https://arxiv.org/html/2608.10678#bib.bib11))污染严重且随时间变化,表明需要定期进行上游审计。最后,我们发布了一个层级化中文网络词元数据集,使这些词元级发现可供审查。本工作有三项贡献:- ∙\\bullet方法。我们提出并验证了Sampled\-BPE,一种用于网络规模中文语料库词元级审计的轻量级流程。它将词元级审计成本从数月降低到数小时,同时保持可用的估计。 - ∙\\bullet结果。我们系统性地审计了11个开放中文语料库和2021年至2026年的6个上游中文Common Crawl快照,揭示了广泛且变化的污染。例如,2026年中文Common Crawl快照中68.72%的内容为成人内容。 - ∙\\bullet数据集。我们发布了一个层级化中文网络词元数据集,包含630,684条词元记录,每条记录包含网络上下文、类别和解释字段。该数据集将词元组织为92,972棵树,支持互联网污染的审查和追溯。
## 2 背景 在本节中,我们首先总结本文审计的语料库,然后讨论语料库审计和中文网络污染的相关工作。
### 2\.1 开放中文语料库与规模分布 参见图2:本工作中审计的中文网络语料库规模分布。LLM语料库涵盖从MB级文档、GB级微调数据、TB级预训练语料库到PB级上游网络存档(Wanget al\.,2018 (https://arxiv.org/html/2608.10678#bib.bib42); Longpreet al\.,2023 (https://arxiv.org/html/2608.10678#bib.bib43); Brownet al\.,2020 (https://arxiv.org/html/2608.10678#bib.bib44); Common Crawl,2011 (https://arxiv.org/html/2608.10678#bib.bib11))。在本工作中,我们使用“网络规模”来指代TB级别的语料库(Liet al\.,2025 (https://arxiv.org/html/2608.10678#bib.bib41); Roziewski and Stokowiec,2016 (https://arxiv.org/html/2608.10678#bib.bib45))。图2 (https://arxiv.org/html/2608.10678#S2.F2)将本工作审计的中文语料库置于这一规模分布中。主流开放中文语料库包括广泛多语言语料库的中文部分,如OSCAR(Abadjiet al\.,2022 (https://arxiv.org/html/2608.10678#bib.bib14))、mC4(Xueet al\.,2021 (https://arxiv.org/html/2608.10678#bib.bib16))、HPLT(Oepenet al\.,2025 (https://arxiv.org/html/2608.10678#bib.bib18))、CulturaX(Nguyenet al\.,2024 (https://arxiv.org/html/2608.10678#bib.bib20))和ROOTS(Laurençonet al\.,2022 (https://arxiv.org/html/2608.10678#bib.bib22));以及中文专属发布,如CWT(Chenet al\.,2023 (https://arxiv.org/html/2608.10678#bib.bib21))、WanJuan(Heet al\.,2023 (https://arxiv.org/html/2608.10678#bib.bib12))、MAPCC(Duet al\.,2024b (https://arxiv.org/html/2608.10678#bib.bib25))、SkyPile(Weiet al\.,2023 (https://arxiv.org/html/2608.10678#bib.bib27))、CCI3(Wanget al\.,2024 (https://arxiv.org/html/2608.10678#bib.bib28))和WuDao(Yuanet al\.,2021 (https://arxiv.org/html/2608.10678#bib.bib29))。详细描述见附录A (https://arxiv.org/html/2608.10678#A1)。
### 2\.2 相关工作 参见图3:Sampled\-BPE审计流程的概念总览。它对网络规模语料库进行采样,训练并统计BPE词元,利用互联网证据将词元映射到内容类别,并将词元统计数据聚合为语料库污染概况。#### 语料库整理与审计。网络规模语料库通常通过来源选择、语言识别、质量过滤、安全或黑名单过滤以及去重,从网络文本中整理而成(Penedoet al\.,2024 (https://arxiv.org/html/2608.10678#bib.bib8); Soldainiet al\.,2024 (https://arxiv.org/html/2608.10678#bib.bib10); Weberet al\.,2024 (https://arxiv.org/html/2608.10678#bib.bib7); Penedoet al\.,2023 (https://arxiv.org/html/2608.10678#bib.bib4))。先前的文档记录和审计工作进一步提高了透明度,并揭示了意外来源、低质量文本、重复、污染和过滤副作用等残余风险(Leeet al\.,2022 (https://arxiv.org/html/2608.10678#bib.bib36); Kreutzeret al\.,2022 (https://arxiv.org/html/2608.10678#bib.bib35); Dodgeet al\.,2021 (https://arxiv.org/html/2608.10678#bib.bib34); Gebruet al\.,2021 (https://arxiv.org/html/2608.10678#bib.bib32))。这些研究主要考察来源级、文档级、质量级或去重级属性。相比之下,我们的工作在词元级别审计语料库。#### 中文网络污染与受污染词元。研究社区已报告了多起中文网络污染在大语言模型中浮现的案例。例如,它出现在GPT词汇中:GPT\-4o发布后,研究人员报告称其许多最长中文词元不是普通词语,而是与垃圾邮件、色情、赌博或诈骗相关的长短语(Yang,2024 (https://arxiv.org/html/2608.10678#bib.bib46))。此外,它甚至可能出现在原本正常任务的输出中:用户报告Codex输出在编程上下文中意外插入中文赌博或彩票类字符串,包括在apply\_patch输出周围和格式错误的工具调用文本中(OpenAI Developer Community,2026 (https://arxiv.org/html/2608.10678#bib.bib47))。近期工作通过大语言模型词汇中的受污染词元研究这一问题,将其存在与可能的训练语料库污染联系起来(Zhanget al\.,2025 (https://arxiv.org/html/2608.10678#bib.bib39))。然而,这些观察检查的是下游模型而非上游语料库。
## 3 Sampled\-BPE 为了实现网络规模中文语料库的低成本且准确的污染审计,Sampled\-BPE并不旨在重建完整词汇表。相反,它近似语料库的词元级和类别级统计。
### 3\.1 审计流程 图3 (https://arxiv.org/html/2608.10678#S2.F3)给出了四阶段审计流程的概念总览。参见图4:采样保持审计准确性。左:词元级覆盖率和词元比率相关性,标注0.25%采样率。中:类别级加权相对误差,标注0.25%采样率。右:0.25%采样率与Full的类别组成比较。#### 第1步:流式采样。给定目标语料库,我们在单次顺序遍历中采样文档。与需要枚举或打乱文档标识符的随机采样相比,流式采样使采样成本几乎线性于输入扫描。这一系统选择减少了I/O,避免了对大型语料库的完全物化,同时产生与随机采样相当的审计准确性(详细比较见附录C (https://arxiv.org/html/2608.10678#A3))。#### 第2步:BPE训练与计数。我们在所选语料库上训练BPE分词器,并使用同一分词器统计词元频率(Sennrichet al\.,2016 (https://arxiv.org/html/2608.10678#bib.bib49))。我们使用BPE有三个原因。\*第一*,因为BPE是一种压缩方法,反复合并频繁出现的相邻单元,其学到的词汇表会暴露表征语料库的重复词汇模式。\*第二*,可以在不依赖固定关键词列表的情况下暴露高频受污染词元,从而发现新的污染术语(MacAvaneyet al\.,2019 (https://arxiv.org/html/2608.10678#bib.bib53); Jianget al\.,2021 (https://arxiv.org/html/2608.10678#bib.bib52); Zhanget al\.,2025 (https://arxiv.org/html/2608.10678#bib.bib39))。\*第三*,BPE对于网络规模审计是高效的:训练由固定合并预算下的局部相邻对频率统计驱动,计数仅需使用学到的分词器进行线性遍历,而无需昂贵的文档级语义分析。#### 第3步:类别映射。受污染词元通常隐晦、缩写或依赖上下文:单独的词元可能无法揭示其类别。因此,受先前中文受污染词元检测工作的启发(Zhanget al\.,2025 (https://arxiv.org/html/2608.10678#bib.bib39)),我们将词元与互联网搜索结果作为上下文证据,映射到六个内容类别之一:正常内容、成人内容、在线赌博、在线游戏、在线视频和异常。为自动化此步骤,我们使用GLM\-4\-32B(一个具有强大中文理解能力的开源中文LLM)作为基础类别分类器。该模型在Zhang等人(2025 (https://arxiv.org/html/2608.10678#bib.bib39))对GPT中文词汇的专家标注所构建的训练/测试划分上进行微调,以从每个词元及其对应的互联网搜索结果预测类别。微调后在测试划分上达到97.32%的分类准确率。#### 第4步:语料库概况分析。我们将词元频率与类别分配结合,构建语料库概况。在词元级别,概况记录每个词元的比率、预测类别、互联网证据和分类理由。这使得后续可以分析共享受污染词元、语料库特定污染术语和高频词汇演变。在类别级别,我们将词元比率聚合为类别流行度和总污染比率,这些是后续语料库级别比较和时间分析中报告的指标。我们将未采样的语料库称为Full。在以下实验中,每个采样语料库使用同一流程进行审计,并与Full进行比较,以评估采样是否保留了污染分析所需的词元级和类别级统计。
### 3\.2 采样保持审计准确性 我们首先询问Sampled\-BPE是否保留了审计语料库污染所需的词元级和类别级统计,即采样是否给出了对Full的可接受近似。对于每个采样率,我们将采样语料库与Full进行比较。令VFullV\_\{\\mathrm\{Full\}\}表示从Full提取的词元集合,令VsampleV\_\{\\mathrm\{sample\}\}表示从采样语料库提取的词元集合并计算覆盖率等指标。我们使用覆盖率衡量采样词元集合对完整词元集合的表征程度,使用词元比率相关性衡量词元频率分布的一致性,并使用类别级加权相对误差衡量类别聚合的准确性。我们将采样率从0.01%变化到1%,并在我们审计的语料库上评估这些指标。图4 (https://arxiv.org/html/2608.10678#S3.F4)左侧面板显示,随着采样率增加,词元覆盖率迅速上升。在0.25%的采样率下,大多数语料库的词元覆盖率超过60%,词元比率相关性与Full相比达到0.95以上。中间面板显示,类别级加权相对误差随采样率增加而下降;在0.25%时,所有语料库的加权相对误差低于5%,其中多数低于3%。右侧面板进一步显示,在0.25%采样率下,各语料库的类别组成与Full高度一致,类别比例的绝对差异大多小于1个百分点。这些结果表明,0.25%的采样率在成本与准确性之间提供了良好的权衡。因此,在后续实验中,我们默认使用0.25%的采样率。相似文章
Pruned BPE: Post-training Visibility Pruning and Token Reallocation for Byte Pair Encoding
This paper proposes Pruned BPE, a post-training method that prunes low-exposure tokens from a BPE vocabulary and reallocates slots to better-exposed candidates, reducing encoded length without increasing model-visible vocabulary size. Experiments on English and Chinese corpora show approximately 0.27–0.36% encoded length reduction over standard BPE.
面向字节级BPE的书写系统级分词器适配
本文介绍了BPE引导插入,用于对字节级BPE模型进行事后分词器适配,在保持词汇表大小固定的同时保留大多数token-ID分配。该方法将乌克兰语的token数量减少约33-36%,同时将对英语和其他欧洲语言的影响降至最低。
打破令牌边界的防线:BPE分词如何在LLM对齐中制造可被利用的漏洞
本文指出,BPE分词将关键安全词汇切分为子词片段,在LLM对齐中制造了可被利用的漏洞。字符级扰动通过破坏令牌边界来绕过安全机制,在五个模型系列上实现了对HarmBench提示的80-100%拒绝翻转,其中48%产生了有害输出。
基于 MIPVU 框架的 Token 级中文隐喻识别多架构可复现基线
本文利用 MIPVU 框架和 PSU 中文隐喻语料库,建立了用于 Token 级中文隐喻识别的可复现多架构基线。研究比较了 RoBERTa 和 MelBERT 等编码器模型与 Qwen3.5-9B 生成式模型的性能,并开源代码和数据以推动后续研究。
利用人类阅读行为进行关键词抽取:基于网络摄像头的眼动追踪语料库
本文探讨利用基于网络摄像头的轻量级眼动追踪特征来改进中文论文摘要的关键词抽取,介绍了CLIS-ET语料库,并表明注视特征能够提升关键词抽取(KPE)性能。