评估经典与Transformer模型在文档敏感性分类中的性能

arXiv cs.LG 论文

摘要

本文介绍了Strategic 16K,一个用于文档敏感性分类的泄露控制数据集,并对经典与基于Transformer的模型进行了基准测试,其中BERT在解决标签泄露问题的同时取得了最佳性能。

arXiv:2608.16928v1 公告类型:新 摘要:组织文档的自动敏感性分类是一个关键但尚未充分解决的问题,误分类的后果从违反法规到安全漏洞不等。虽然基于AI的方法为手动审查提供了可扩展的替代方案,但其可靠性根本上取决于训练数据的完整性。该领域中一个普遍但未报告的问题是标签泄露:文档主体中嵌入的残留分类标记,允许模型利用表面捷径,而不是学习真正的基于内容的敏感性信号,从而导致性能估计被夸大且不可靠。本文通过引入Strategic 16K解决了这个问题,这是一个精心构建的、泄露控制的语料库,包含16,000条来自WikiLeaks Public Library of US Diplomacy (PlusD)的外交电报,并提出了一个系统基准,评估了涵盖经典机器学习和基于Transformer方法的六种模型架构。我们记录了一个扩展的泄露移除协议,该协议识别并消除了文档主体中嵌入的三类残留分类标记。在干净的基准上,BERT取得了最强性能(准确率 = 89.14%,F1 = 89.33%),其次是ELECTRA(准确率 = 88.57%,F1 = 88.90%)。在经典模型中,使用逻辑回归的TF-IDF在显著降低计算成本的情况下取得了最佳性能。这些结果构成了第一个在明确泄露控制条件下从WikiLeaks PlusD构建的完全可重复的敏感性分类基准。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:16

# 经典与基于Transformer的文档敏感性分类模型基准测试
来源:https://arxiv.org/html/2608.16928
###### 摘要

组织文档的自动敏感性分类是一个关键但尚未得到充分重视的问题,其分类错误的后果从监管违规到安全漏洞不等。虽然基于AI的方法为人工审查提供了可扩展的替代方案,但其可靠性根本上取决于训练数据的完整性。该领域一个普遍但未被充分报道的问题是标签泄露:残留在文档正文中的分类标记,使模型能够利用表面捷径而非学习真正的基于内容的敏感性信号,从而产生虚高且不可靠的性能估计。本文通过引入Strategic 16K来解决这一问题。这是一个精心构建、控制泄露的语料库,包含16,000份来自维基解密美国外交公共图书馆的电报,并提出了一个系统的基准测试,评估了六种涵盖经典机器学习和基于Transformer方法的模型架构。我们记录了一个扩展的泄露移除协议,该协议识别并消除了嵌入文档正文中的三类残留分类标记。在干净的基准测试中,BERT取得了最佳性能(准确率 = 89.14%,F1值 = 89.33%),其次是ELECTRA(准确率 = 88.57%,F1值 = 88.90%)。在经典模型中,结合逻辑回归的TF-IDF以显著更低的计算成本取得了最佳性能。这些结果构成了在维基解密PlusD中,在明确的泄露控制条件下构建的第一个完全可复现的敏感性分类基准。

## I 引言

一份错误分类的文档可能导致数据泄露、监管处罚或国家安全事件。在大多数组织中,文档是否被归类为敏感仍然是在文档级别手工决定的。在文档被路由、存储和传输之前,经过培训的审查员必须手工阅读和标记每份文档,这既耗时,在审查员之间也不一致,并且无法随着当今组织产生的文档量而扩展。虽然使用自然语言处理进行自动敏感性分类提供了一个有原则的可扩展解决方案,但这种方法的有效性在很大程度上取决于训练模型是捕获了真正的敏感性信号,还是仅仅捕获了训练数据准备方式的产物。

这种差异的意义超乎想象。标签泄露是一个众所周知且经常被忽视的文档敏感性分类问题,其中训练文档的正文文本中存在明确的敏感性标记,例如嵌入在行内分类码、分类短语和分发通知中。真实标签以机器可读的方式直接存储在这些产物上。这样的分类器不需要知道是什么使文档变得敏感,它只需要看到分类标记是否存在。该模型在交叉验证时得分非常高,但当应用于经过正确净化处理的文档时,它就失败了,而这正是实际操作条件。

这个问题并非仅仅是理论性的。先前使用维基解密美国外交公共图书馆作为敏感性分类训练语料库的研究,通常没有披露明确的泄露移除程序。在不了解训练数据中包含何种产物的情况下,其报告的分数不能被解释为真正敏感性理解的证据;也无法在不同研究之间进行公平比较或在受控条件下复现。

本文将直接解决这些局限性。我们从维基解密PlusD构建了Strategic 16K,一个包含16,000份文档的基准数据集,使用了记录完善的泄露移除协议,并在相同实验条件下对六种模型架构进行了首次受控的跨系列评估。本工作的贡献包括:

1.  第一个来自维基解密PlusD的可复现敏感性分类基准,具有完整的泄露移除和敏感性聚焦采样协议文档。
2.  一个扩展的泄露移除协议,针对先前研究未解决的嵌入文档正文中的三类残留分类标记。
3.  在一个共同的净化语料库上,在相同实验条件下,系统比较了经典TF-IDF分类器和基于Transformer模型的跨系列基准测试。
4.  量化的效率分析,将结合逻辑回归的TF-IDF确定为一个强大的实用基线,其计算成本仅为微调Transformer模型的一小部分。

## II 相关工作

### II-A 传统机器学习方法

然而,在TF-IDF和词袋模型表示的帮助下,经典机器学习方法在各个领域的文本分类中已经建立了坚实的基线。Ahmad等人[1]测试了SVM、随机森林、k近邻和朴素贝叶斯用于文档分类,发现SVM的准确率达到97%,证明了正则化良好的线性模型在词汇丰富的文本上表现良好。Joachims[2]通过证明具有稀疏TF-IDF表示的最大间隔公式在高维特征空间中具有良好的泛化界,为基于SVM的文本分类提供了理论基础。尽管这些方法效率很高,但它们只能在表面层次上比较词语,并未考虑在决定文档是否敏感时常常关键的双向关系。

### II-B 深度学习方法

Alzhrani等人[3]基于CNN构建了一个系统,用于在维基解密外交电报数据集上检测敏感文本,F1值为0.91,该系统将长文档分割为较短的段落,以将重点重新定向到局部敏感段落。这代表了深度学习首次应用于维基解密PlusD敏感性分类。在之前的工作中,Hart等人[4]提出了将机器学习用于数据防泄漏活动的可能性,认为自动分类器可用于检测组织文档中的敏感信息。两项研究共同的一个关键局限是,它们都没有明确描述任何识别或从维基解密语料库中移除潜在标签泄露的程序。因此,很难确定报告的性能是反映了真正的语义敏感性理解,还是至少部分地利用了残留的分类产物。

### II-C 基于Transformer的模型

BERT[5]是在掩码语言建模任务上预训练的双向Transformer,改变了文本分类的范式。BERT使用上下文表示标记,使用所有层的自注意力来同时建模标记的左右上下文,这是TF-IDF或循环模型无法实现的。Petrolini等人[6]对BERT进行了微调以自动检测敏感数据,并在隐私敏感分类任务中获得了F1值=0.95。Kowsari等人[7]对文本分类算法进行了调查,发现Transformer模型的表现持续且显著优于经典和循环模型。Saritha和Kumar[8]回顾了基于AI的敏感数据保护技术,强调了使用Transformer模型、卷积神经网络(CNN)、循环神经网络(RNN)、自编码器和元启发式优化方法来检测和防止数据泄露。然而,所回顾的研究在数据集构建过程中并未涉及明确的泄露控制。

### II-D 研究空白总结

先前关于文档和文本分类的代表性研究总结在表I中。这些研究来自不同的环境和数据集,用于提供敏感性分类中模型系列和评估方法的背景。本研究的动机源于所有回顾工作中观察到的四个空白:(1)先前使用维基解密PlusD的研究均未明确披露泄露移除协议;(2)先前的基准测试难以复现,因为它们未指定预处理流程和数据集划分;(3)没有在共同的净化语料库上进行受控的跨系列比较;(4)没有工作量化该领域Transformer模型与经典模型之间的效率权衡。

表I:关于文本和敏感性分类的代表性先前工作

## III 数据集与预处理

### III-A 来源:维基解密美国外交公共图书馆

维基解密美国外交公共图书馆是最大的、公开可用的真实政府文件集合,带有官方敏感性标签,包含由全球美国大使馆产生的251,287份外交电报。七种官方分类标签——UNCLASSIFIED(非密)、CONFIDENTIAL(机密)、LIMITED OFFICIAL USE(有限制官方使用)、SECRET(秘密)、UNCLASSIFIED//FOR OFFICIAL USE ONLY (FOUO)(非密//仅供公务使用)、CONFIDENTIAL//NOFORN(机密//不得对外国人公开)和SECRET//NOFORN(秘密//不得对外国人公开)——由受过培训的政府官员在撰写时附加到每份电报上。这些是使用正式协议做出的真实政府分类决定,而非众包标注,这意味着该数据集作为真实基础敏感性标签来源的独特可靠性。

没有此数据的预制版本可用。每份文档都是通过定制的自动提取管道从维基解密PlusD API收集的。该管道反复处理每个分类类别,获取电报的HTML页面,提取文档内容和原始分类标签,并清除任何残留的HTML产物。该管道对超过100,000份独特文档进行了去重,并以结构化的CSV格式存储。

### III-B 二元标签映射

原始的七种标签被简化为二元模式,代表基本的访问限制决定。UNCLASSIFIED和UNCLASSIFIED//FOUO均被分类为“非敏感”,因为它们没有正式的访问限制。所有其他标签(LIMITED OFFICIAL USE、CONFIDENTIAL、CONFIDENTIAL//NOFORN、SECRET和SECRET//NOFORN)都被赋予“敏感”的正式访问限制,因为它们都施加了某种程度的正式限制。此映射和由此产生的语料库分布如表III所示。

### III-C 泄露移除协议

处理维基解密PlusD电报预处理过程中最重要的挑战之一是移除嵌入文档正文中的残留分类产物。除非消除,否则这些产物可能使分类器使用表面捷径而非学习真正的敏感性信号。发现并消除了三类泄露:

- • 行内段落标记:在特定电报每个段落开头插入的单字母敏感性代码(C)、(S)、(U)和(SBU),表示该段落的分类。
- • 重复分类短语:文档正文中的自然语言短语,如“this cable is classified SECRET”,而非在标题或元数据字段中。
- • 分发通知:重复的样板字符串,如“Sensitive But Unclassified, Not for Internet Distribution”,在文档正文中反复出现。

所有识别出的模式在扩展的清洗过程中已被消除。反映分类的敏感性术语保留在自然或半自然的句子上下文中。例如,讨论核保密协议的电报未被修改。这是产物移除与内容保留之间的最关键区别,构成了强制模型从真实内容学习的基准测试的基础。

为说明该协议,提供了三个具有代表性的前后对比示例:(1)`(C) The ambassador confirmed...` 变为 `The ambassador confirmed...`;(2)`This cable is classified SECRET. The meeting...` 变为 `The meeting...`;以及(3)`Sensitive But Unclassified, Not for Internet Distribution. Officials agreed...` 变为 `Officials agreed...`。

经过清洗后,还对语料库检查了字母间隔的分类横幅,这是一种在原始PlusD电报中记录到的模式,其中分类标签显示为空格字符(例如,`S E C R E T`作为独立行)。在抽样子集中未发现此类模式。因此,上述三类代表了Strategic 16K中存在的完整泄露产物集合,对于其所包含的文档样本而言,该语料库被认为是完全受控的。

为提供成功移除泄露的经验证据,对清洗后语料库的两类文档的顶级TF-IDF特征进行了检查。图1显示了每类的前15个特征。两组特征都完全由通用的英语词汇组成;在最高权重特征中均未出现SECRET、CONFIDENTIAL或NOFORN等分类相关标记。这证实了在Strategic 16K上训练的分类器必须依赖基于内容的信号,而非表面分类产物。

请参阅图片说明图1:Strategic 16K中敏感和非敏感类别的前15个TF-IDF特征。两组特征都完全由通用的英语词汇组成,没有任何分类相关标记,为成功移除泄露提供了经验证据。表II:标签泄露对结合逻辑回归的TF-IDF性能的影响。泄露问题的严重性已通过经验确认。如表II所示,结合逻辑回归的TF-IDF在原始语料库上取得了近乎完美的性能,但在移除泄露后其性能显著下降。这表明在原始数据集上的虚高性能主要归因于残留的分类产物,而非真正的语义敏感性理解。

为进一步验证语料库构建,评估了一个仅使用长度作为分类信号的基线。该基线的准确率显著低于所有评估的模型,证实了Strategic 16K中敏感与非敏感文档之间的长度差异不能作为敏感性的可靠代理。因此,该语料库强制模型从内容而非结构捷径中学习,本基准测试中报告的性能反映了真正的敏感性区分能力。

### III-D Strategic 16K 基准

在泄露移除之后,通过应用敏感性聚焦采样策略构建了Strategic 16K,该策略增加了模型在训练期间对敏感文档多样性的接触。如表III所示,语料库共包含16,000份文档,类别分布接近平衡(敏感 52.4%,非敏感 47.6%)。接近平衡的分布避免了一个类别在结构上处于优势地位。

相似文章

用于设备端故障检测的轻量级Transformer模型:资源受限部署的基准研究

arXiv cs.LG

一项基准研究,在三个公开数据集上对比了传统机器学习方法(随机森林、XGBoost、SVM、逻辑回归)与轻量级Transformer变体(DistilBERT、TinyBERT、MobileBERT)在设备端故障检测中的表现。传统机器学习在远小得多的资源占用下实现了有竞争力的准确率,而TinyBERT-4L是最便于部署的Transformer模型。

欺骗语义:法律领域欺骗检测与通用领域最先进方法的基准测试

arXiv cs.CL

本文综述并评测了法律语境下基于NLP的自动欺骗检测,比较了微调Transformer和七个大语言模型(LLM)在七个数据集上采用多种提示策略的表现。结果表明存在明显的领域敏感性:微调模型在数据丰富的通用领域表现出色,而少样本LLM在低资源法律场景中具有竞争力。

基于多传感器物理危害评估的大语言模型基准测试

arXiv cs.AI

该论文对五个大语言模型在多传感器物理危害评估中的表现进行了基准测试,结果发现,当多个传感器同时升高但均未达到各自安全限值时,所有被测试模型均未能发出预警信号,而在单传感器违规检测中则表现出近乎完美的准确性。