MIL-BERT:基于性能与解释保证的任意大小文本分类
摘要
本文介绍了MIL-BERT,这是一种通过选择相关摘录来对任意长文本进行分类的算法,在多个数据集上实现了最先进的性能,并提供了性能与解释保证。
arXiv:2608.20636v1 Announce Type: new
摘要:许多文本分类决策仅基于构成摘录即可实现。受多实例学习领域的启发,我们提出了一种训练神经网络通过选择此类摘录来对文本进行分类的算法。我们展示了我们的方法具有可扩展性,并在近百万令牌的样本上进行了学习演示。我们在7个数据集上评估了我们的方法,重点关注远超我们基础模型编码限制的长文本集合。我们使用该算法在3个数据集上展示了最先进的结果:新闻媒体的政治偏见识别、长故事中的触发警告,以及推文集合中作者的人口统计特征。此外,在弱标记文本集合(包)上训练的模型能够泛化并准确分类构成性的较小实例。除了在这些问题上实现新的最先进水平外,该方法是少数在这些数据集中表现优异的神经方法之一。
查看缓存全文
缓存时间: 2026/08/24 04:23
# MIL-BERT:具备性能与可解释性保障的任意长文本分类
来源:https://arxiv.org/html/2608.20636
###### 摘要
许多文本分类决策仅依据文本片段即可完成。受多示例学习领域的启发,我们提出了一种训练神经网络通过选择此类片段进行文本分类的算法。我们证明该方法具有可扩展性,并已针对接近百万token的样本进行了学习验证。我们在7个数据集上评估了该方法,重点关注远超我们基础模型编码极限的长文本集合。该算法在3个数据集上实现了最先进的结果:新闻媒体的政治倾向识别、长故事中的触发预警检测以及推文集合中作者人口统计特征的识别。此外,基于弱标签文本集合(包)训练的模型,能够准确泛化至对构成该集合的较小实例进行分类。除针对这些问题取得的新最先进成果外,该方法也是少数能在这些数据集上表现优异的神经网络方法之一。
## 1 引言
当前最先进的文本分类与回归(C&R)方法主要基于Transformer系列语言模型37 (https://arxiv.org/html/2608.20636#bib.bib41)。然而,标准Transformer具有固定长度的位置嵌入,且计算量和内存占用随序列长度呈二次方增长。许多使用流行基础模型进行C&R的实际应用,在处理长文档时会采取折衷方案(如截断),隐含地假设文档开头就包含足够准确预测的信息。另一方面,针对长文档的Transformer变体(如Infinite Transformer21 (https://arxiv.org/html/2608.20636#bib.bib15))应用成本相对较高,它们会处理整个文本,过程不透明且可能产生不必要的开销。我们推测,许多文本C&R问题可以通过识别一个或几个支持特定预测的段落来成功解决——我们将这一现象称为**信号局部性**。对于表现出信号局部性的问题,我们可以用对适度大小的指示性片段进行搜索,来替代对超大文本的完整处理。这相当于对问题进行了**多示例学习**(MIL)的框架构建。MIL是一种机器学习范式,其中将由称为**包**的**实例**集合进行分类。只要一个包中至少有一个实例为正,该包就被分类为正例。例如,MIL已被应用于基于切片级别(包)标签28 (https://arxiv.org/html/2608.20636#bib.bib2),在更大的全切片图像中识别癌变图像块(实例)的任务。如果图像包含癌细胞,则至少有一个图像块包含癌细胞;如果不包含,则没有图像块含癌。MIL在文本中的一个应用实例是,通过对特定日期和国家的推文集合进行分类来识别社会动荡9 (https://arxiv.org/html/2608.20636#bib.bib1)。受这些方法启发,我们开发了一种能够学习分类任意长度文本,并具备性能和可解释性保障的算法。本文的主要贡献如下:
- • 我们描述了一种基于MIL框架对长文本进行分类的高效方法,该方法涉及一组固定的“选择器”,用于识别与特定预测最相关的段落。
- • 在涉及多个先前提出的长文本分类问题的实验中,我们证明了这种基于片段的方法(MIL-BERT)与处理整个文档的替代方案相比具有竞争力,并且在某些情况下超越了先前报告的准确率。
- • 我们阐述了MIL-BERT在可解释性方面的优势,这源于其需要识别出驱动分类决策的关键且易于审查的段落。
## 2 方法
### 2.1 预备知识
在标准的MIL公式化描述4 (https://arxiv.org/html/2608.20636#bib.bib11)中,我们对**包**进行二元分类。每个包 \(X=\{x_1,...,x_n\}\) 包含一组带标签 \(y_i\) 的实例 \(x_i\)。如果包 \(X\) 的任何一个构成实例 \(x_i\) 的标签 \(y_i=1\),则该包 \(X\) 获得正标签 \(Y=1\),这使得MIL本质上成为一个稀疏学习问题。训练期间仅提供包标签,目标是学习一个有效的实例分类器。后续的MIL变体优先考虑包标签12 (https://arxiv.org/html/2608.20636#bib.bib3),或在训练时提供带噪声的实例标签28 (https://arxiv.org/html/2608.20636#bib.bib2)。我们研究的问题同时涉及显式(触发预警)和隐式(人口统计画像)实例标签。
### 2.2 算法
我们提出了一种针对表现出信号局部性的文本C&R问题的新算法,将长文档表示为任意大的片段集合(包)。在本研究中,我们使用滑动窗口将文档分割为片段 \(x_1, x_2, ...\),并使用RoBERTa模型19 (https://arxiv.org/html/2608.20636#bib.bib26) 嵌入每个片段,采用最后一层起始符号标记的嵌入。我们的关键创新源于一个洞见:在训练期间,即使实例的中间激活与梯度无关(例如公式1 (https://arxiv.org/html/2608.20636#S2.E1) 所示的最大池化),它们也会被保存在内存中,以便后续计算梯度。
\[
\nabla \max (f(x_1,...)) = \nabla \max (f(\argmax (f(x_1,...))))
\]
(1)
我们通过所谓的**双次传递池化技巧**实现了这一数学替换。在第一次传递中,模型在没有梯度的情况下,通过一个称为**选择器**的argmax函数选择关键片段。在第二次传递中,模型在第一次传递选定的子集上带梯度运行。这允许模型使用 \(k\) 内存计算任意数量 \(n\) 个点的梯度;代价是使用 \(O(n+k)\) 的计算量。此过程如图1 (https://arxiv.org/html/2608.20636#S2.F1) 所示。
*图1:文档被分解为片段,并使用BERT风格的模型进行编码。在第一次传递(虚线)中,选择器层在没有梯度的情况下找到极值点,节省内存。在带梯度的第二次运行(实线)中,这些点被传递给选择器层、一个Gumbel-softmax操作,然后进入分类器层。*
本研究中所有选择器都基于维度为 \(k\) 的线性层。我们对包中的所有片段进行仿射变换 \((WX + b)\),并在每个维度上选择最极端的片段,类似于最大池化操作。选定的片段可以通过多种方式组合以生成预测。本研究考虑了两种方法。在**共享特征图**选择器中,选择和分类之间共享参数,仿射变换的输出维度与类别数量匹配,每个维度的最高值最终成为该类别的对数几率(logit)。在选择top-k实例并聚合分数的变体9 (https://arxiv.org/html/2608.20636#bib.bib1)中,这种经典MIL方法也从包标签中学习实例分类器。在**特征树**选择器中,仿射变换的每个维度类似于决策树的一个特征,阈值为0;如果索引0大于0,则接下来考虑索引1;否则考虑索引2。这允许仅使用 \(k\) 个实例就进行 \(1 + 2^{k-1}\) 次选择决策,从而减少内存使用。从几何上看,每个选择器索引表示一个超平面,符号表示包位于超平面的哪一侧,但这与共享特征图选择器中的类别没有直接关系。**特征树**方法牺牲了实例导向性以适应更高阶的模式。其他选择器是可能的,但要使双次传递池化工作,选择器方法必须是**幂等**的,即选择器的应用在第一次和第二次传递之间必须产生相同的结果。为了支持通用的分类器层,我们规定选择器输出所选实例的嵌入并将其传递给分类器。这需要在训练期间进行不可微分的argmax操作。幸运的是,Gumbel-softmax技巧通过向向量添加噪声以创建接近独热(one-hot)向量,实现了对向量中最大值的近似可微分选择13 (https://arxiv.org/html/2608.20636#bib.bib4)。该技巧已被扩展到以可微分方式执行top-k选择等离散操作26 (https://arxiv.org/html/2608.20636#bib.bib5)。这使得更强大的分类器层(如Transformer或自注意力)能够应用于实例,正如MIL研究中所做31 (https://arxiv.org/html/2608.20636#bib.bib40)。对于本研究中的分类器层,我们使用简单的线性层,但其维度可变。共享分类器层与其选择器共享所有参数,使用top-k片段(k=1)对每个类别进行评分。特征树分类器将所选索引的值作为输入传递给一个线性层(维度为 \(1 + 2^{k-1} \times \text{classes}\)),其余为零。
## 3 数据集
我们在具有可识别实例标签的MIL、具有隐式标签的MIL以及长文本文档上探索算法能力。首先,我们研究经典MIL应用,其中我们在文本包上训练分类器,然后在标签可识别的**包分类**和**实例分类**两个层面评估其准确性。任务是识别故事中的触发预警43 (https://arxiv.org/html/2608.20636#bib.bib7),特别是2023年共享任务42 (https://arxiv.org/html/2608.20636#bib.bib31) 111https://pan.webis.de/clef23/pan23-web/trigger-detection.html。该数据集仅在故事(包)级别有标签,但在后续工作中,他们搜索了故事中可能包含触发词的段落(实例),并根据8个细粒度二元标签中的1个进行了标注40 (https://arxiv.org/html/2608.20636#bib.bib8);我们评估了两个数据集中匹配的7个标签的实例准确性。第二个MIL数据集来自CLEF 2023任务3 222https://gitlab.com/checkthat_lab/clef2023-checkthat-lab/-/tree/main/task3,涉及识别新闻来源(任务B:包)和单篇文章(任务A:实例)中的政治偏见7 (https://arxiv.org/html/2608.20636#bib.bib9)。这两个基准测试都具有标准的训练、验证和测试划分数据。
其次,我们展示了来自PAN2019@CLEF 333https://pan.webis.de/clef19/pan19-web/celebrity-profiling.html的名人作者人口统计画像结果,其中需要根据推文集合预测性别、职业、出生年份和名气等级41 (https://arxiv.org/html/2608.20636#bib.bib30)。人口统计画像符合MIL在具有隐式标签的噪声数据上学习的用例。“我丈夫”这个短语可以指示性别,但并非绝对,因此该领域的片段难以明确标注。该数据集有训练和测试划分,因此我们采用分层抽样,使用训练划分的20%作为验证集。对于出生年份任务,我们根据其特定的基于F1的评分函数(为年长的作者设计更宽的桶)对年份进行分桶。使用MSE损失时,我们通过减去1920并除以100来归一化范围。在此数据集中匿名化URL改进了结果。
作为最后一个关注领域,我们还将这些方法应用于长文档分类基准测试25 (https://arxiv.org/html/2608.20636#bib.bib16),该基准包含先前算法的结果:Hyperpartisan15 (https://arxiv.org/html/2608.20636#bib.bib10)、20Newsgroups、EURLEX-57K5 (https://arxiv.org/html/2608.20636#bib.bib28) 和 Book Text2 (https://arxiv.org/html/2608.20636#bib.bib29)。每个数据集都指定了训练、验证和测试划分 444https://github.com/amazon-science/efficient-longdoc-classification。尽管之前的数据集作为共享任务出现过,但这个长文档基准测试包含5次重复运行,因此我们也如此操作。我们在表1 (https://arxiv.org/html/2608.20636#S4.T1)中描述了每个数据集的类别数量,并在表2 (https://arxiv.org/html/2608.20636#S4.T2)中描述了其文档长度。
## 4 超参数
表3 (https://arxiv.org/html/2608.20636#S5.T3)列出了每次实验设定的超参数,主要通过以下启发式方法选择。我们有片段窗口大小 \(W\)、步幅 \(S\)、选择器选择(共享或特征树),每个选择器对应一个分类层。我们大多使用共享分类器,因为它通常表现更好且需要更少的调整(\(n\_excerpts = classes\))。为简单起见,我们目标设定窗口大小为256个token,步幅为窗口大小的 \(\frac{1}{4}\) 以引入多样性,回想一下CNN中带有位移增强的步幅,类似于图像处理中的平移增强32 (https://arxiv.org/html/2608.20636#bib.bib32)。所谓的**共享特征图**选择器分类器,其片段数量必须与类别数量成正比,这可能导致内存使用急剧增加,因此对于极端的分类问题(如EURLEX,有超过4000个类别),需要更短的片段。对于CLEF23,我们使用共享选择器,top-k值为3,因为它仅在817个示例(新闻源)上训练,其中每个包(源)有更多的偏见实例(文章)可供学习。另一个例外是W的PAN19-Birthyear,它需要使用**特征树**选择器,因为在超参数调整运行期间**共享选择器**表现不佳。损失和重加权的差异由关键性能指标解释;对于强调宏观F1(macro-F1)的单类别数据集,我们使用基于类别的重加权,但对于强调准确率或微观F1(micro-F1)(例如长文本基准和CLEF23B)的数据集则不使用。对于多标签数据集,我们使用ZLPR损失,该损失平衡了相对于类别频率的多标签损失33 (https://arxiv.org/html/2608.20636#bib.bib25)。我们针对每个数据集的关键指标(例如准确率、微观F1、宏观F1)使用模型检查点训练模型。我们使用了学习率退火。对于Gumbel-softmax,tau设置为1,采用软采样技术,并在48个epoch内衰减率为 \(\frac{1}{2}\)。我们使用RoBERTa large作为嵌入片段的模型19 (https://arxiv.org/html/2608.20636#bib.bib26)。
表1:这些实验中使用的数据集,包含更长的文档和文本集合。所有数据集都包含包标签,部分还包含实例标签。
表2:以RoBERTa token计的数据集长度
## 5 结果
我们现在描述实验结果,首先是分类性能以及内存和计算使用情况。接着我们通过视觉分析,展示选择器选定的实例及后续包级别表示与包中其他实例的对比。最后我们分析选择器所选实例的解释性特质。
### 5.1 分类结果
表3:每次实验的超参数
首先,我们分享在MIL问题上的结果,其中基于包级别信息训练的模型在该任务上达到了最先进水平,并且能够泛化至实例段落的分类。我们实现了最先进的分类结果相似文章
LegalBench-BR:评估大语言模型在巴西法律判决分类上的基准
研究者发布首个公开基准 LegalBench-BR,用于评估大模型在巴西法律文本分类任务上的表现。实验表明,LoRA 微调的 BERTimbau 大幅超越 GPT-4o mini 与 Claude 3.5 Haiku。
分类器性能不确定性估计及其在大语言模型与嵌套数据中的应用
本文评估了社会科学文本分类典型条件下分类器性能指标的置信区间方法,为使用大语言模型时准确估计召回率、精确率等指标的区间提供了指导。
当文本与数字不一致时:大型语言模型中的证据仲裁
本文介绍了一个基准测试,用于研究大型语言模型如何仲裁来自文本和数字来源的冲突证据,发现模型使用启发式策略,并偏向于近期性和外部工具。
基于可解释Transformer模型的Mpox研究自动化多标签分类
本文提出了一种基于BERT的Mpox研究文章自动化多标签分类系统,准确率达到97%,并采用SHAP进行可解释性分析。该系统旨在帮助研究人员和医疗工作者快速找到相关信息。
用于引文功能分类的大型语言模型
本文对五种大型语言模型在引文功能分类任务上进行了全面评估,基于微调后的 Falcon 7B 模型在 ACL-ARC 数据集上取得了新的最优结果。同时引入了 AC3 数据集,该数据集采用七类别标注方案,能够区分中性致谢与评价性立场。