类别结构保持胜过多样性:不平衡文本分类的文本增强方法综合基准
摘要
本文在7个不平衡分类数据集上对11种文本增强方法进行了基准测试,包括经典扰动、嵌入空间检索和基于LLM的方法。研究发现,基于检索的过采样(EmbSMOTE)优于基于LLM的增强方法,并且保持类别条件结构比表面多样性更为重要。
arXiv:2608.12340v1 公告类型:新
摘要:随着大型语言模型(LLM)的快速发展,生成式数据增强在自然语言处理的不平衡文本分类中引起了广泛关注。然而,迄今为止尚无实证基准将基于LLM的增强与嵌入空间SMOTE式检索(EmbSMOTE)进行比较,后者是不平衡分类中一个强有力的经典参照方法。本研究在七个公开文本分类数据集上构建了一个受控基准,涵盖11种增强方法,包括经典扰动、嵌入空间检索和基于LLM的生成,类别数$K=2$-$28$,不平衡比率从1.1到500以上,每个单元使用五个随机种子,采用宏F1、Welch的$t$检验、五个分布度量以及基于Qwen3-8B的LLM族敏感性分析进行评估。实验结果表明,所有基于LLM的方法在统计上等同于或劣于EmbSMOTE,性能差距随着不平衡程度的增加而单调扩大,在GoEmotions-28上达到$\Delta\text{F1}_\text{macro}\!\approx\!0.063$。此外,观察到表面层面的独特性与下游性能几乎没有相关性,而LLM特有的伪影,如文本伸长和标签分布均匀化,与分类准确率呈负相关。与六个基于LLM和四个经典增强基线相比,这些结果表明有效的变量不是表面多样性,而是类别条件结构保真度,即增强样本保留训练分布类别条件几何结构的程度。因此,检索式过采样应被作为不平衡多分类的默认方法,并在实际部署基于LLM的增强之前,应设定更高的实证门槛。
查看缓存全文
缓存时间: 2026/08/14 09:25
# 类结构保持优于多样性:面向不平衡文本分类的文本增强方法综合基准 来源: https://arxiv.org/html/2608.12340 Keito Inoshita 关西大学商学部,大阪府吹田市山手町3-3-35,邮编564-8680,日本 [[email protected]](mailto:[email protected]) ###### 摘要 随着大语言模型(LLMs)的快速发展,生成式数据增强在自然语言处理中的不平衡文本分类任务中引起了广泛关注。然而,迄今为止尚无实证基准将基于LLM的增强方法与嵌入空间SMOTE式检索(EmbSMOTE)——一种用于不平衡分类的强经典参考方法——进行比较。本研究在七个公开文本分类数据集上构建了一个受控基准,涵盖11种增强方法,包括经典扰动、嵌入空间检索和基于LLM的生成,类别数K=2K=2至2828,不平衡比从1.1到超过500,每个单元使用五个随机种子,采用宏F1、Welch’stt检验、五个分布度量以及基于Qwen3-8B的LLM家族敏感性分析进行评估。实验结果显示,所有基于LLM的方法在统计上等同于或劣于EmbSMOTE,且随着不平衡程度的增加,性能差距单调扩大,在GoEmotions-28上达到ΔF1macro≈0.063\\Delta\\text{F1}\_\\{\\text{macro}\\}\\\!\\approx\\\!0.063。此外,观察到表面层面的独特性与下游性能的相关性可忽略不计,而LLM特有的伪影,如文本拉长和标签分布均匀化,与分类准确率呈负相关。与六种基于LLM和四种经典增强基线相比,这些结果表明,有效的变量不是表面层面的多样性,而是类条件结构保真度,即增强样本保留训练分布的类条件几何结构的程度。因此,基于检索的过采样应作为不平衡多类分类的默认方法,并且在基于LLM的增强实际部署之前,应提出更高的实证标准。 ###### 关键词: 自然语言处理,文本数据增强,不平衡学习,大语言模型,情感识别 ††期刊: 基于知识的系统 ## 1 引言 随着自然语言处理(NLP)中文本分类任务的快速普及,标签空间不平衡已成为一个几乎普遍存在的挑战。预训练语言模型的标准微调在SST-2[27 (https://arxiv.org/html/2608.12340#bib.bib5)]等平衡二分类任务上表现良好;然而,众所周知,当标签空间中存在稀有类别时,性能会急剧下降。值得注意的是,在GoEmotions-28[11 (https://arxiv.org/html/2608.12340#bib.bib9)]等细粒度情感分类基准上,即使有5,000个训练示例,无增强基线通常也会低于0.20的宏F1,这充分确立了类别不平衡下的文本分类作为现代NLP中一个持续存在的挑战。 在此背景下,文本数据增强长期以来一直被研究作为一种标准的缓解策略。经典方法如EDA[30 (https://arxiv.org/html/2608.12340#bib.bib10)]、AEDA[15 (https://arxiv.org/html/2608.12340#bib.bib11)]、反向翻译[26 (https://arxiv.org/html/2608.12340#bib.bib12)]以及嵌入空间过采样[8 (https://arxiv.org/html/2608.12340#bib.bib13),4 (https://arxiv.org/html/2608.12340#bib.bib15)]构成了一个成熟的基线组。受大语言模型快速发展的启发,生成式增强重新引起了人们的关注:诸如AugGPT[10 (https://arxiv.org/html/2608.12340#bib.bib17)]、LLM2LLM[16 (https://arxiv.org/html/2608.12340#bib.bib18)]、CoTAM[22 (https://arxiv.org/html/2608.12340#bib.bib19)]和CIEGAD[14 (https://arxiv.org/html/2608.12340#bib.bib20)]等方法,后者是一种所谓的几何引导方法,围绕类内簇几何结构来组织LLM生成,在低资源场景下报告了显著的性能提升。将这些方法应用于高度不平衡的多类问题(如情感识别)在最近的综述中正日益系统化[6 (https://arxiv.org/html/2608.12340#bib.bib30),3 (https://arxiv.org/html/2608.12340#bib.bib29)]。 尽管有这些研究工作,现有方法仍然存在以下局限性: i) 经典方法在类结构保持方面表现出优势,但在文本多样性方面存在不足,而它们据称不如LLM生成文本的依据仍不清楚。 ii) 基于LLM的方法据称在多样性上超越经典方法,但几项同期研究表明这一前提仅在有条件的情况下成立[5 (https://arxiv.org/html/2608.12340#bib.bib21),23 (https://arxiv.org/html/2608.12340#bib.bib22),21 (https://arxiv.org/html/2608.12340#bib.bib24)],并且注意到基于LLM的方法在下游分类性能上并不一致地优于经典方法。具体来说,据我们所知,目前尚不存在将嵌入空间SMOTE式检索(EmbSMOTE)作为参考方法的经验NLP基准。 iii) 在受控不平衡条件下,比较经典扰动、嵌入空间检索和现代基于LLM的生成的系统性NLP基准明显缺乏,且该基准需要在统一实验协议下使用足够的随机种子和统计校正,以使负面发现可信。 在本研究中,上述局限性得到了解决。具体而言,我们新构建了一个11种方法×\\times7个公开数据集×\\times5个随机种子的受控基准,其中系统比较了四种经典方法和六种基于LLM的方法。本研究的核心贡献在于综合基准本身,以及对多样性与类结构保持之间相互作用的机制性解释。 数据集涵盖SST-2[27 (https://arxiv.org/html/2608.12340#bib.bib5)]、AG News[33 (https://arxiv.org/html/2608.12340#bib.bib6)]、Emo[7 (https://arxiv.org/html/2608.12340#bib.bib7)]、TREC[18 (https://arxiv.org/html/2608.12340#bib.bib8)]、GoEmotions-13[11 (https://arxiv.org/html/2608.12340#bib.bib9)]、DBpedia[17 (https://arxiv.org/html/2608.12340#bib.bib33)]和GoEmotions-28[11 (https://arxiv.org/html/2608.12340#bib.bib9)],涵盖了从K=2K=2到K=28K=28个类别的范围,以及不平衡比(IR)=1.12=1.12到IR=527.67=527.67的范围。此外,我们引入了一种所谓的“定位-然后-解码”公式VoidGen,作为方法论探针,它反转了现有基于LLM的增强所遵循的常规“先生成-后验证”顺序:在生成之前识别句子嵌入空间中的稀疏区域,并通过学习到的投影器将LLM解码条件于这些目标。VoidGen的定位不是作为竞争性的最佳方法,而是作为一种受控测试,用于检验预先针对稀疏嵌入空间区域是否能带来结构保持方面的优势。 本研究的主要贡献总结如下。 1. i) 构建了一个受控的经验NLP增强基准,涵盖11种方法×\\times7个数据集×\\times5个种子,使用Welch’stt检验,并将EmbSMOTE作为强参考方法。所有基于LLM的增强方法在统计上等同于或劣于EmbSMOTE,且随着类别不平衡的增加,差距扩大。 2. ii) 在相同的算法超参数和提示下,基于LLM的增强相对于EmbSMOTE的劣势在两种不同的LLM家族(Llama-3.1-8B和Qwen3-8B)中复现,这表明瓶颈不在于特定LLM的生成质量,而在于“先生成-后验证”范式的结构性约束。 3. iii) 使用五个分布度量对增强集进行量化,并分析它们与宏F1以及各类别F1值的相关性,提供了一种机制性解释,其中类条件结构保真度,而非表面层面的多样性,才是起作用的变量。 4. iv) 引入了一种“定位-然后-解码”方法VoidGen,它在生成之前识别嵌入空间的稀疏区域,并将生成条件于这些目标,作为方法论探针,强化了以下发现:仅靠生成前定位不足以保证结构保真度,类结构保持是更基本的要求。 本文的其余部分组织如下。第2节 (https://arxiv.org/html/2608.12340#S2)回顾相关工作。第3节 (https://arxiv.org/html/2608.12340#S3)介绍问题公式化、分类器协议以及每种增强方法。第4节 (https://arxiv.org/html/2608.12340#S4)介绍实验设置。第5节 (https://arxiv.org/html/2608.12340#S5)报告实验结果和分析。第6节 (https://arxiv.org/html/2608.12340#S6)讨论关键发现和局限性。最后,第7节 (https://arxiv.org/html/2608.12340#S7)总结本研究并概述未来方向。所有代码均已公开,以支持直接复制和重用[13 (https://arxiv.org/html/2608.12340#bib.bib32)]。 ## 2 相关工作 ### 2.1 经典文本增强 早期的文本增强方法通常建立在基于规则的变换之上,其中局部词级特征被扰动,同时保留每个句子的表面形式。Wei和Zou[30 (https://arxiv.org/html/2608.12340#bib.bib10)]提出了EDA,它应用四种随机词元级操作,即同义词替换、随机插入、随机交换和随机删除,使用默认比率,这可以有效将所需训练数据减半,同时仍能在五个基准上实现一致的性能提升。Karimi等人[15 (https://arxiv.org/html/2608.12340#bib.bib11)]将EDA简化为仅随机插入标点,消除了删除步骤,并完全保留了每个句子的词汇内容,在相同基准上始终优于EDA。反向翻译[26 (https://arxiv.org/html/2608.12340#bib.bib12)]最初是为神经机器翻译开发的,并作为一种语义丰富的基线被广泛采用,通过中间语言生成释义。在本研究中,它被实现为英语→\\rightarrow德语→\\rightarrow英语翻译,借助Helsinki-NLP MarianMT模型。 基于表示空间过采样的方法也被开发用于解决类别不平衡。SMOTE[8 (https://arxiv.org/html/2608.12340#bib.bib13)]通过在特征空间中线性插值种子样本与其kk个最近邻之一来生成合成少数类样本,从而直接控制类别分布而不是扰动多数类文本。Mixup[32 (https://arxiv.org/html/2608.12340#bib.bib14)]通过插值来自完整训练分布的样本对及其软标签来扩展这一原则,将分类器正则化为在训练点之间保持线性。这些插值思想已被扩展到文本领域:Bystroński等人[4 (https://arxiv.org/html/2608.12340#bib.bib15)]提出了SMOTExT,其中首先插值句子级嵌入,随后通过检索增强生成架构将所得潜在向量解码为新的文本字符串。Taskiran等人[28 (https://arxiv.org/html/2608.12340#bib.bib16)]在一项大规模系统研究中,使用基于Transformer的向量化在两个文本分类基准(TREC和Emotions)上评估了31种SMOTE变体,证实每种过采样策略的相对收益强烈依赖于数据集特征。 本研究比较的方法跨越了这两种范式。EmbSMOTE将SMOTE适配到Sentence-BERT(SBERT)[24 (https://arxiv.org/html/2608.12340#bib.bib2)]的句子嵌入空间,其中通过同一类内的插值计算合成嵌入,并通过从训练语料库中进行最近邻检索来恢复相应的文本。由于返回的文本都是真实的训练示例,类成员资格在设计上得到保证。需要指出的是,本分析所依据的核心设计对比在于检索(保持类结构但在表面层面多样性上有限)与生成(可能在表面多样性上更丰富,但在类结构保证上较弱)之间的对比。Bystroński等人[4 (https://arxiv.org/html/2608.12340#bib.bib15)]报告称,基于检索的过采样优于许多经典增强方法,Taskiran等人[28 (https://arxiv.org/html/2608.12340#bib.bib16)]同样发现基于检索的方法在不同数据集条件下具有竞争力。与上述侧重于检索的研究不同,本研究更进一步,证明在高不平衡多类条件下,基于检索的过采样甚至可以超越基于LLM的增强。 ### 2.2 基于LLM的增强 大型指令微调语言模型的出现引发了人们对生成式文本增强的浓厚兴趣。AugGPT[10 (https://arxiv.org/html/2608.12340#bib.bib17)]使用类别特定的聊天格式提示为每个训练示例生成KK个释义,在少样本场景中展现出显著的性能提升。LLM2LLM[16 (https://arxiv.org/html/2608.12340#bib.bib18)]采用所谓的两阶段迭代策略,其中学生模型首先识别自身的失败案例,然后教师LLM专门针对这些示例合成目标增强;在极低数据设置下,报告的性能提升在TREC上达到+52.6%+52.6\\%,在SST-2上达到+39.8%+39.8\\%。思维链增强方法(CoTAM)[22 (https://arxiv.org/html/2608.12340#bib.bib19)]利用思维链提示来产生可控的数据增强,仅编辑用户指定的属性,同时保留所有其他内容,在分类和基于方面的情感任务上均优于先前最先进的基于LLM的增强。最近,CIEGAD[14 (https://arxiv.org/html/2608.12340#bib.bib20)]被新提出,它围绕训练集的类内簇几何结构来组织LLM生成。具体来说,预算分配算法将增强配额按比例分配给(标签,簇)对,依据是簇大小、边缘和空洞分数;LLM被提示使用簇级领域配置文件以及簇内锚文本之间的插值和外推目标;生成输出通过一个五方面LLM-as-judge进行过滤,综合分数阈值为3。CIEGAD被认为是本基准中几何结构最复杂的基于LLM的增强方法,它与基于检索的EmbSMOTE的比较构成本研究的结构核心。 几项同期研究为基于LLM的增强与经典增强的比较效率提供了部分证据。Cegin等人[5 (https://arxiv.org/html/2608.12340#bib.bib21)]在六个数据集和三个分类器上将LLM释义和生成方法与既有方法进行了比较,发现基于LLM的方法仅在种子样本极为稀缺时提供优势。Radliński等人[23 (ht
相似文章
使用GMM和LLM通过定向数据增强进行不平衡数据聚类
本文提出了一种新颖的无监督数据增强方法,结合高斯混合模型和大语言模型,通过为代表性不足的聚类生成合成文档,改善不平衡文本数据集上的聚类效果。
通过同质训练-测试分割方法增强自动机器学习
本文系统评估了五种用于AutoML的训练-测试分割策略,表明基于几何的方法在保持分布相似性方面不如随机/分层分割有效,并提出了Optimised-Distribution方法,实现了89%的相似度。
多样性注入的位置至关重要:面向多样化生成的统一框架
本文提出了一个用于大型语言模型测试时多样化生成的统一框架,根据多样性注入的位置(表面级 vs. 规范级)对方法进行分类。它提出了规范级方法,首先生成多样化的中间规范,然后基于这些规范生成最终响应。在五个开放任务和四个骨干模型上,规范级注入在保持质量的同时提升了输出多样性。
在心理防御分类中利用上下文感知的合成增强缓解数据稀缺问题
本文提出了一种结合上下文感知合成增强框架与混合分类模型的方法,以解决从文本中分类心理防御机制时的数据稀缺和类别不平衡问题。该方法在 PsyDefDetect 共享任务基准上取得了显著改进。
不确定性引导的LLM语义增强用于异质性治疗效果估计
本文提出CURL,一种即插即用适配器,利用估计器不确定性分配预训练LLM的语义能力,以改进异质性治疗效果(CATE)估计。它引入两种角色调节的提示,构建面向分配和异质性的表示,在四个基准上提升了十个宿主学习器的性能。