LLM生成样本的几何过滤在少样本文本分类中的应用
摘要
本文提出了一种几何过滤框架,通过评估LLM生成样本在嵌入空间中与真实类别示例的欧氏距离来选择高质量样本,从而将少样本文本分类性能提升了2.61个百分点,优于SMOTE方法。
arXiv:2608.13866v1 公告类型: 交叉
摘要: 大型语言模型(LLMs)可以为文本分类生成合成训练数据,但生成样本的质量参差不齐:有些位于嵌入空间中正确类别的区域,而其他则落在边缘或跨类区域。我们提出了一种几何过滤框架,通过评估每个LLM生成样本在句子嵌入空间中与真实类别示例的欧氏距离,仅选择几何上一致的候选样本。一种软加权机制将过滤分数转换为分类器训练的样本权重。在13个数据集、5个分类器、10种增强方法和超过6,700种配置上评估,我们的方法比SMOTE提升了2.61个百分点(pp)($p<0.0001$, Cohen's $d=0.95$, 88.9% 胜率)。该方法无需修改过滤器即可推广到命名实体识别(+9.26pp, 100% 胜率),并在来自4家提供商的5个LLMs上表现稳健。一个关键发现是,最简单的基于距离的过滤器始终优于复杂的多标准替代方案。
查看缓存全文
缓存时间: 2026/08/17 10:06
# 面向少样本文本分类的LLM生成样本几何过滤
来源:https://arxiv.org/html/2608.13866
Benjamín Schindler 附属机构:工程与科学学院 阿道弗·伊瓦涅斯大学 社会数据科学千年中心 (SODAS) 智利圣地亚哥 bschindler@alumnos\.uai\.cl
Gonzalo A\. Ruz 附属机构:工程与科学学院 阿道弗·伊瓦涅斯大学 社会数据科学千年中心 (SODAS) 植物韧性数据科学千年中心 (PhytoLearning) 智利圣地亚哥 gonzalo\.ruz@uai\.cl
###### 摘要
大型语言模型(LLMs)可以为文本分类生成合成训练数据,但生成样本的质量参差不齐:部分样本位于嵌入空间中正确的类别区域,而另一些则落在边缘或跨类别区域。我们提出一个几何过滤框架,通过评估每个LLM生成样本在句子嵌入空间中与真实类别样本的欧几里得距离来筛选,仅选择几何一致的候选项。一种软加权机制将过滤分数转换为分类器训练的样本权重。在13个数据集、5个分类器、10种增强方法和超过6,700种配置上的评估表明,我们的方法比SMOTE平均高出+2.61个百分点(pp)(\(p<0.0001\),Cohen’s \(d=0.95\),88.9%胜率)。该方法无需修改过滤器即可泛化到命名实体识别(+9.26pp,100%胜率),并且在来自4个供应商的5个LLM上表现稳健。一个关键发现是,最简单的基于距离的过滤器始终优于复杂的多标准替代方案。
###### 索引术语:
数据增强、大型语言模型、少样本学习、文本分类、几何过滤、嵌入空间
## I 引言
低资源场景下的文本分类仍然是自然语言处理中的一个核心挑战。许多实际领域,如仇恨言论检测、新闻分类和垃圾邮件过滤,都需要在标注数据上训练监督模型,但实践者通常每类只有10到50个标注样本。这种稀缺性在多类设置中更加复杂,因为每个类别都需要足够的样本来让分类器学习到稳健的决策边界。其结果是宏平均F1性能下降,尤其是在代表性不足的类别上\[12 (https://arxiv.org/html/2608.13866#bib.bib7)\]。
两种主要范式通过数据增强来解决这种数据稀缺性。**经典过采样方法**,如SMOTE\[6 (https://arxiv.org/html/2608.13866#bib.bib1)\]和ADASYN\[13 (https://arxiv.org/html/2608.13866#bib.bib2)\],通过在嵌入空间中进行插值来生成合成样本。这些方法提供了明确的几何放置指导,但生成的插值向量不对应于语言上连贯的文本。**基于LLM的生成**能产生语法正确且语义合理的文本\[26 (https://arxiv.org/html/2608.13866#bib.bib8), 3 (https://arxiv.org/html/2608.13866#bib.bib6)\],但缺乏关于分类器操作的表示空间几何结构的信息。
这两种范式之间存在一个根本鸿沟:经典方法提供几何控制但缺乏语言有效性,而LLM提供语言质量但缺乏几何感知。这导致了质量异质性问题:LLM生成的样本在嵌入空间中的位置差异很大。有些落在忠于目标类的区域,而有些则落在边缘区域甚至与其他类别相关的区域。不加区分地纳入所有生成样本会降低分类器性能\[15 (https://arxiv.org/html/2608.13866#bib.bib9), 5 (https://arxiv.org/html/2608.13866#bib.bib11)\]。Springer等人\[20 (https://arxiv.org/html/2608.13866#bib.bib24)\]进一步证明,合成数据对少样本分类器的影响关键取决于样本质量,而不仅仅是数量。这一观察引出了我们的核心问题:能否通过只选择高质量合成样本的几何过滤来改进基于LLM的增强?
本文提出一种后生成的几何过滤系统,通过评估每个合成样本在嵌入空间中的位置进行筛选。该框架桥接了两种范式:LLM生成语言有效的文本,而几何过滤器确保只有与真实数据分布一致的样本被保留。我们的贡献是:
1. 1. 一个基于嵌入空间中欧几里得距离的几何过滤框架,用于选择高质量的LLM生成样本。该系统与生成模型解耦,并在来自4个供应商的5个LLM上进行了验证。
2. 2. 一种软加权机制,将几何过滤分数转换为用于分类器训练的连续样本权重,超越了二元接受/拒绝决策。
3. 3. 证明这些过滤器无需修改即可跨任务(从文本分类到命名实体识别)泛化,实现+9.26pp的改进。
4. 4. 基于超过6,700种配置的综合经验证据,证明最简单的基于距离的过滤器始终优于复杂的多标准替代方案,并附有理论解释。
## II 相关工作
### II-A 经典过采样
SMOTE\[6 (https://arxiv.org/html/2608.13866#bib.bib1)\]通过在特征空间中对最近邻进行插值来生成合成样本。ADASYN\[13 (https://arxiv.org/html/2608.13866#bib.bib2)\]通过自适应采样密度扩展了这一方法。EDA\[25 (https://arxiv.org/html/2608.13866#bib.bib3)\]应用表层文本扰动(同义词替换、随机插入/删除)。虽然在某些情况下有效,但这些方法要么缺乏语言连贯性(嵌入空间中的SMOTE),要么只产生表面变化(EDA)\[11 (https://arxiv.org/html/2608.13866#bib.bib23), 23 (https://arxiv.org/html/2608.13866#bib.bib21)\]。
### II-B 基于LLM的增强
GPT-3生成的评论在情感分析中将准确率提高了+12.7%,宏F1提高了+13pp\[21 (https://arxiv.org/html/2608.13866#bib.bib25)\]。微调的LLM在多类不平衡文本中优于SMOTE,F1达到0.76对比0.60\[7 (https://arxiv.org/html/2608.13866#bib.bib10)\]。AugGPT利用ChatGPT进行跨多任务的增强\[8 (https://arxiv.org/html/2608.13866#bib.bib12)\]。然而,最近的研究表明,当每类有超过20个样本时,LLM的收益会减少\[5 (https://arxiv.org/html/2608.13866#bib.bib11)\],并且评估协议会显著影响结论\[17 (https://arxiv.org/html/2608.13866#bib.bib22)\]。
### II-C 混合与质量感知方法
新兴方法结合了生成式和生成方法。LLMOverTab使用SMOTE识别代表性不足的区域,并使用LLM填充它们\[14 (https://arxiv.org/html/2608.13866#bib.bib13)\]。SMOTExT应用SMOTE插值后接LLM解码\[4 (https://arxiv.org/html/2608.13866#bib.bib14)\]。SentiGEN将T5与遗传算法和XLNet验证器结合\[22 (https://arxiv.org/html/2608.13866#bib.bib15)\]。AugmenToxic将LLM增强应用于毒性检测\[1 (https://arxiv.org/html/2608.13866#bib.bib26)\]。然而,这些方法均未在嵌入空间中实施定量的后生成验证。我们的工作通过引入基于嵌入空间属性评估样本质量的几何过滤器来填补这一空白。
## III 方法论
### III-A 问题设定
我们在涵盖9个文本领域的13个数据集上进行评估:7个文本分类数据集(2-20类),包括20newsgroups、sms\_spam、hate\_speech、ag\_news、emotion、dbpedia14和20newsgroups\_20class;3个可扩展性数据集(trec6、banking77、clinc150,类别数6-150);以及3个NER语料库(MultiNERD、WikiANN、Few\-NERD)。少样本场景通过从训练集中每类采样10、25或50个样本来模拟,同时保持完整测试集不变。
所有文本使用all\-mpnet\-base\-v2\[18 (https://arxiv.org/html/2608.13866#bib.bib19), 16 (https://arxiv.org/html/2608.13866#bib.bib20)\]进行编码,生成L2归一化的768维嵌入。使用3个额外的嵌入模型(bge\-large, e5\-large, bge\-small)进行的消融研究证实了鲁棒性(90.5%的跨模型一致性)。
### III-B LLM生成
我们使用Gemini 3 Flash作为主要生成模型,并在GPT-5-mini、Claude 4.5 Haiku、Kimi K2.5和GLM-5(5个模型,4个供应商)上验证了鲁棒性。对于每个类别,真实样本作为上下文内示例,并生成3倍的冗余候选样本(每个所需样本生成3个候选)。未进行微调;所有特异性均来自上下文学习。响应通过MD5哈希缓存以确保可重复性。
### III-C 几何过滤器
我们实现了五种复杂度递增的过滤策略:
**无过滤器(控制):** 从候选样本中随机选择,隔离几何过滤的贡献。
**LOF过滤器\[2 (https://arxiv.org/html/2608.13866#bib.bib4)\]:** 评估每个合成样本相对于真实类别样本的局部密度。有两个变体:宽松(宽容阈值)和严格。
**级联过滤器:** 一个包含最多4个层级的分层评分系统:(1)到最近真实锚点的欧几里得距离,(2)余弦相似度,(3)KNN纯度,(4)质心距离。分数通过几何平均数结合,并通过排序选择前N个候选样本。**第1层(仅距离)** 产生了最佳结果。
**组合过滤器:** 要求同时通过LOF和余弦相似度阈值。这是最具限制性的策略,作为过度过滤的案例研究。
关键发现是,第1级级联(仅欧几里得距离)优于所有多标准替代方案。对于L2归一化向量,\(\|\mathbf{u}-\mathbf{v}\|_2^2 = 2(1-\cos(\mathbf{u},\mathbf{v}))\),因此欧几里得距离是余弦相似度的严格单调函数,后者不增加任何判别信息\[24 (https://arxiv.org/html/2608.13866#bib.bib18)\]。此外,LOF需要\(k=20\)个邻居,但在10-shot设置下只有9个可用,导致密度估计退化\[19 (https://arxiv.org/html/2608.13866#bib.bib16)\]。
### III-D 软加权
与其二元接受/拒绝,几何过滤分数被转换为连续的样本权重。该过程有四个步骤:(1)为所有候选项计算级联第1级分数;(2)选择前N个候选;(3)通过min-max将分数归一化到\[0,1\];(4)应用温度缩放:
\[
w(x) = \max\left(w_{\min},\ s_{\text{norm}}(x)^{1/T}\right)
\]
(1)
其中 \(T=0.5\)(即指数 \(1/T=2\),这使权重分布向最高分候选者集中),且 \(w_{\min}=0\),因此公式(1)中的 \(\max\) 运算符在此处不起作用,仅作为防止零权重样本的通用保障保留。真实样本始终获得权重1.0。权重作为 `sample_weight` 传递给分类器,因此几何一致的合成样本在训练中贡献更大。
### III-E 基线与分类器
我们与8种增强基线进行比较:SMOTE\[6 (https://arxiv.org/html/2608.13866#bib.bib1)\]、随机过采样、EDA\[25 (https://arxiv.org/html/2608.13866#bib.bib3)\]、回译(通过Gemini EN→ES→EN)、无增强、嵌入混合、T5释义和BERT上下文增强\[9 (https://arxiv.org/html/2608.13866#bib.bib5)\]。加上我们的两种变体(二元过滤和软加权),构成了表I (https://arxiv.org/html/2608.13866#S4.T1) 中的10种方法,其中SMOTE作为全程参考。评估了5种分类器:逻辑回归、线性SVC、岭回归、随机森林(100棵树)和MLP(100个隐藏单元)。
### III-F 统计协议
实验使用最多5个随机种子 \[42,123,456,789,1011\] 控制少样本采样,遵循两种协议。10种方法的主要比较(表I (https://arxiv.org/html/2608.13866#S4.T1) 和 II (https://arxiv.org/html/2608.13866#S4.T2))使用3个线性分类器和前3个种子(1,890次运行)。第二种协议覆盖所有5个分类器和所有5个种子下的7种方法(3,675次运行),并提供了表III (https://arxiv.org/html/2608.13866#S4.T3) 中的MLP和随机森林行。主要指标是完整测试集上的宏F1。显著性通过配对t检验与Bonferroni校正评估;每个表格报告其配对观测数 \(N\)。效应量报告为Cohen’s \(d\)(0.2为小,0.5为中,0.8为大)。置信区间通过自举法(10,000次重采样)计算。胜率衡量方法超过SMOTE的配置比例。
## IV 实验结果
### IV-A 主要比较
表I (https://arxiv.org/html/2608.13866#S4.T1) 展示了10种增强方法在1,890种配置(21种数据集配置×3个分类器×3个种子×10种方法)上与SMOTE的比较。
软加权方法比SMOTE高出+2.61pp,具有大的效应量(\(d=0.95\))和88.9%的胜率。二元过滤也达到了显著性(+2.39pp,\(d=0.82\))。关键的是,所有现代基线——T5释义、BERT上下文增强和嵌入混合——都未能超越SMOTE。这挑战了基于预训练模型的技术自动超越经典方法的叙事,与\[5 (https://arxiv.org/html/2608.13866#bib.bib11)\]一致。
软加权与二元过滤之间的消融显示出+0.22pp的边际差异(\(p=0.053\)),表明主要贡献来自几何过滤本身。二元过滤已经比无增强高出+1.75pp(\(p<0.0001\),\(d=0.63\)),证实了几何选择比不加区分地纳入样本增加了显著价值。
### IV-B 训练集大小的影响
表II (https://arxiv.org/html/2608.13866#S4.T2) 显示了明显的收益递减模式。在10-shot时,效应量非常大(\(d=1.48\)),绝对宏F1从67.23%(SMOTE)提高到72.12%。在25-shot时,胜率达到95.2%,表明近乎普遍的改进。在50-shot时,收益减少,因为分类器已有足够的数据来建立合理的决策边界。这种模式有一个直接的解释:当真实数据稀缺时,过滤后的合成样本提供了真正的新信息,使类别区域密集化;随着真实数据增长,分类器已经捕捉到了主要的决策边界,增强带来的边际价值递减。
图1 (https://arxiv.org/html/2608.13866#S4.F1) 通过情感数据集(6类,10-shot)的t-SNE投影说明了过滤机制。左图显示了所有LLM候选(叉号),其中许多落在跨类别或边缘区域。右图仅显示几何过滤后的样本(三角形),它们紧密聚集在每个类的真实样本(圆形)周围。
参考标题图1:情感数据集(6类,10-shot)嵌入空间的t-SNE可视化。左:所有LLM候选(叉号)包含跨类别和边缘区域的样本。右:经过几何过滤后,仅保留类别一致的样本(三角形)在真实样本(圆形)附近。星号表示类别质心。
表I:10种增强方法与SMOTE基线的比较。表I相似文章
通过判别式文本表征将一步图像生成从类别标签扩展到文本
研究者通过集成高判别力的大语言模型文本编码器,将 MeanFlow 一步图像生成从固定类别标签扩展到灵活文本输入,实现高效的文本条件合成并显著提升性能。
GEM:用于最优LLM数据策展的几何熵混合
GEM将LLM数据策展重新表述为超球面上的变分问题,使用几何熵混合和最小化-最大化算法来发现平衡的语义簇,在数据混合策略中实现了高达1.2%平均下游准确率的最先进改进。
你的逆嵌入矩阵实际上是文本嵌入的特征透镜
本文指出,LLM文本嵌入过度表达了高频无信息词元,并提出EmbedFilter,一种线性变换,通过滤除该子空间来改善语义表示并实现降维。
DWT-Fusion: 一种基于信号的免训练LLM生成文本检测框架
介绍DWT-Fusion,一种免训练框架,通过对token级对数概率进行离散小波分析来检测LLM生成的文本,在多个数据集上取得了优异的AUROC结果。
Telescope:通过测量标记重复概率改进LLM生成内容的零样本检测
论文引入了Telescope Perplexity这一指标,通过测量标记重复概率以零样本方式检测LLM生成的文本,在多个数据集上实现了最先进或具有竞争力的性能。