LLM增强的双分支学习在大规模多标签文本分类中的应用
摘要
本文提出了DualMLC,一个双分支框架,结合了自回归和双向语言模型用于大规模多标签文本分类,在基准测试上取得了最先进的结果。
arXiv:2609.12915v1 Announce Type: new
摘要:大规模多标签文本分类为每个文档从包含数千或数万个候选标签的词汇表中分配少量相关标签。尽管预训练语言模型改善了语义文本表示,但大多数基于表示的方法将预测流程集中在主要编码器上,或在单个排序器中结合辅助特征。因此,异构语言模型之间的互补性尚未得到充分探索。我们提出DualMLC,一个双分支框架,通过自回归仅解码器语言模型和双向编码器处理相同文档。每个分支维护自己的表示路径,并独立估计在共享标签空间上的相关性分数。DualMLC通过后期对数几率融合结合两个分数向量,使共享证据强化相关标签,而分支特定证据补偿另一分支表示的局限性。DualMLC在三个广泛使用的大规模多标签文本分类基准测试上取得了最先进的结果。消融实验结果进一步证实,集成异构预测器产生的排名比任何单一分支更强。源代码可在https://github.com/huiyegit/DualMLC公开获取。
查看缓存全文
缓存时间: 2026/09/14 08:41
# LLM增强的双分支学习用于大规模多标签文本分类 来源:https://arxiv.org/html/2609.12915 辉叶1,京张2,秀龙杨3,拉杰谢卡尔·桑德拉曼1 隶属关系:1乔治亚州立大学计算机科学系,美国佐治亚州亚特兰大市30303 2亚马逊公司,美国加利福尼亚州圣迭戈市 3华中师范大学计算机学院,中国湖北省武汉市430079 [email protected], [email protected], [email protected], [email protected] ###### 摘要 大规模多标签文本分类任务旨在从包含数千或数万个候选标签的词汇表中,为每个文档分配一小部分相关标签。尽管预训练语言模型已显著提升了文本的语义表征能力,但大多数基于表征的方法主要围绕单一主编码器构建预测流程,或在单个排序器中组合辅助特征。异构语言模型之间的互补性因此仍未得到充分探索。我们提出 DualMLC,这是一种双分支框架,通过一个自回归仅解码器语言模型和一个双向编码器分别处理同一文档。每个分支维护各自的表征路径,并在共享的标签空间上独立估计相关性分数。DualMLC 通过后期 logit 融合将两个分数向量结合,使共享证据能够强化相关标签,而分支特异性证据则可弥补另一分支表征的局限。DualMLC 在三个广泛使用的大规模多标签文本分类基准测试中取得了最先进的结果。消融研究进一步证实,集成异构预测器所产生的排序效果优于任何单一分支。源代码已公开于 https://github.com/huiyegit/DualMLC。 ###### 关键词: 大规模多标签文本分类、大语言模型、异构表征学习、双分支学习 ## I 引言 多标签文本分类旨在为每个文档从预定义标签集合中分配一个相关标签子集。在大规模场景下,标签集合可能包含数千或数万个标签,而每个文档通常仅关联其中一小部分。该任务支持细粒度语义组织和检索,在网页标注[1 (https://arxiv.org/html/2609.12915#bib.bib1)]、产品分类、文档标记、推荐系统[2 (https://arxiv.org/html/2609.12915#bib.bib2)]和语义搜索等应用中具有重要价值。 大规模多标签文本分类的研究已通过近期代表性的神经网络系统提升了标签预测效率和文本语义表征能力,包括 LightXML[3 (https://arxiv.org/html/2609.12915#bib.bib3)]、XR-Transformer[2 (https://arxiv.org/html/2609.12915#bib.bib2)]、MatchXML[4 (https://arxiv.org/html/2609.12915#bib.bib4)]、CascadeXML[5 (https://arxiv.org/html/2609.12915#bib.bib5)] 和 QUEST[6 (https://arxiv.org/html/2609.12915#bib.bib6)],这些系统主要围绕单一文本编码器构建预测流程。因此,其标签分数主要受单一表征几何形态影响。然而,双向编码器与自回归语言模型在架构、上下文化机制和预训练目标上存在显著差异,因此可能捕获不同且互补的语义证据。这一区别在大规模标签词汇表上的预测中尤为重要,因为许多标签语义相近,文本表征的细微变化就可能改变其排序位置。这引出了一个基本的科学问题:异构编码器是否提供了真正互补的表征?它们的组合证据能否提高最高排名标签的预测准确性? 为解决这一问题,本文提出一种双分支多标签分类框架,称为 DualMLC,该框架明确利用互补表征来处理大规模多标签文本分类。DualMLC 通过两个采用不同表征机制的并行分支处理相同输入文本,从而能够从不同视角对输入语义进行建模。每个分支维护独立的表征路径,并使用各自的语义证据估算候选标签的相关性。这种独立学习保留了每种表征捕获的独特信息,避免过早地将异构特征强制映射到共享空间。随后,将两个分支产生的预测证据结合,形成对标签集的统一排序,使得共享证据能够强化相关标签,互补证据则能弥补各自表征的局限。通过这种方式,DualMLC 将表征互补性转化为直接提升大规模标签词汇表预测能力的机制。我们的主要贡献总结如下: - • 我们提出 DualMLC,一个异构双分支框架,通过两个不同的建模机制学习独立文本表征,并将其预测证据整合,用于大规模多标签文本分类。 - • 我们研究了大规模标签词汇表上的表征互补性,并通过实验证明两个分支捕获了不同且互补的证据,其整合效果优于任何单一分支。 - • 大量实验表明,DualMLC 在三个基准数据集上取得了新的最先进结果,而全面的消融研究验证了分支集成的作用及关键设计选择的影响。 ## II 相关工作 大规模多标签学习最初侧重于高效的输出建模。Babbar 和 Schölkopf[7 (https://arxiv.org/html/2609.12915#bib.bib7)] 提出 DiSMEC,通过分布式优化保留标签特异性判别力;而 Yen 等人[8 (https://arxiv.org/html/2609.12915#bib.bib8)] 开发了 PD-Sparse,通过对偶稀疏性降低成本。嵌入方法则压缩局部标签结构。Bhatia 等人[9 (https://arxiv.org/html/2609.12915#bib.bib9)] 在 SLEEC 中学习邻域保持表征,Tagami[10 (https://arxiv.org/html/2609.12915#bib.bib10)] 在 AnnexML 中重建标签邻域图用于近似检索。基于树的方法将评分限制在候选路径上。Jain 等人[11 (https://arxiv.org/html/2609.12915#bib.bib11)] 在 PfastreXML 中引入倾向评分树,Prabhu 等人[12 (https://arxiv.org/html/2609.12915#bib.bib12)] 在 Parabel 中使用平衡划分组织标签,Khandagale 等人[13 (https://arxiv.org/html/2609.12915#bib.bib13)] 在 Bonsai 中开发了更浅、更多样化的树。Wydmuch 等人[14 (https://arxiv.org/html/2609.12915#bib.bib14)] 通过 eXtremeText 为标签树建立了概率基础,而 Yu 等人[15 (https://arxiv.org/html/2609.12915#bib.bib15)] 在 XR-Linear 中统一了语义索引、匹配和稀疏排序。这些方法为控制标签评分提供了有效机制,但其主要关注点在于输出组织,而非异构语义文本编码。 上下文编码器将重点从输出结构转向语义表征学习。Liu 等人[16 (https://arxiv.org/html/2609.12915#bib.bib16)] 提出 XML-CNN 学习卷积文档特征,You 等人[1 (https://arxiv.org/html/2609.12915#bib.bib1)] 随后在 AttentionXML 中结合序列编码与标签特定注意力。预训练 Transformer 进一步强化了这一方向。Chang 等人[17 (https://arxiv.org/html/2609.12915#bib.bib17)] 引入 X-Transformer 用于分层聚类匹配,而 Jiang 等人[3 (https://arxiv.org/html/2609.12915#bib.bib3)] 开发 LightXML,在标签召回与排序间共享一个 Transformer 表征。Zhang 等人[2 (https://arxiv.org/html/2609.12915#bib.bib2)] 在 XR-Transformer 中扩展了跨标签分辨率的微调,Kharbanda 等人[5 (https://arxiv.org/html/2609.12915#bib.bib5)] 在 CascadeXML 中将中间层与不同分辨率关联。另一条平行研究方向丰富了主编码器之外的预测信号。Xun 等人[18 (https://arxiv.org/html/2609.12915#bib.bib18)] 用 CORNet 建模标签相关性,Dahiya 等人[19 (https://arxiv.org/html/2609.12915#bib.bib19)] 在 SiameseXML 中对齐实例与标签表征,Chien 等人[20 (https://arxiv.org/html/2609.12915#bib.bib20)] 通过 PINA 引入辅助信息。近期,Ye 等人[4 (https://arxiv.org/html/2609.12915#bib.bib4)] 在 MatchXML 中结合稀疏、任务微调和静态句子表征,Zhou 等人[6 (https://arxiv.org/html/2609.12915#bib.bib6)] 在 QUEST 中适配了量化的大语言模型。这些进展证明了更丰富语义的价值,但它们通常优化单一编码器层级或在单一排序流程中组合多个特征来源。DualMLC 则学习架构不同的编码器作为独立监督的预测器,并仅在两者都映射到共同标签空间后才整合其证据。 ## III 方法 ### III-A 任务定义 设 $\mathcal{D}=\{(x_i,\mathbf{y}_i)\}_{i=1}^N$ 表示包含 $N$ 个文档的训练集。每个文档 $x_i$ 关联一个在标签集合 $\mathcal{L}=\{\ell_1,\ldots,\ell_L\}$ 上的多热向量 $\mathbf{y}_i \in \{0,1\}^L$。条目 $y_{ij}=1$ 表示标签 $\ell_j$ 与 $x_i$ 相关,而 $y_{ij}=0$ 表示不相关。任务是学习一个评分函数 $f_\theta(x_i) \in \mathbb{R}^L$,由模型参数集合 $\theta$ 参数化,该函数能为相关标签分配更高的分数。对于给定的预测深度 $k$,预测的标签集为 $$ \widehat{\mathcal{Y}}_i^{(k)} = \left\{ \ell_j \in \mathcal{L} \mid j \in \operatorname{TopK}\!\left(f_\theta(x_i), k\right) \right\}, $$ (1) 其中 $\operatorname{TopK}$ 返回分数最高的 $k$ 个条目的索引。因此,核心建模需求是构建能够保留充分语义证据的文档表征,以便在大规模且紧密相关的标签集上进行可靠排序。 ### III-B DualMLC 概述 DualMLC 通过并行异构编码器实现评分函数。我们用 $q$ 表示自回归分支,用 $b$ 表示双向分支。对于 $r \in \{q,b\}$,其 logit 向量 $\mathbf{z}_i^r \in \mathbb{R}^L$ 为 $$ \mathbf{z}_i^r = \left( \mathcal{C}_r \circ \mathcal{R}_r \circ \mathcal{P}_r \circ \mathcal{G}_r \circ \mathcal{E}_r \circ \tau_r \right)(x_i), $$ (2) 其中 $\circ$ 表示函数组合,$\tau_r$ 是分词器,$\mathcal{E}_r$ 是编码器,$\mathcal{G}_r$ 聚合上层输出,$\mathcal{P}_r$ 执行序列池化,$\mathcal{R}_r$ 调整维度,$\mathcal{C}_r$ 生成 $L$ 个标签 logit。图1 (https://arxiv.org/html/2609.12915#S3.F1) 概括了其流程。两个分支在进入共同标签空间之前保持独立,该空间作为融合接口,无需强制隐藏特征对齐。每个编码器保留其原生的上下文化和池化方式,而其分类器将分支特异性证据映射到与相同标签关联的坐标上。 参考标题 图1:DualMLC 概览。相同输入文本由两个异构表征分支处理。每个分支独立生成标签 logit,并将其结合以获得最终标签排序。训练期间两个分支均接受直接监督。 ### III-C 异构文本编码 分支分词器 $\tau_q$ 和 $\tau_b$ 独立地将文档转换为两个词元序列 $$ \mathbf{t}_i^q = \tau_q(x_i), \qquad \mathbf{t}_i^b = \tau_b(x_i). $$ (3) 独立分词尊重不同的预训练词汇表。对于分支 $r \in \{q,b\}$ 中的文档 $x_i$,设 $\mathbf{a}_i^r = [a_{i1}^r,\ldots,a_{iT_r}^r] \in \{0,1\}^{T_r}$ 表示其长度为 $T_r$ 的二进制注意力掩码,其中 $t$ 索引词元位置。我们将非填充词元对应的 $a_{it}^r$ 设为1,填充词元对应的设为0。该掩码进入每个 Transformer 层,并在文档池化期间排除填充位置。词元状态为 $$ \mathbf{H}_{i,0}^r = \operatorname{Emb}_r(\mathbf{t}_i^r), \qquad \mathbf{H}_{i,m}^r = E_{r,m}\!\left(\mathbf{H}_{i,m-1}^r, \mathbf{a}_i^r\right), \quad m=1,\ldots,M_r, $$ 其中 $\operatorname{Emb}_r$ 和 $E_{r,m}$ 分别是嵌入层和第 $m$ 个 Transformer 层。状态 $\mathbf{H}_{i,m}^r \in \mathbb{R}^{T_r \times d_r}$ 具有隐藏宽度 $d_r$,$M_r$ 是层数。分支 $q$ 使用因果注意力,而分支 $b$ 使用双向注意力。因果注意力在自回归约束下总结文档,而双向注意力则整合每个词元两侧的证据。因此,它们不同的上下文形成机制能够强调相同标签的不同词汇和语义线索,从而为双分支设计提供所需的表征多样性。 分支 $q$ 使用 Qwen2.5-7B[21 (https://arxiv.org/html/2609.12915#bib.bib21)],而分支 $b$ 使用 BERT-base-uncased[22 (https://arxiv.org/html/2609.12915#bib.bib22)]。我们为更大的自回归骨干网络适配了低秩自适应[23 (https://arxiv.org/html/2609.12915#bib.bib23)],应用于每个注意力投影(索引为 $p \in \{Q,K,V,O\}$),其中 $Q, K, V, O$ 分别表示查询、键、值和输出投影。对于层 $m \in \{1,\ldots,M_q\}$ 中的输入 $\mathbf{u} \in \mathbb{R}^{d_{\mathrm{in}}}$,适配后的投影为 $$ \operatorname{Proj}_{m,p}(\mathbf{u}) = \mathbf{W}_{m,p}^0 \mathbf{u} + \frac{\gamma_{\mathrm{L}}}{r_{\mathrm{L}}} \mathbf{B}_{m,p} \mathbf{A}_{m,p} \mathcal{D}_{\mathrm{L}}(\mathbf{u}), $$ (5) 其中 $d_{\mathrm{in}}$ 和 $d_{\mathrm{out}}$ 是投影的输入和输出宽度。冻结的预训练权重为 $\mathbf{W}_{m,p}^0 \in \mathbb{R}^{d_{\mathrm{out}} \times d_{\mathrm{in}}}$,其上标 $0$ 将其与学习到的更新区分开来。因子 $\mathbf{A}_{m,p} \in \mathbb{R}^{r_{\mathrm{L}} \times d_{\mathrm{in}}}$ 和 $\mathbf{B}_{m,p} \in \mathbb{R}^{d_{\mathrm{out}} \times r_{\mathrm{L}}}$ 是可训练的。此外,$r_{\mathrm{L}}$ 是 LoRA 的秩,$\gamma_{\mathrm{L}}$ 是缩放因子,$\mathcal{D}_{\mathrm{L}}$ 是应用于 $\mathbf{u}$ 的 LoRA 丢弃算子。乘积 $\mathbf{B}_{m,p} \mathbf{A}_{m,p}$ 构成了任务特定的更新,同时保留了 $\mathbf{W}_{m,p}^0$。
相似文章
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
基于双重语义嵌入的大语言模型鲁棒文本水印
本文提出了双重嵌入水印(DEW),一种面向大语言模型的语义水印方案,通过利用上下文嵌入和词级嵌入来增强对抗改写和翻译的鲁棒性。实验结果表明,与先前方法相比,该方法在改写和翻译后仍能保持较好的检测性能。
M2G-LLM: 通过多模态图推理和LLM上下文注入提升临床预测
本文介绍了M2G-LLM,这是一个通过图神经网络使用多模态图推理来增强大语言模型的框架,旨在利用电子健康记录改进临床预测任务。
一域多语:无需配对数据构建跨语言遥感MLLM的领域与语言LoRA组合
本文介绍了Modl技术,该技术通过组合领域与语言LoRA并实现互正交性,创建跨语言遥感多模态大语言模型(MLLM),在无需配对多语言数据的情况下实现卓越性能。
离散扩散语言模型是免训练的多标签分类器
本文提出了dLLM-SetScore,一个使用离散掩码扩散语言模型进行多标签文本分类的免训练框架,仅需少量验证数据即可达到竞争性能。