离散扩散语言模型是免训练的多标签分类器

arXiv cs.LG 论文

摘要

本文提出了dLLM-SetScore,一个使用离散掩码扩散语言模型进行多标签文本分类的免训练框架,仅需少量验证数据即可达到竞争性能。

arXiv:2608.14649v1 公告类型:新 摘要:我们提出dLLM-SetScore,一种使用离散掩码扩散语言模型进行多标签文本分类的免训练方法。对于每个候选标签,它提出一个简短的是/否问题,并在单个掩码位置比较两个答案标记的概率。该方法不使用任何特定任务的微调或在文本蕴含数据集上进行训练;一个200个样本的标记验证切片用于选择阈值、温度和提示措辞。 我们首先展示,将所有标签放在一个提示中会产生强烈的槽位位置不对称性:在GoEmotions样本中,第一个答案槽位有$99.4\%$被预测为正,在Reuters样本中为$100\%$。每个标签的评分将每个标签放在相同的句法位置,使预测不受标签顺序影响并避免此伪影。我们在六个数据集上评估LLaDA-8B和Dream-7B,并与NLI模型、自回归LLM、SetFit和监督分类器进行比较。在两个扩散系列共享的五个数据集上,Instruct检查点在10次比较中有9次提高了宏观F1,在8次比较中提高了微观F1,尽管这些比较并未找出原因。在我们的协议中,LLaDA-Instruct在Reuters和ECtHR指标上记录了最高的免训练值。我们证明了排列不变性,表征了加权汉明损失下的阈值决策,并推导了召回率和F1的简短列表上限。一个探索性的局部联合集优化步骤降低了来自有偏和无偏初始化的F1,并作为负面结果保留。
查看原文
查看缓存全文

缓存时间: 2026/08/18 10:20

# 离散扩散语言模型:无需训练的多标签分类器
**SIAM SDM 2026 最终录用论文预印本。附录与完整结果:** https://github.com/misterpawan/multilabel-classification-dllm-paper.git
**来源:** https://arxiv.org/html/2608.14649
**Pawan Kumar**
印度海得拉巴国际信息技术研究所
pawan\.kumar@iiit\.ac\.in
个人主页:aiwranglers\.org (https://aiwranglers.org/)

###### 摘要
我们提出 **dLLM-SetScore**,一个无需训练的框架,利用离散掩码扩散语言模型作为多标签文本分类器,无需对扩散骨干网络进行任务特定微调,也无需在文本蕴含数据集上进行训练;仅使用一个小型(200个样本)有标签验证集切片用于阈值、温度和提示模板的选择。我们在六个数据集(GoEmotions、Reuters-21578、EURLEX57K、ECtHR Task A、Jigsaw Toxic、AAPD)上,使用两个掩码扩散模型家族(LLaDA-8B 和 Dream-7B),与 BART-MNLI、DeBERTa-NLI、Qwen2.5-7B-Instruct、SetFit 以及监督式 BERT、RoBERTa 和 T5 进行了评估。本文做出四项贡献。(i) 我们识别了全掩码多位置提示中的**位置槽不对称性**,该问题导致按字母顺序排列的第一个答案槽位(在 GoEmotions 上为 99.4% 正类,在 Reuters 上为 100% 正类)坍缩,并使宏观F1趋向于零。(ii) 我们提出了**逐标签蕴含评分**:每个标签都在相同的句法位置进行查询,因此对标签顺序具有置换不变性,从而消除了位置槽不对称性。(iii) 在两个扩散家族共享的五个数据集上,Instruct 检查点在大多数情况下优于其对应的 Base 检查点(宏观F1在10对(数据集,家族)组合中有9对提升,微观F1在10对中有8对提升)。这一比较记录了被评估检查点中反复出现的从Base到Instruct的差异,但并未确定其机制。(iv) 我们给出了逐标签评分的理论分析(置换不变性、加权汉明损失下的贝叶斯最优性、因列表限制导致的召回率和F1上界)。在我们的评估协议内,LLaDA-Instruct 配合经验证选择的逐标签问题模板,在 Reuters(微观/宏观)、ECtHR(微观/宏观)、Jigsaw(在不同模板下最佳调优微观和最佳调优宏观)以及 GoEmotions(经提示调优后的微观)数据集-指标组合上记录了最高的无需训练的性能值。一个结合 BART-MNLI、SetFit(一个少样本监督组件)和 LLaDA-Instruct 的混合集成方法在 Reuters 上达到了 82.4/79.3 的微观/宏观F1,与监督式 RoBERTa 的微观F1差距在7以内。我们还探索了一种局部条件联合集合精炼(JSR)变体;经验表明,无论从有偏还是无偏的种子开始,它都是有害的,因此我们仅将其作为一个信息性的负面结果保留。

## 1 引言
多标签文本分类为每个文档分配一个相关标签的*子集*。标准方法是监督式的:在微调后的编码器上使用 sigmoid 分头[xiao2019label,ma2021label]。近期研究表明,扩散模型也可用作分类器[li2023diffusionclassifier,clark2023t2i],但仅限于单标签图像任务。将其扩展到多标签文本并非易事:m个标签产生2^m个子集,并且掩码扩散语言模型在使用长的全掩码答案后缀进行提示时,会表现出训练分布的伪影。

我们提出了 **dLLM-SetScore**,一个利用离散扩散语言模型进行多标签分类的无需训练的框架。所谓“**无需训练**”是指:不对扩散骨干网络进行任务特定微调,也不在文本蕴含数据集上进行训练;仅使用一个小型有标签验证切片(200个样本)来选择阈值、温度和提示模板。该方法很简单:对于每个候选标签,构建一个简短的逐标签是/否提示,并在单个掩码答案位置读取扩散模型对动词“yes”相对于“no”的对数概率。我们还研究了一种联合集合精炼(JSR)变体,它迭代局部条件更新;我们发现这在我们尝试的每种配置中都有害,因此仅将其作为一个负面结果和消融研究保留。

我们发现,替代的全掩码多位置评分方法存在强烈的位置槽不对称性(按字母顺序排列的第一个答案槽位在 GoEmotions 上坍缩至 99.4% 正类,在 Reuters 上坍缩至 100% 正类),而逐标签提示通过将每个标签查询置于相同的句法位置,消除了这种不对称性。在评分器固定的情况下,Instruct 检查点在大多数评估的单元格中比其对应的 Base 检查点具有更高的宏观F1。相同的模式出现在 LLaDA-8B 和 Dream-7B 中,尽管此比较并未确定差异的来源。

#### 贡献
本文做出四项贡献,其表述与摘要、本文以及结论中的形式相同。
(i) 我们识别并诊断了掩码扩散语言模型上全掩码多位置评分的位置槽不对称性。
(ii) 我们提出了逐标签蕴含评分,其中每个标签都在相同的句法位置进行查询;由此产生的评分器对标签顺序具有置换不变性,因此免除了位置槽不对称性,并将 Reuters 的宏观F1从 10.9 提升至 38.2,同时微观F1基本保持不变。
(iii) 在 LLaDA 和 Dream 共享的五个数据集上,Instruct 检查点在大多数单元格中优于其对应的 Base 检查点(在10对(数据集,家族)组合中,宏观F1在9对上提升,微观F1在8对上提升)。我们报告这一点作为经验性的检查点比较,而非关于指令调优的因果性声明。
(iv) 我们给出了逐标签评分器的理论分析:置换不变性、阈值匹配加权汉明损失下的贝叶斯最优性,以及由列表限制施加的召回率和F1的明确上界;一段简短的文字说明了该理论能解释和不能解释的内容。
额外的结果表格、逐标签分析、提示扫描、实现细节和证明见参考文献之后的附录。

## 2 相关工作
**扩散分类器。** Li 等人[li2023diffusionclassifier]表明,图像扩散模型可以通过比较条件去噪轨迹上的逐类重建损失来进行分类。Clark 和 Jaini[clark2023t2i]将其扩展到文本到图像扩散模型,展示了零样本识别和组合行为。这些方法适用于单标签图像分类。我们将该思想适应到多标签文本分类,这引入了图像设置中不存在的指数级子集复杂性、标签依赖性和提示预算限制。我们还识别了一种文本掩码扩散特有的新失败模式:当一个全掩码答案后缀附加到干净提示时,第一个掩码位置承载了完整的提示上下文,而其他位置则没有,从而产生位置槽不对称性,将宏观F1拖向零。

**离散扩散语言模型。** 离散状态扩散在 D3PM[austin2021structured]中被形式化,使用结构化转移矩阵和吸收态损坏。Campbell 等人[campbell2022continuous]将其建模为连续时间逆向马尔可夫链。MDLM[sahoo2024simple]证明了掩码扩散语言模型可以用与 MLM 损失混合相关的简化目标进行训练。LLaDA[nie2025large]将其扩展到 80 亿参数,并提供了 Base 和 Instruct 两种检查点。Dream-7B[ye2025dream]从 Qwen2.5-7B 自回归骨干初始化,并使用掩码去噪目标进行微调,提供了第二个具有不同父模型和分词器的骨干家族。与那些为判别任务微调掩码扩散骨干的工作不同,我们直接*原样*使用去噪器,没有任何额外的任务特定微调。

**多标签文本分类。** 强监督基线使用微调编码器上的 sigmoid 分头独立预测标签[xiao2019label,ma2021label],有时使用序列解码器目标[yang2018sgm]。像 SetFit[tunstall2022efficient]这样的少样本替代方案在句子嵌入上训练轻量级头部。Kementchedjhieva 和 Chalkidis[kementchedjhieva2023exploration]探索了用于法律和生物医学多标签分类的编码器-解码器替代方案。这些方法均未使用生成式扩散骨干。

**零样本文本分类。** BART-MNLI[yin2019benchmarking,lewis2020bart]和 DeBERTa-NLI 通过在 MNLI 上训练的蕴含模板对标签进行评分。这些是我们的主要基线。与它们不同,dLLM-SetScore 从一个从未在 NLI 数据上训练过的骨干上的扩散掩码分布中获取证据,因此任何分类能力都源于掩码去噪预训练(以及对于 Instruct 变体,额外的通用指令遵循监督);我们将在第5节(https://arxiv.org/html/2608.14649#S5)中给出相应区分。

## 3 方法
### 3.1 问题设定与符号
给定文档 $x \in \mathcal{X}$ 和标签集合 $\mathcal{L}=\{\lambda_1,\dots,\lambda_m\}$,预测 $y \in \{0,1\}^m$。对于每个文档,我们使用完整集合 $\Lambda(x)=\mathcal{L}$ 或一个文档特定的短列表 $\Lambda(x)\subseteq\mathcal{L}$,其大小 $k=|\Lambda(x)|$;下文所有求和均基于 $\Lambda(x)$,未被选中的标签约定预测为负类。

我们构建一个提示前缀 $p(x,\Lambda)$,包含指令、文档和有序标签列表,后接一个答案后缀 $a(y)=v(y_1);\dots;v(y_{|\Lambda|})$,其中 $v(1)=\texttt{yes}, v(0)=\texttt{no}$ 是在骨干加载时验证的单标记动词。拼接 $s=p(x,\Lambda)\,\|\,a(y)$ 是完整的输入序列;$s_{[t]}$ 是位置 $t$ 的标记,$r_i$ 是第 $i$ 个答案槽位的绝对位置,$\tilde{s}^{(M)}$ 是将 $s_{[t]}$ 在每个 $t\in M\subseteq\{r_1,\dots,r_{|\Lambda|}\}$ 处替换为 $[\text{MASK}]$ 标记后得到的序列。符号总结在表1(https://arxiv.org/html/2608.14649#S3.T1);理论部分稍后引入的符号($\Lambda(x), P_{\{+\}}, \rho_{\mathrm{ret}}, \rho_i, \mathcal{I}_{\{+\}}, R_{\tau}^{\star}, u_i^{\star}$)在首次使用时定义。

表1:正文使用的符号。理论部分的特定符号在首次出现时内联定义。

局部扩散分数 $\ell_{\theta,i}(b;x,y_{-i})$ 是在*其他*答案槽位上的随机掩码集 $M$ 下,第 $i$ 个答案槽位取动词 $v(b)$ 的对数概率的期望:
$$\ell_{\theta,i}(b;x,y_{-i})=\mathbb{E}_{M\sim q_i}\!\left[\log p_{\theta}\!\left(v(b)\,\big|\,\tilde{s}^{(M\cup\{r_i\})},r_i\right)\right]。$$
(1)
掩码分布 $q_i$ 首先均匀采样 $|M|$ 来自 $\{0,1,\dots,|\Lambda|-1\}$,然后从 $\{r_j:j\neq i\}$ 中均匀抽取该大小的子集 $M$,遵循官方 LLaDA 的答案似然计算流程。

伪似然代理 $\mathcal{PL}_{\theta}(y\mid x):=\sum_{i}\ell_{\theta,i}(y_i;x,y_{-i})$ 将联合评分分解为 $|\Lambda|$ 个标量局部查询;它不是多槽位答案后缀的联合对数似然。

### 3.2 逐标签蕴含评分(推荐方法)
我们为每个(文档,标签)对使用一个简短提示:
> **文档:** $\langle\text{doc}\rangle$  
> **问题:** 本文档是否表达了 $\langle\text{label}\rangle$?  
> **答案:** [MASK]

并读取逐标签对数几率 $u_i(x)=\log p_{\theta}(v^+|\mathrm{prompt}_i,r_i)-\log p_{\theta}(v^-|\mathrm{prompt}_i,r_i)$。

(2)

每个标签都在相对于文档和单个掩码答案槽位的相同句法位置进行查询,因此此布局对标签顺序具有置换不变性,并且*消除了我们在第5节(https://arxiv.org/html/2608.14649#S5)中诊断出的全掩码评分的位置槽不对称性*;它并非完全无偏(提示模板、词汇和标签描述偏见仍然存在,我们在表5(https://arxiv.org/html/2608.14649#S5.T5)和附录16(https://arxiv.org/html/2608.14649#A16)中进行了研究)。我们在全文中使用一个一致术语“逐标签蕴含评分”;我们也将其简称为“逐标签评分”。图1(https://arxiv.org/html/2608.14649#S3.F1)对比了两种操作模式,算法1(https://arxiv.org/html/2608.14649#alg1)给出了伪代码。

**算法1** 逐标签蕴含评分(推荐方法)。  
**输入:** 文档 $x$,标签集合 $\Lambda$,动词 $(v^+,v^-)=(\texttt{yes},\texttt{no})$。  
**输出:** 逐标签对数几率向量 $u\in\mathbb{R}^{|\Lambda|}$,经阈值处理为 $\hat{y}_i=\mathbf{1}[\sigma(u_i/T)\geq\tau_i]$,其中 $T,\tau_i$ 在验证切片上调优。  
实现在 `scripts/llada_per_label.py` 中;对应图1(https://arxiv.org/html/2608.14649#S3.F1)(b)。
```
1: for each label λ_i ∈ Λ do
2:    s_i ← "文档:" x "问题:本文档是否表达了" λ_i "?答案:" [mask]
3:    对 s_i 运行扩散骨干;令 r_i 为掩码位置
4:    u_i ← log p_θ(v^+ | s_i, r_i) - log p_θ(v^- | s_i, r_i)
5: end for
6: return u = (u_1, u_2, ..., u_{|Λ|})
```

图1:dLLM-SetScore 比较的两种扩散评分模式。
(a) **全掩码一元评分**将所有标签和所有答案槽位打包到一个提示中;掩码扩散训练分布与长的全掩码后缀相距甚远,因此按字母顺序排列的第一个答案槽位(红色)在 GoEmotions 上坍缩至 99.4% 正类,在 Reuters 上坍缩至 100% 正类(图2(https://arxiv.org/html/2608.14649#S5.F2))。
(b) **逐标签蕴含评分**运行 $|\Lambda|$ 个简短提示,每个提示包含一个处于相同句法位置的单个掩码答案槽位;此布局对标签顺序具有置换不变性,并消除了(a)中的位置槽不对称性(但提示模板或词汇偏见未消除)。两种模式共享相同的下游校准步骤。逐标签模式是我们推荐的默认模式,也是表3(https://arxiv.org/html/2608.14649#S5.T3)中每个 LLaDA-I 和 Dream-I 行的操作模式。

### 3.3 联合集合精炼(JSR,探索性)
从逐标签种子 $\hat{y}_i^{(0)}=\mathbf{1}[\sigma(u_i/T)\geq\tau_i]$ 开始,JSR 通过对所有标签的联合掩码模式运行扩散骨干并重复精炼预测集合来进行迭代。这需要在每次迭代中进行 $|\Lambda|$ 次前向传递,计算成本高昂,并且我们发现经验上是有害的(见第5.5节),因此仅作为负面结果和消融保留。

相似文章

多块扩散语言模型

Hugging Face Daily Papers

本文提出多块扩散语言模型(MBD-LMs),将单块扩散扩展为并发多块解码,并采用优化训练策略如多块教师强制(Multi-block Teacher Forcing)和优化的块缓冲区解码算法。实验表明,每次前向传递的令牌数增加,基准测试准确率提升。