探索更多以解决更多:通过基于熵的引导提升文本扩散模型的多样性

arXiv cs.CL 论文

摘要

提出了一种无需训练的语义感知核熵(SAKE)引导方法,用于文本扩散模型,利用核格拉姆矩阵上的二阶Rényi熵在采样过程中平衡保真度与多样性。实验表明,在推理密集型任务上,该方法改善了Pareto前沿和多样本性能。

arXiv:2608.00024v1 公告类型:新论文 摘要:尽管扩散模型通过高质量生成和可控引导机制彻底改变了图像合成等连续领域,但将这种可控性引入文本的离散、序列特性仍然是一个开放挑战。与此同时,当前的采样策略和引导方法调整词元似然时并未捕捉更广泛的语义图景,导致保真度与多样性之间的平衡欠佳。在这项工作中,我们提出了一种新颖的无需训练的语义感知核熵(SAKE)引导方法。我们的方法在核格拉姆矩阵上计算二阶Rényi熵,该矩阵同时捕捉跨词元的语义交互和相对词元位置。通过在嵌入空间中对这一目标进行线性化,我们推导出一个易于处理的引导信号,该信号动态调整采样分布,在冗余时使其平坦化以鼓励探索,在多样时使其尖锐化以保证保真度。实证实验表明,与温度缩放和离散引导基线相比,我们的方法在保真度和多样性之间实现了更优的Pareto前沿,并在代码生成和数学生成等推理密集型任务上提升了多样本性能。
查看原文
查看缓存全文

缓存时间: 2026/08/04 07:36

# 探索更多以解决更多:通过基于熵的引导提升文本扩散模型的多样性 ###### 摘要 尽管扩散模型通过在图像合成等连续域中实现高质量生成和可控引导机制而带来了革命性变化,但将这种可控性引入文本的离散、序列化特性仍然是一个未解决的挑战。同时,当前的采样策略和引导方法调整令牌似然时,并未捕捉更广泛的语义景观,导致保真度与多样性之间的平衡欠佳。在这项工作中,我们引入了一种新颖的免训练语义感知核熵(Semantic-Aware Kernel Entropy, SAKE)引导方法。我们的方法在一个核 Gram 矩阵上计算二阶 Rényi 熵,该矩阵同时捕捉跨令牌语义交互和相对令牌位置。通过在嵌入空间中将该目标线性化,我们推导出一个可处理的引导信号,该信号动态调整采样分布——在冗余时使其平坦化以鼓励探索,在多样时使其尖锐化以保持保真度。实验证明,与温度缩放和离散引导基线相比,我们的方法在保真度和多样性之间实现了更优的帕累托前沿,并在推理密集型任务(如代码生成和数学生成)上提升了多样本生成性能。 机器学习,ICML ## 1 引言 文本生成长期以来由自回归(AR)模型主导\(Brown et al., 2020 (https://arxiv.org/html/2608.00024#bib.bib47); Liu et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib46); Yang et al., 2025 (https://arxiv.org/html/2608.00024#bib.bib27)\),这些模型将序列的联合概率分解为条件下一个令牌概率的乘积。虽然非常有效,但 AR 生成本质上受到串行延迟和解码过程中缺乏双向上下文的限制。近年来,扩散语言模型(DLMs)作为一种引人注目的非自回归替代方案出现,提供了向并行解码的范式转变\(Austin et al., 2021 (https://arxiv.org/html/2608.00024#bib.bib18); Nie et al., 2025 (https://arxiv.org/html/2608.00024#bib.bib21); Ye et al., 2025 (https://arxiv.org/html/2608.00024#bib.bib22)\)。现代 DLM 的核心机制是直接在离散的分类令牌空间中运行的扩散过程。这涉及一个前向破坏过程,将有效令牌逐渐转换为噪声,并配对一个经过训练以逆转该轨迹的生成模型。与自回归方法不同,该框架能够同时迭代地精炼所有令牌。因此,DLM 在整个生成过程中利用全局双向上下文,并能够在计算成本和样本质量之间进行灵活的权衡。 连续扩散模型在图像和音频合成中的成功在很大程度上得益于其通过推理时引导实现的可控性\(Dhariwal and Nichol, 2021 (https://arxiv.org/html/2608.00024#bib.bib4); Ho and Salimans, 2022 (https://arxiv.org/html/2608.00024#bib.bib5); Bansal et al., 2023 (https://arxiv.org/html/2608.00024#bib.bib35)\)。这种引导通过修改反向扩散动力学,在无需重新训练的情况下从期望的条件分布中采样。然而,将这些范式扩展到文本生成的离散序列领域面临根本性挑战。在连续空间中,引导通常通过可微能量函数修改得分函数(数据对数似然的梯度)来运作。相比之下,在离散域中,梯度是未定义的,得分函数基于分类后验分布。修改该分布需要重新归一化,这在计算上难以处理,因为需要计算一个对 \(V^L\) 个可能序列(其中 \(L\) 是序列长度,\(V\) 是词表大小)求和的配分函数。尽管最近的方法通过假设令牌独立性\(Sahoo et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib19)\)将这种指数成本降低为线性成本,但此类分解忽略了对于连贯语义形成至关重要的复杂跨令牌相关性。 除了计算上的难以处理性之外,离散文本扩散还面临 logit 空间缺乏语义结构的问题,而连续扩散则利用了连续特征空间的内在语义几何结构。由于离散模型估计的是分类分布上的转移概率,由此产生的 logit 编码的是模型置信度而非语义相似性。因此,现有的 DLM 采样和引导策略(例如温度缩放、D-CFG\(Sahoo et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib19)\))仅限于操纵令牌似然,而不考虑更广泛的语义景观。为了引发多样性,这些方法依赖于通过高温缩放实现的非语义分布平坦化,而不是在文本流形上导航。这从根本上限制了保真度-多样性的权衡,因为多样性是通过向概率质量函数注入随机噪声获得的,而非通过结构化的语义探索。 多样性通常被视为与质量相对的权衡,但我们认为,在复杂推理中,思维链(CoT)的多样性是稳健性的前提,而不仅仅是多样性的来源。之前的工作如 Self-Consistency\(Wang et al., 2022 (https://arxiv.org/html/2608.00024#bib.bib23)\) 和 Tree-of-Thoughts\(Yao et al., 2023 (https://arxiv.org/html/2608.00024#bib.bib24)\) 表明,生成多条不同的推理路径会增加恢复正确答案的概率。多样性防止模型的概率分布坍缩到单一且可能错误的思维链上。当探索被限制在一个狭窄的高似然令牌簇中时,模型可能强化其初始偏见,导致在错误推理上过早收敛。与此一致,我们的实证结果显示,多样性引导的思维链显著提高了复杂推理任务的通过率,验证了探索在确定性任务中的效用。 在本文中,我们研究离散、序列化设置下 DLM 的引导问题。给定一个训练好的扩散语言模型,我们引导采样以最大化任务成功率,同时保持跨令牌交互,保留多样性和语义有效性。我们的贡献有三方面。 - • 我们提出了一个通用的计算高效 *多样性引导* 框架,用于离散文本扩散。该框架通过整合序列级语义信息,克服了先前令牌独立假设的局限性。在此框架基础上,我们提出了 *语义感知核熵*(SAKE),这是一个可处理的、对序列语义多样性进行建模的目标,并显式最大化序列的 Rényi 熵。 - • 我们证明 SAKE 起到了 *自适应分布调制器* 的作用。与静态温度缩放不同,我们的方法动态调整生成概率:当模式坍缩时使分布平坦化以鼓励探索,当内在多样性已经很高时使其尖锐化以确保连贯性。 - • 在合成环境和标准 LLM 基准上的实证评估确认,与离散引导基线和基于温度的采样相比,我们的方法在质量和多样性之间实现了更优的权衡。值得注意的是,将 SAKE 应用于 LLaDA-8B-base 带来了显著的性能提升,改进了 HumanEval pass@32(\(41.1\rightarrow 55.8\))、MBPP pass@32(\(48.2\rightarrow 56.1\))和 GSM8K self-consistency(\(71.5\rightarrow 75.1\))。 ## 2 相关工作 ### 2.1 文本生成的扩散模型 早期的文本扩散在连续嵌入空间中运行\(Li et al., 2022 (https://arxiv.org/html/2608.00024#bib.bib16); Yuan et al., 2022 (https://arxiv.org/html/2608.00024#bib.bib17)\),但由于将去噪后的连续向量映射回连贯的离散令牌存在挑战,其性能与 AR 基线相比有限。为了解决嵌入瓶颈,近期研究转向直接在分类令牌空间上运行的离散扩散过程。基础工作 D3PM\(Austin et al., 2021 (https://arxiv.org/html/2608.00024#bib.bib18)\) 使用转移矩阵形式化了离散状态上的扩散,定义了均匀损坏或损坏为特定掩码令牌(吸收态)等噪声过程。在此基础上,现代扩散语言模型(DLMs)已经显著扩展\(Lou et al., 2023 (https://arxiv.org/html/2608.00024#bib.bib3); Sahoo et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib19); Ou et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib20); Nie et al., 2025 (https://arxiv.org/html/2608.00024#bib.bib21); Ye et al., 2025 (https://arxiv.org/html/2608.00024#bib.bib22)\),并证明 DLM 在困惑度和零样本生成方面能够匹配或超越 AR 模型,同时支持任意填充和迭代精炼。 ### 2.2 扩散模型的引导机制 基于连续分数的扩散模型\(Sohl-Dickstein et al., 2015 (https://arxiv.org/html/2608.00024#bib.bib11); Ho et al., 2020 (https://arxiv.org/html/2608.00024#bib.bib8); Song et al., 2020 (https://arxiv.org/html/2608.00024#bib.bib10); Song and Ermon, 2019 (https://arxiv.org/html/2608.00024#bib.bib9)\) 在各种生成任务中展现出卓越的能力,包括图像\(Rombach et al., 2022 (https://arxiv.org/html/2608.00024#bib.bib29); Dhariwal and Nichol, 2021 (https://arxiv.org/html/2608.00024#bib.bib4); Ho et al., 2022 (https://arxiv.org/html/2608.00024#bib.bib30)\) 和视频\(He et al., 2022 (https://arxiv.org/html/2608.00024#bib.bib31); Blattmann et al., 2023a (https://arxiv.org/html/2608.00024#bib.bib32), b (https://arxiv.org/html/2608.00024#bib.bib33)\)。条件生成通过引导实现,即在推理过程中修改学习到的得分函数\(Dhariwal and Nichol, 2021 (https://arxiv.org/html/2608.00024#bib.bib4); Nichol et al., 2021 (https://arxiv.org/html/2608.00024#bib.bib34); Bansal et al., 2023 (https://arxiv.org/html/2608.00024#bib.bib35); Ho and Salimans, 2022 (https://arxiv.org/html/2608.00024#bib.bib5); Corso et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib36); Askari Hemmat et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib37); Jalali et al., 2025a (https://arxiv.org/html/2608.00024#bib.bib28); Sani et al., 2026 (https://arxiv.org/html/2608.00024#bib.bib65); Jalali et al., 2026 (https://arxiv.org/html/2608.00024#bib.bib52)\)。如前所述,将这些技术转移到离散扩散在数学上并非易事。为了使引导可处理,Schiff et al. (2024 (https://arxiv.org/html/2608.00024#bib.bib1)) 提出了离散无分类器引导(D-CFG)和离散基于分类器的引导(D-CBG),它们依赖于令牌转移相互独立的假设。尽管这使归一化成本从指数级降低到与序列长度成线性关系,但独立性假设忽略了对于语义形成至关重要的跨令牌相关性。 ### 2.3 生成任务中的多样性 除了生成质量之外,多样性已成为研究社区中越来越关键的价值。人们提出了各种度量标准来量化图像\(Sajjadi et al., 2018 (https://arxiv.org/html/2608.00024#bib.bib39); Jalali et al., 2023 (https://arxiv.org/html/2608.00024#bib.bib6); Ospanov et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib53); Ospanov and Farnia, 2025 (https://arxiv.org/html/2608.00024#bib.bib60); Ospanov et al., 2025 (https://arxiv.org/html/2608.00024#bib.bib61)\) 和文本\(Zhu et al., 2025 (https://arxiv.org/html/2608.00024#bib.bib38)\) 领域的多样性。在自回归文本生成中,已经开发了几种超越温度缩放的方法来增强输出多样性\(Vijayakumar et al., 2016 (https://arxiv.org/html/2608.00024#bib.bib43); Holtzman et al., 2019 (https://arxiv.org/html/2608.00024#bib.bib44); Nguyen et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib45)\)。此外,基于熵的样本生成新颖性已在\(Zhang et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib62), 2025 (https://arxiv.org/html/2608.00024#bib.bib63); Lotfian et al., 2026 (https://arxiv.org/html/2608.00024#bib.bib68)\) 中被研究,相关工作中\(Hu et al., 2025a (https://arxiv.org/html/2608.00024#bib.bib56); Rezaei et al., 2025 (https://arxiv.org/html/2608.00024#bib.bib58); Hu et al., 2025b (https://arxiv.org/html/2608.00024#bib.bib57); Jafari and Farnia, 2026 (https://arxiv.org/html/2608.00024#bib.bib67); Nia and Farnia, 2026 (https://arxiv.org/html/2608.00024#bib.bib66)\) 研究了生成模型的在线多样性感知评估。嵌入在多样性评估中的作用和比较已在\(Stein et al., 2023 (https://arxiv.org/html/2608.00024#bib.bib69); Jalali et al., 2025b (https://arxiv.org/html/2608.00024#bib.bib54); Wu et al., 2025 (https://arxiv.org/html/2608.00024#bib.bib49); Gong et al., 2025 (https://arxiv.org/html/2608.00024#bib.bib55); Wu and Farnia, 2026 (https://arxiv.org/html/2608.00024#bib.bib50); Wu et al., 2026 (https://arxiv.org/html/2608.00024#bib.bib51)\) 中被分析。与此同时,扩散模型在图像生成中展现了出色的多样性控制能力,这得益于其灵活的推理机制。然而,尽管免训练引导技术已被证明对连续图像扩散有效\(Sadat et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib41); Corso et al., 2024 (https://arxiv.org/html/2608.00024#bib.bib36); Kirchhof et al., 2025 (https://arxiv.org/html/2608.00024#bib.bib42); Jalali et al., 2025a (https://arxiv.org/html/2608.00024#bib.bib28)\),但在离散扩散模型中进行文本生成的多样性引导仍未被探索。 ## 3 预备知识 连续扩散生成模型。 扩散模型(DMs)\(Ho et al., 2020 (https://arxiv.org/html/2608.00024#bib.bib8); Song and Ermon, 2019 (https://arxiv.org/html/2608.00024#bib.bib9); Song et al., 2020 (https://arxiv.org/html/2608.00024#bib.bib10)\) 是一类生成模型,旨在通过逆转预定义的前向加噪过程\(Sohl-Dickstein et al., 2015 (https://arxiv.org/html/2608.00024#bib.bib11)\),从目标数据分布 \(p_{\text{data}}(\mathbf{x}_{0})\) 中采样。在前向扩散过程中,数据样本 \(\mathbf{x}_{0}\) 在连续时间区间 \(t\in[0,T]\) 上被高斯噪声逐步扰动。该过程在数学上描述为添加噪声以获得带噪状态 \(\mathbf{x}_{t}=\sqrt{\alpha_{t}}\mathbf{x}_{0}+\sqrt{1-\alpha_{t}}\boldsymbol{\epsilon}_{t}\),其中 \(\boldsymbol{\epsilon}_{t}\sim\mathcal{N}(\mathbf{0},\mathbf{I})\) 表示标准高斯噪声,\(\alpha_{t}\in[0,1]\) 是一个单调递减的调度,控制噪声水平。DMs\(Ho et al., 2020 (https://arxiv.org/html/2608.00024#bib.bib8)\) 训练一个神经网络 \(\boldsymbol{\epsilon}_{\theta}:\mathcal{X}\times[T]\mapsto\mathcal{X}\) 来预测每个时间步 \(t\) 的噪声 \(\boldsymbol{\epsilon}_{t}\)。该目标隐式地学习了边缘分布 \(p_{t}(\mathbf{x}_{t})\) 的得分函数\(Song and Ermon, 2019 (https://arxiv.org/html/2608.00024#bib.bib9); Song et al., 2020 (https://arxiv.org/htm

相似文章

Speculative Refinement: 一种混合自回归扩散解码策略及其在不同基准测试中的行为表现

arXiv cs.AI

介绍了 Speculative Refinement (SpecRef),一种无需训练的混合解码策略,它通过熵引导的选择性掩码,从自回归草稿中热启动掩码扩散语言模型。在六个基准测试上的评估表明,代码基准测试混淆了结构发现与逻辑正确性,识别出了一种精炼张力现象,并显示评估协议可能产生不同的模型排名。