大型语言模型能否捕捉训练数据中的多样性?

arXiv cs.CL 论文

摘要

本文通过比较生成输出与训练数据的熵来研究大型语言模型中的条件多样性差距,并提出一个信息论框架来度量和缓解这一差距。

arXiv:2609.02275v1 公告类型:新 摘要:大型语言模型被训练来建模文本上的条件分布,然而,它们是否捕捉了训练数据中存在的所有合理输出的多样性,仍然理解不足。我们通过信息论的视角研究这个问题,比较模型生成输出的条件熵与相应训练数据的条件熵。给定配对的输入-输出样本,我们使用条件熵及其基于冯·诺依曼熵的矩阵类比来度量超出条件输入解释的输出变异性,而无需同一提示的多个参考输出。在具有公开训练数据的LLM系列中,包括OLMo、Pythia和GPT-Neo,我们一致发现模型生成输出的条件熵低于其训练数据,这在不同模型规模、序列长度和解码策略中都成立。我们在语言建模之外也观察到类似的条件多样性差距,包括类条件ImageNet生成器和在MS-COCO上训练的文本条件模型。为了解决这个差距,我们提出了一种后处理校正机制,为每个输入生成多个输出,并通过矩阵熵投影重新加权它们,增加条件多样性的同时保持接近原始模型分布。我们证明了基于矩阵的条件熵泛函的凹性,这使得由此产生的熵约束投影成为一个凸优化问题,并开发了一个可扩展的镜像下降算法来实现它。我们的结果揭示了现代生成模型与其训练数据之间系统性的条件多样性差距,并提供了一个信息论框架来度量和缓解这一差距。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:52

# 大语言模型能否捕捉训练数据中的多样性?来源:https://arxiv.org/html/2609.02275

吴优琪††注:香港中文大学计算机科学与工程系, [email protected]
法赞·法尼亚††注:香港中文大学计算机科学与工程系, [email protected]

###### 摘要
大语言模型被训练来对文本的条件分布进行建模,然而它们是否能充分捕捉训练数据中所有合理输出的多样性,仍未被充分理解。我们通过信息论视角,比较模型生成输出与相应训练数据的*条件熵*来研究这个问题。给定配对的输入-输出样本,我们使用条件熵及其基于*冯·诺依曼熵*的矩阵类比,来衡量超出条件输入所能解释范围的输出变异性,而无需为同一提示提供多个参考输出。在训练数据可公开获取的LLM家族中,包括OLMo、Pythia和GPT-Neo,我们一致发现,无论模型规模、序列长度和解码策略如何,模型生成的输出都比其训练数据表现出更低的条件熵。我们还在语言建模之外观察到类似的条件多样性差距,包括在ImageNet上训练的类条件生成器和在MS-COCO上训练的文本条件模型。为了解决这一差距,我们提出了一种事后修正机制:为每个输入生成多个输出,并通过矩阵熵投影重新加权它们,在保持接近原始模型分布的同时增加条件多样性。我们证明了基于矩阵的条件熵泛函的凹性,这使得由此产生的熵约束投影成为一个凸优化问题,并开发了一种可扩展的镜像下降算法来实现它。我们的结果揭示了现代生成模型与其训练数据之间存在系统性的条件多样性差距,并提供了一个用于度量和缓解此差距的信息论框架。

## 1 引言
大语言模型越来越多地被用作条件分布模型:给定一个提示、指令、上下文或文档,它们不仅需要生成一个合理的补全,还需要从大量有效输出中进行采样。同样的观点也支撑着许多其他条件生成系统,包括文本到图像模型、图像描述系统以及类条件图像生成器[1](https://arxiv.org/html/2609.02275#bib.bib39)、[2](https://arxiv.org/html/2609.02275#bib.bib40)、[3](https://arxiv.org/html/2609.02275#bib.bib2)、[4](https://arxiv.org/html/2609.02275#bib.bib3)。在这些场景中,条件变量很少能决定唯一的输出。一个提示可能允许多种正确的表述、推理路径、详细程度或风格选择;一张图像可能对应多种忠实的描述;一个类别标签可能对应广泛的视觉实例。因此,一个核心问题是:现代条件生成模型能否捕捉数据分布所支持的全部输出范围?

大多数现有评估并未直接回答这个问题。标准的语言建模指标(如似然或困惑度)衡量的是平均预测拟合度,而许多生成基准测试则侧重于准确性、对齐性和语义一致性。对于图像和多模态生成,CLIPScore[5](https://arxiv.org/html/2609.02275#bib.bib8)、MAUVE[6](https://arxiv.org/html/2609.02275#bib.bib12)以及条件Fréchet型距离[7](https://arxiv.org/html/2609.02275#bib.bib11)等指标提供了比较生成样本和参考样本的宝贵工具。然而,一个模型即使在这些指标上表现良好,仍可能将其概率质量集中在有效输出的一个更窄的子集上。这对于LLM和提示引导的生成至关重要,因为其目标不仅仅是产生一个可接受的答案,而是要表征自然文本数据中存在的条件变异性。

直接测量*条件*输出变异性在统计上具有挑战性。在许多数据集中,我们观察到配对样本 (X, Y),其中 X 是条件变量,Y 是相应的输出,但我们没有针对完全相同的条件观察到多个人类输出。因此,通常无法为每个固定的提示单独估计条件熵。为此,我们通过配对的输入-输出样本来研究条件熵。在经典层面,香农条件熵衡量的是在观察到 X 后 Y 中剩余的不确定性。在核层面,我们使用基于对 (X, Y) 的乘积核构建的矩阵类比,并减去条件变量的熵。这提供了一种方法来衡量超出输入已解释的变异性之外的输出变异性,而无需为每个条件提供重复的参考输出。利用这一视角,我们发现现代生成模型中存在一致的条件输出范围差距。

在训练数据可公开访问的LLM家族中,包括OLMo[8](https://arxiv.org/html/2609.02275#bib.bib41)、Pythia[9](https://arxiv.org/html/2609.02275#bib.bib42)和GPT-Neo[10](https://arxiv.org/html/2609.02275#bib.bib43),我们通过实证评估发现,模型生成的续写比相应的训练数据表现出更低的条件熵。我们在文本之外也观察到相同的现象,包括在ImageNet上训练的类条件生成器和在MS-COCO上训练的文本条件图像模型。这些结果表明,该问题并非特定于某一种架构或训练方法。相反,条件生成模型似乎表征了其数据中存在的条件分布的一个缩减版本,因为它们的条件熵低估了训练数据的条件熵。

我们使用条件熵和基于矩阵的条件熵将这一现象形式化,这扩展了[11](https://arxiv.org/html/2609.02275#bib.bib1)中针对无条件生成模型的近期多样性偏差分析,将其应用于条件生成式AI和LLM模型。由此产生的分数比较了联合输入-输出分布的熵与输入边际分布的熵,从而分离出归因于条件输出规律的那部分变异性。这种表述对于LLM和通用条件生成系统来说是自然的,因为它直接评估配对样本,而不需要为每个提示提供多个真实响应。它还将经验测量问题与基于矩阵的量子熵泛函联系起来。

在技术层面,我们证明了所提出的基于矩阵的条件熵是联合输入-输出分布的一个凹泛函。这一结构性质有两个后果。它产生了类似于经典香农熵的经典行为的有限样本单调性和低估性质。更重要的是,基于矩阵的量子熵的凹性意味着,将生成的条件分布投影到更高条件熵区域可以被表述为一个凸优化问题。

在分析之后,我们为LLM和条件生成器提出了一种事后样本空间重加权方法。给定提示 x₁, ..., xₙ,我们为每个提示 xᵢ 生成并考虑多个输出 yᵢ,₁, ..., yᵢ,ₘ,并联合优化这些生成候选上的权重,以改善整体条件变异性。关键约束是分配给每个提示的总权重保持不变,因此输入边际被保留,只调整生成输出上的条件分布。然后投影找到最近的重加权经验分布,使其基于矩阵的条件熵超过目标水平。这样,该方法不会重新训练模型或合成新样本;相反,它检查模型是否已经生成了有效但权重不足的输出,并将概率质量重新分配到更广泛的条件经验分布上。

为了可扩展性,我们在单纯形的乘积上开发了一种高效的镜像下降实现,每个单纯形对应于从每个条件生成的候选输出。这将指数梯度重加权从无条件设置扩展到条件生成,同时精确地保留了提示边际。由于联合输入-输出特征空间是张量积空间,维度可能高得令人望而生畏,我们使用草图化的联合特征来实现该方法。对于有限维嵌入,我们使用Kronecker积特征的随机投影;对于平移不变核,我们使用乘积核的直接联合随机傅里叶特征。这些近似方法避免了显式构建完整的张量积表示,并将每次优化步骤的成本降低到依赖于草图维度而非原始乘积维度。

本文的贡献可总结如下:
- • 我们使用条件熵及其基于矩阵的对应物,将LLM和条件生成模型能否捕捉训练数据中全部有效输出范围的问题进行了形式化。
- • 我们实证表明,在训练数据可公开获取的LLM、类条件ImageNet生成器和MS-COCO生成器中,存在一致的条件输出范围差距。
- • 我们推导了所应用的基于矩阵的条件熵泛函的凹性和有限样本性质,并表明熵约束重加权可以表述为一个凸规划问题。
- • 我们开发了一种可扩展的、基于乘积单纯形镜像下降和草图化联合特征的事后重加权算法,用于调整条件输出分布。

## 2 预备知识
我们考虑一个条件生成问题,其中条件变量 X ∈ 𝒳,输出变量 Y ∈ 𝒴。数据分布记为 P_XY,具有边际分布 P_X 和条件分布 P_{Y|X}。一个条件生成模型指定了一个条件分布 Q_{Y|X},它与相同的输入边际分布一起诱导出联合模型分布 Q_XY = P_X Q_{Y|X}。

设 k_𝒳: 𝒳 × 𝒳 → ℝ 和 k_𝒴: 𝒴 × 𝒴 → ℝ 是正半定核。在本文中,我们使用归一化核,满足对所有 x ∈ 𝒳 和 y ∈ 𝒴,k_𝒳(x, x) = 1 和 k_𝒴(y, y) = 1。
¹ ¹ 任何核函数 k 可以通过将 k(z, z') 替换为 k̃(z, z') = k(z, z') / √[k(z, z) k(z', z')] 来归一化。

对于配对样本,我们使用乘积核 k_XY([x, y], [x', y']) = k_𝒳(x, x') ⋅ k_𝒴(y, y')。给定样本 (x₁, y₁), ..., (xₙ, yₙ),设 K_𝒳 和 K_𝒴 为相应的格拉姆矩阵。乘积核的格拉姆矩阵为 K_XY = K_𝒳 ⊙ K_𝒴,其中 ⊙ 表示哈达玛积。

对于一个迹为单位 Tr(A) = 1 的正半定矩阵 A,其冯·诺依曼熵定义为 H_vN(A) = −Tr(A log A)。
遵循[12](https://arxiv.org/html/2609.02275#bib.bib26)、[13](https://arxiv.org/html/2609.02275#bib.bib6)的基于矩阵的熵框架,我们通过联合输入-输出熵与输入熵之差来度量条件输出不确定性:
H_vN(Y|X; P̂ₙ) := H_vN( (1/n) K_XY ) − H_vN( (1/n) K_𝒳 ) 。

我们注意到,上述函数的指数等同于*条件 Vendi* 分数,该分数由 Jalali 等人引入并分析[13](https://arxiv.org/html/2609.02275#bib.bib6)。此量是条件熵的核类比:它衡量在考虑条件变量中已存在的熵之后,输出贡献的不确定性。

我们还使用二阶矩阵熵 H₂(A) = −log Tr(A²),它给出经验条件二阶熵如下:
H₂(Y|X; P̂ₙ) := H₂( (1/n) K_XY ) − H₂( (1/n) K_𝒳 ) = log ( ‖K_𝒳‖_F² / ‖K_XY‖_F² ),
其中 ‖⋅‖_F 表示弗罗贝尼乌斯范数。这个二阶版本作为冯·诺依曼熵的更简单计算对应物非常有用,如[13](https://arxiv.org/html/2609.02275#bib.bib6)中所表述并框架为*条件 RKE*分数。

总体算子定义和更多细节推迟到附录B[2](https://arxiv.org/html/2609.02275#A2)。

## 3 开放语言模型中的条件输出范围差距
我们首先评估开放语言模型是否匹配其训练数据的条件输出范围。我们专注于 OLMo、Pythia 和 GPT-Neo,因为它们的训练语料库是公开可获取或可重构的。每个样本表示为一个配对样本 (X, Y),其中 X 是长度为 lₚ ∈ {3,4,5} 个词元的前缀,Y 是相应的长度为 l_c ∈ {2,3,4} 个词元的续写。对于训练基线,Y 是语料库中观察到的续写;对于模型样本,Y 是使用贪心解码、核采样或祖先采样从相同前缀生成的。然后我们使用条件冯·诺依曼熵 (VNE)、条件二阶矩阵熵以及词汇 Distinct-2 和 Distinct-3 分数来比较配对的训练分布和模型分布。

在所有数值实验和表格中,我们报告指数形式 exp(H_vN) 和 exp(H₂),这样报告的值可以解释为在相应熵度量下,条件上可区分的有效输出数量。

表1报告了结果。差距定义为 Δ = Metric_train − Metric_model;因此,正值表明模型生成的续写比训练数据具有更小的条件测量输出范围。这种模式在所有三个模型家族和所有解码方法中都是一致的:报告的差距为正。词汇 Distinct-n 分数提供了一个补充的表面层面检查。它们在每个设置中也显示出正差距,最大的差距再次出现在贪心解码下。然而,Distinct-n 没有明确考虑条件前缀,只衡量生成续写中的 n-gram 变异。因此,我们将其用作支持性证据,而主要比较基于配对前缀-续写样本上的条件熵。

置信区间(通过五次独立评估计算)相对于观察到的差距较小,表明该效应是稳定的,而不是波动

相似文章

大型语言模型总是讲相同的故事吗?

arXiv cs.CL

本文研究大型语言模型是否能够生成多样化的故事。通过叙事相似性分析,作者发现,LLM生成的叙事彼此之间的相似度始终高于人类撰写的故事,而常见的缓解策略(如负面提示和温度缩放)未能解决这种同质化问题。

面向多样化科学假设搜索的大语言模型方法

Hugging Face Daily Papers

本文提出了一种受并行回火启发的进化框架,该框架利用多温度采样和信息交换,提高了大语言模型生成科学假设的多样性和质量,并在分子发现、方程发现和算法发现等领域中得到了验证。

解密语言模型的强化学习后训练

arXiv cs.LG

本文剖析了大型语言模型的强化学习后训练算法,探讨了基础模型分布、奖励信号粒度和提示多样性如何影响后训练结果。