语言模型受困于歧义诅咒
摘要
本文发现语言模型中存在歧义诅咒:下一个词分布越模糊,学习难度越大,这源于架构和学习方面的原因,并通过合成数据和真实数据进行了验证。
arXiv:2608.15448v1 Announce Type: new
摘要: 大型语言模型越来越多地依赖采样作为自身改进的驱动力,使其学习到的分布的保真度比以往任何时候都更为关键。然而,并非所有分布都同样容易学习。在这项工作中,我们发现了一种歧义诅咒:在大型语言模型中,更广泛地说,在所有产生离散概率分布的神经网络中,下一个词的分布越模糊,准确学习就越困难。通过广泛的理论分析,我们将这种诅咒追溯到架构和学习的根源。更模糊的分布需要更多的容量来存储,更大的嵌入来表示,更多的步骤来拟合,并且会放大词采样噪声。我们在具有受控地面真相的合成任务上验证了这些发现,并在真实数据训练的语言模型中观察到了相同的特征。我们的结果为大型语言模型的统计能力提供了新的视角,并为在何时信任其输出分布提供了一个实用框架。
查看缓存全文
缓存时间: 2026/08/18 10:09
# 语言模型受困于歧义诅咒
来源:https://arxiv.org/html/2608.15448
Hyun Dong Lee、Scott Linderman
单位:斯坦福大学
联系邮箱:{nzucchet, hdlee, scott.linderman}@stanford.edu
###### 摘要
大型语言模型越来越依赖采样作为其自我改进的驱动力,这使得其学习到的概率分布的准确性比以往更为关键。然而,并非所有分布都同样易于学习。在本研究中,我们发现了一种“歧义诅咒”:在大型语言模型中,更广泛地说,在所有产生离散概率分布的神经网络中,下一个词元的分布歧义性越高,其准确学习就越困难。通过广泛的理论分析,我们追溯了这种诅咒在架构和学习层面的根源。歧义性更高的分布需要更多容量来存储、更大的嵌入向量来表示、更多的优化步骤来拟合,并且会放大词元采样噪声。我们在具有可控真实值的合成任务上验证了这些发现,并在真实数据训练的语言模型中观察到相同的特征。我们的结果为大型语言模型的统计能力提供了一个新的视角,并提供了一个实用的框架来判断何时可以信任其输出分布。
### 1 引言
自回归语言模型一次生成一个词元,根据给定的前序词元采样条件分布[86, 5, 62, 93, 98, 75, 76, 10]。我们通常使用贪心解码策略将采样偏向最可能的词元[44, 42, 102, 16],但这种策略会产生有害影响。推理时缩放方法[88, 50, 100, 68]仅在模型将概率分散到多样化的后续选项(而不仅仅是概率最高的选项)时才成功[9, 90]。同样,在策略内强化学习后训练[71, 40]中,只能探索和强化模型实际采样的轨迹[106]。随着模型生成的合成数据[39, 23]和在线AI生成内容[95, 57]在训练语料库中所占份额越来越大,采样分布缺乏多样性可能导致问题在多代模型中累积,直到模型崩溃[87]。出于所有这些原因,学习到的分布需要经过良好校准,不仅要捕捉最可能的词元,还要捕捉完整的下一个词元分布。在存在多个合理后续选项的歧义场景中,这种必要性尤为迫切。
在本研究中,我们朝着理解神经网络(从而理解大型语言模型)建模这种不确定性能力迈出了一步。我们发现了一个新现象,即*歧义诅咒*:下一个词元的分布越歧义,学习就越困难。
本文其余部分致力于精确阐述这一观点,揭示其根源,并讨论其对大型语言模型的后果。我们的贡献如下:
- 我们识别并形式化了大型语言模型中的歧义诅咒。
- 我们将诅咒追溯到架构根源(第3节)——更歧义的分布需要更多容量存储和更大的嵌入表示;以及学习根源(第4节)——它们需要更多优化步骤来拟合并放大了词元采样的噪声。
- 我们通过实验验证了这种诅咒(第5节),在受控的合成环境中证实了我们的理论预测,表明在真实数据训练的语言模型中出现了相同的特征,并认为这些结果可扩展到更大的模型。
### 2 自回归语言建模作为上下文分类问题
大多数大型语言模型是仅解码器的Transformer[98, 75, 76, 10],它们学习自回归地预测下一个词元[86, 5, 62, 93]。在我们的分析中,我们将此过程视为上下文到词元的分类问题,并根据训练分布下下一个词元的歧义性来区分语言模型必须分类的众多上下文。本节介绍这一形式化框架,并为第3节和第4节中理论分析的简化玩具模型提供动机。
##### 从序列到分类。
自回归语言模型将序列x1:t的概率分解为条件分布的乘积,每个分布基于其前序上下文x1:t-1来预测xt,即:
pθ(x1:t) = ∏_{t'=1}^t pθ(xt' | x1:t'-1) (1)
其中θ是模型参数,pθ是其定义的分布。从机制上讲,pθ(xt | x1:t-1)是通过首先让基于Transformer的骨干网络将上下文x1:t-1映射到维度为h的嵌入et = fθ(x1:t-1),然后应用一个线性头W后接一个softmax来产生大小为d的词表上的分布来计算的:
pθ(xt=j | x1:t-1) = softmax(We_t)_j,其中 e_t = fθ(x1:t-1)。 (2)
从这个角度来看,下一个词元预测是一个分类问题:骨干网络产生上下文的表示,然后线性头通过多类逻辑回归预测下一个词元。训练通过平均最小化训练上下文上的真实分布与预测分布之间的交叉熵来联合拟合骨干网络和线性头。
##### 聚焦于线性头以实现分析的可处理性。
第3节和第4节单独研究这个最后的线性头,将骨干网络产生的上下文表示视为给定的。线性头在网络中扮演核心角色:它是唯一将嵌入映射到输出词表的组件,并调节所有流回骨干网络的梯度[36]。因此,单独研究它可以直接探究模型最直接负责拟合下一个词元分布的部分。在这方面,表示学习是一个重要但次要的问题。第5节将通过实验表明,类似的结果对于整个语言模型同样成立。
由于我们将最后一层视为逻辑回归,我们可以简化我们的符号:线性头接收n个上下文嵌入ei和对应的目标分布pi,必须学习将两者映射。我们研究当这些目标在歧义性上变化时,它是如何应对的。默认情况下,我们将嵌入视为独立同分布地从单位球体中采样。在第3.2节中,我们将转而询问最优嵌入在固定维度h下会是什么样子以及它们能实现什么;在该机制中,我们联合优化权重W和嵌入ei。
##### 通过支持集大小建模歧义性。
在自然语言中,上下文通常允许多个合理的后续选项:在“the cat sat on the”之后,合理的下一个词元包括“mat”、“floor”、“couch”等。我们通过为每个上下文i分配一个在随机支持集Si(大小为k)上均匀分布的真实分布pi来建模这种歧义性。上下文i后跟词元j的概率为:
p_{i,j} = 1/k if j ∈ S_i; 0 otherwise。 (3)
超参数k控制歧义程度:[1]我们使用“歧义”一词超出了其语言学含义[74],作为描述分布在许多词元上分散质量的术语。k=1对应于根据数据只有一个可能后续的上下文,而k>1意味着几个词元是等可能的。虽然下一个词元分布在实践中显然不是均匀的,但这个模型捕捉了关键直觉:将概率质量分散到更多词元上使得预测问题本质上更困难。在第5节实验中遇到的非均匀分布上,我们通过pi的有效支持集大小(定义为pi熵的指数)来衡量歧义性。它比原始支持集大小更稳健,因为极小的概率贡献也极小,并且它简化为我们在理论中研究的支持集上的均匀分布。该量在其他领域以不同名称出现,包括信息论中的困惑度[48]和统计力学中的多重性[84]。
### 3 歧义诅咒的架构根源
歧义诅咒部分根植于模型的架构特性。更准确地说,我们表明,随着它们变得更加歧义,下一个词元分布需要更多容量来以所需的准确性存储,并且需要更大的嵌入维度来被恰当表示。我们专注于使用线性模型获得关于为何如此的理论直觉。
**图 1:歧义诅咒的架构根源:歧义分布需要更多参数存储和更大嵌入表示。**
对第3节理论分析的示意性描述,描绘了网络容量(左)和所需嵌入维度(右)如何依赖于我们的歧义性度量,即真实分布下可能的下一个词元数量k(支持集大小)。容量与参数数量成正比,与k成反比,而所需嵌入维度与k成比例增长,当骨干网络不能产生任意嵌入时(现实的 vs. 理想的骨干网络),比例常数更大。容量预测在附录A.6中进行了经验验证。
#### 3.1 模型容量:歧义分布需要更多参数来存储
直观地,建模k个可能的后续选项就像同时解决k个不同的上下文到词元关联,这应该需要k倍的容量。我们现在证明这确实如此。
我们考虑公式2中的线性头模型,使用随机嵌入ei,并询问它能存储的依赖上下文的分布pi(如公式3所定义)的数量如何依赖于k。“存储”我们非正式地表示模型能够准确回忆的最大上下文数量;附录A.1给出了精确定义。这可以被视为一个联想记忆问题,与神经联想记忆的一系列工作相关联,历史上是Hopfield网络[45, 55, 77],近期则是语言模型[54, 35, 83, 7, 1, 107, 64]。
##### Hebbian模型。
遵循先前的工作[11, 65],我们研究一种类似Hebbian的构造,其中学习到的权重矩阵被近似为:
W = β ∑_{i=1}^n z_i e_i^T,其中 z_{i,j} = 1 - k/d if j ∈ S_i; -k/d otherwise。 (4)
这里,z_i是目标logits,它们被设计使得在支持集内和支持集外的词元之间的差异为1,并且它们对应的概率分布接近pi。我们可以将W视为近似在线梯度下降以最小化 ||z_i - W e_i||^2 的结果,学习率为β,假设嵌入近似正交。通过梯度下降最小化实际的交叉熵损失会产生不同的权重,具有更大的容量,因此这种分析只提供了容量的下界。然而,该界限是紧的:Hebbian模型捕捉了与在随机嵌入上使用Adam训练的线性头相同的关于k的缩放关系(附录A.6)。
##### 歧义性需要更多容量。
为了理解Hebbian模型在给定大小为h的嵌入ei时预测pi的程度,我们将其输出logits分解为信号项和噪声项:
l_i := W e_i = β (z_i e_i^T e_i [信号] + ∑_{j≠i} z_j (e_j^T e_i) [噪声])。 (5)
由于嵌入是单位向量,信号项具有固定的大小并精确地恢复z_i。噪声项来自嵌入之间的干扰。它具有零均值和每个分量的方差 σ² ≈ nk/(hd),在我们关注的 k ≪ d 的机制中。该方差随着模式数量n和支持集大小k的增加而增长:每个目标z_i影响k个输出坐标,因此随着歧义性增加,任何给定的预测方向会被更多的模式干扰。只要噪声小于信号,Hebbian模型应该能够存储所有n个模式。解出n得到容量缩放极限,这是我们发现的歧义诅咒的第一个根源:
**根源 1:容量 ∝ hd/k。** (6)
图1的左面板说明了这种缩放关系。相似文章
方言税:方言偏见在语言建模流程中的持续存在
本文研究了方言偏见如何在整个语言建模流程中持续存在和累积,从分词到推理,表明差异在每一步都被编码。
一个用于评估大语言模型在临床数据登记抽象中表现的歧义分类体系:一项多中心前瞻性研究
本研究开发了一个歧义分类体系,用于评估大语言模型在从未经处理的电子病历数据中进行临床数据登记抽象时的表现,发现LLM的准确性显著低于人工抽象者,并且随着任务歧义性的增加而下降。
评估大型语言模型中的中文歧义理解能力
本文介绍了基于潜在歧义理论的汉语歧义数据集CHA-Gen,并评估了多个LLM在歧义检测任务上的表现。研究发现,模型虽然面临挑战,但通过思维链提示有所改进,而指令调优则导致过度自信。
词汇规范化中的多语言诅咒
本文研究了词汇规范化中的多语言诅咒,发现同时在多种语言上训练单个模型会导致各语言准确率下降,而当语言以小组形式训练时性能最佳。
@rohanpaul_ai: 非常有趣的工作——语言模型不仅会在输出表面产生不良结果;它们还会经历内部状态…
讨论了一项研究,表明语言模型会展现出内部状态,这些状态携带了不确定性、策略性扭曲或不当服从的痕迹,而不仅仅是产生不良输出。