语言模型难以实现概念整合

arXiv cs.CL 论文

摘要

本文研究了大型语言模型中的 compartmentalization(概念隔离)现象,即模型未能跨同一概念的不同表示共享统计强度,导致样本效率和模型容量降低。作者在多语言和多格式场景中验证了这一现象,并表明合成平行数据无法完全解决此问题。

arXiv:2605.19284v1 公告类型:新论文 摘要:在大型语言模型(LLM)的训练数据中,相同的潜在概念通常以多种不同方式呈现:同一事实既出现在英语中也出现在斯瓦希里语中;许多函数既可以用 Python 也可以用 Haskell 表达;命题既可以用形式语言也可以用自然语言表达。我们证明,LLM 可能表现出 compartmentalization(概念隔离),即它们无法识别和共享统一概念的不同表示之间的统计强度。在最坏的情况下,LLM 只是为每个概念表示学习并行的内部表示,用冗余信息饱和模型容量,并随着这种表示数量的增加而降低样本效率。我们还表明,合成平行数据尽管自身容易被学习,却无法改善这一情况。在此框架下,我们发现对于小模型而言,早期多语言学习几乎完全被 compartmentalized。最后,我们研究的所有干预措施都表现出一种相变,其有效性取决于不同表示的数量,这表明语言建模目标可能仅以不一致的方式统一表示。
查看原文
查看缓存全文

缓存时间: 2026/05/20 08:24

# 语言模型面临隔离化挑战

代码: https://github.com/vinhowe/compartmentalization. 评估数据: https://doi.org/10.5281/zenodo.20171021
来源: https://arxiv.org/html/2605.19284

Thomas Vincent Howe, David Wingate
杨百翰大学计算机科学系,犹他州普罗沃市84602
th443@byu\.edu, wingated@cs\.byu\.edu

###### 摘要

在大型语言模型(LLM)使用的训练数据中,相同的潜在概念常常以多种不同的方式呈现:相同的事实出现在英语和斯瓦希里语中;许多函数可以用Python和Haskell表达;我们既可以用形式语言也可以用自然语言表达命题。我们证明LLM可能表现出**隔离化**(compartmentalization),即它们无法识别并共享统一概念的不同呈现之间的统计强度。在最坏的情况下,LLM只是学习每个概念呈现的并行内部表示,用冗余占满模型容量,并随着呈现数量的增加降低样本效率。我们还证明,即使合成并行数据本身容易被学习,它也无法改善这种情况。在此框架下,我们发现,对于小模型来说,早期的多语言学习几乎完全被隔离化。最后,我们研究的所有干预措施都表现出一个相变,其有效性取决于不同呈现的数量,这表明语言建模目标可能只是不一致地统一表示。

## 1 引言

语言模型从包含大量不同方式呈现的统一概念的数据中学习。相同的事实出现在英语和斯瓦希里语中;许多函数可以用Python和Haskell表达;我们既可以用形式语言也可以用自然语言表达命题。我们希望模型能够识别这些是相关的,而大型语言模型的许多成功表明它们通常能做到,至少在足够规模下是这样。但是前沿规模的语言模型以令人惊讶的方式失败。

- 在多语言环境下,Ifergan等人(2024 (https://arxiv.org/html/2605.19284#bib.bib8))表明,在7B规模下,语言模型在任何语言中知道的事实数量比多语言平均值多三倍以上,并且跨语言的任务性能并不意味着语言之间“相互学习”,即共享相似任务的表示。
- 类似地,Goldman等人(2025 (https://arxiv.org/html/2605.19284#bib.bib11))证明,非思考型前沿语言模型在回忆仅存在于单一语言中的维基百科事实时,始终无法在其他语言中成功。
- 在单一语言内,Calderon等人(2026 (https://arxiv.org/html/2605.19284#bib.bib9))发现,前沿语言模型可以在类似预训练的维基百科上下文中正确背诵许多事实,但在类似问答的上下文中却不行。在这些情况下,编码成功但检索失败——模型从功能上并不“知道”这些事实。
- 类似地,Berglund等人(2024 (https://arxiv.org/html/2605.19284#bib.bib10))引入了逆转诅咒,这是一个更知名且被广泛复现的前沿失败案例,其中LLM无法从事实关系“A是B”泛化到隐含但未演示的“B是A”。

图1:隔离化牺牲了样本效率和容量。1(a) (https://arxiv.org/html/2605.19284#S1.F1.sf1) 减缓的计算方式:在由基础c=1模型某个检查点达到的任意验证损失目标L(此处L=4.5)处,找到c=1和c=N各自跨越L时的迭代次数,并计算它们的比值。我们通过线性插值找到隔离化模型的交点。该示例在41.9M模型上,c=8时在L=4.5处读数为5.0×。1(b) (https://arxiv.org/html/2605.19284#S1.F1.sf2) 每个c隔间运行相对于c=1基线的减缓,针对41.9M模型,绘制在匹配的验证损失目标上。减缓随c在整个轨迹中增加。1(c) (https://arxiv.org/html/2605.19284#S1.F1.sf3) 六个模型规模(1.1M至0.98B参数)上最终验证损失随c的变化。最终验证损失也随c增加。

在理解这类失败时,我们从机器翻译领域汲取灵感,该领域长期以来一直将中间语言(interlingua)作为目标:一种多种语言共享的语义空间。Johnson等人(2017 (https://arxiv.org/html/2605.19284#bib.bib2))表明,共享编码器有时可以发现从未联合训练过的语言之间泛化的表示。那么,为什么有如此多的证据表明前沿模型通常学习语言特定(以及广泛上下文特定)的表示呢?

我们提出一个基于表示学习中的冗余性来理解这类失败的视角。具体来说,我们将**隔离化**定义为一个现象,其中模型将潜在数据生成过程的c种呈现视为部分或完全不同的,因此需要多达c个该结构的独立表示。隔离化的最坏情况是强意义上的冗余:相同的结构被独立学习,存储为单独的表示,彼此之间没有摊还。我们认为这至少有两个后果:

- **样本效率低下**。如果每个潜在相似的呈现都被视为一个独立的预测任务,那么每个呈现只能从自己的数据份额中受益。在最坏的情况下,如果某个呈现仅占数据的\(\varepsilon\),那么在该呈现下学习类似数量的结构可能需要\(1/\varepsilon\)倍的数据样本(假设没有容量限制)。
- **容量竞争**。冗余表示也会消耗有限的表示容量。在不承诺特定容量概念的情况下,我们假设完美的c倍冗余阻止了不同呈现之间的摊还,因此需要比模型更统一表示的单呈现下相同数据更多的容量。即使有更多数据,在容量受限的境况下,隔离化的模型可能更快达到饱和——也就是说,当在我们最坏情况呈现的留出样本上进行评估时,训练了\(1/\varepsilon\)倍样本的模型仍可能比仅在该呈现上训练的相同规模模型达到更高的平台。

我们的贡献在此框架内共有六个方面。

## 2 贡献

- 我们定义了一种数据增强方法,能够诱导语言模型中的隔离化,并证明在此构造下,语言模型在从1.1M到约1B参数的六个模型规模上付出了随c扩展的样本效率和容量代价。
- 我们提供了存在性证明,表明这些代价并非根本性的,我们使用两种不同的方法,每种方法都提供了SGD自身无法发现的统一解决方案:能够在隔间内预测而无需隔离化代价的模型。
- 我们发现,配对“翻译”数据尽管容易被模型学习,但直到一个依赖于c的相变(我们在1B参数规模上复制了该相变)才能减少隔离化——我们证明这可以通过权重衰减加速到更低的c。
- 我们展示了一个辅助的对比表示对齐目标具有类似的c依赖性;对于c=2,它在100万步中没有改善,但改善随c增长。
- 我们提出了一种针对训练于具有多种不同呈现的现有数据集上的模型的隔离化操作度量,并将其应用于多语言训练。
- 通过使用传记/问答数据集训练的模型,我们观察到编码相同数据的多种格式之间存在破坏性的容量竞争,以隔离化模型作为基线。

## 3 一种最坏情况隔离化模型

图2:每个隔间的结构量决定了隔离化的容量代价。所有运行使用14.7M基础模型,c=2;我们比较了第二个隔间数据的四种选择——英语(同质对照)、俄语、基于词频采样的噪声和均匀随机令牌噪声——与单隔间(c=1)基线进行比较。2(a) (https://arxiv.org/html/2605.19284#S3.F2.sf1) 每种条件下的英语侧验证损失。2(b) (https://arxiv.org/html/2605.19284#S3.F2.sf2) 每个c=2运行与c=1基线在匹配的英语验证损失上的减缓。当两个隔间都包含语言数据时,英语样本效率相对于基线达到平台,但使用噪声时,英语数据匹配基线样本效率。

为了系统地探索隔离化,我们首先提出一种简单的方法来创建c种统计相同数据的不同呈现。由于来自这些隔间的数据在统计上是相同的,在最好的情况下,模型理论上可以在这些隔间之间共享大量的表示和计算结构,但在最坏的情况下,它们会通过将它们视为c个独立任务来浪费建模能力。

为了在不受自然数据中鼓励表示共享的结构性线索(子词重叠、句法规律性、语义对应)影响的情况下研究隔离化,我们创建了一个具有c种呈现的最大程度隔离化模型,采用一种分词技巧¹。通过增加分词器词汇表V的基数c倍,得到一个具有cV个标记的分词器。然后,为了以呈现j编码数据,我们简单地将标记ID偏移jV。虽然这允许我们在每种呈现中编码任意比例的数据,但在我们的实验中我们假设均匀的c路分割。在这种构造中,隔离化的效果对每个隔间同样糟糕。我们以正常方式初始化更大的联合分词器,没有任何先验的共享结构。

我们通过在固定数据集上训练多个规模的小模型至收敛来解决样本效率和容量问题,每个规模下的令牌数比Chinchilla最优值多约6-5000倍(Hoffmann等人,2022 (https://arxiv.org/html/2605.19284#bib.bib3))。具体来说,我们在约1310亿个FineWeb令牌(Penedo等人,2024 (https://arxiv.org/html/2605.19284#bib.bib4))上训练GPT风格解码器(§A.1 (https://arxiv.org/html/2605.19284#A1.SS1)),即100万步,批大小2048,块大小64,以及我们由于计算约束可以在单个GPU上训练的模型大小(见表1 (https://arxiv.org/html/2605.19284#A1.T1))。我们以2e-5的学习率训练所有实验以避免过训练时的不稳定性,并且不使用权重衰减,我们发现这对完全隔离化的模型没有影响²。我们接受另一个限制:使用我们自己训练的16k分词器,打破了与现有模型的困惑度比较,以减轻将词汇表大小增加多达八倍的内存成本。

我们的实验结果如图1 (https://arxiv.org/html/2605.19284#S1.F1) 所示。减缓定义为与基线c=1模型相比,隔离化模型达到给定验证损失所需步数的倍数。支持我们对隔离化的描述,我们观察到样本效率相对于c=1的减缓随c增加而增加,并且验证损失随c增加而更高地达到平台,表明容量竞争。值得注意的是,由于计算约束,我们在约1B规模上训练的模型较少。

接下来我们提出两个与容量相关的

相似文章

分区、提示、聚合:语言模型中的统计自一致性

Hugging Face Daily Papers

本文提出了一个框架来测试LLM估计是否在不同子群体间遵循统计自一致性(全概率定理),发现了广泛的违反以及“宏观谬误”,即细粒度估计与人类数据的一致性更好。

推理大语言模型中的隐藏语言一致性现象

arXiv cs.CL

本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。

论词汇性在大语言模型中的持续影响

arXiv cs.CL

本文研究了词汇重叠(而非语义内容)如何影响跨层和跨架构的大语言模型表示,并证明即使在为语义相似性训练的模型中,这种词汇效应依然存在,导致下游任务性能下降。