在词元级别上比较Transformer和混合模型

Lobsters Hottest 论文

摘要

本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。

<p><a href="https://lobste.rs/s/6c5c4j/comparing_transformers_hybrid_models_at">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/06/27 15:54

# 在 Token 级别比较 Transformer 和混合模型 来源:https://arxiv.org/html/2606.20936 Yanhong Li Allen Institute for AI yanhongl@allenai\.org &William Merrill Allen Institute for AI willm@allenai\.org ###### 摘要

混合语言模型结合了注意力和循环层,展现出良好前景:理论上,循环层改善了纯 Transformer 在状态跟踪方面的局限性;实证上,混合模型在损失和下游评估中可以超越纯 Transformer(Waleffe 等,2024 (https://arxiv.org/html/2606.20936#bib.bib26);Merrill 等,2026 (https://arxiv.org/html/2606.20936#bib.bib11))。然而,目前尚不清楚哪些数据或能力驱动了这些增益,以及这些增益在多大程度上反映了推动混合模型发展的理论优势。我们利用 Olmo 3(Olmo 等,2026 (https://arxiv.org/html/2606.20936#bib.bib10))和 Olmo Hybrid(Merrill 等,2026 (https://arxiv.org/html/2606.20936#bib.bib11))的开放权重来解决这个问题:我们比较了在相同前缀下,匹配的 Transformer 和混合模型在相同目标 Token 上的损失,并按自然 Token 标签、复制特征、分隔符结构和受控合成探针来分层统计结果。混合模型在大多数标签族中损失较低,但增益并不均匀:在开放类实词上增益最大,而在许多封闭类功能词上增益较小。在散文、代码和标记语言中,混合模型在开始分隔符上的损失优势大于对应的结束分隔符,并且在重复的 n-gram 上几乎消失。合成探针显示了相同的分化:混合模型在代词记忆和实体跟踪任务上表现出优势,而 Transformer 在需要选择结束分隔符的括号匹配任务上表现更优。这些模式表明,混合模型中的循环层改善了利用文档语义状态的预测,而注意力则有助于那些可以通过 n-gram 复制或句法括号匹配预测的 Token。最后,我们通过概念验证的过滤评估展示了 Token 级别的分解如何能够增强混合架构的预训练诊断。

## 1 引言

混合语言模型——结合了注意力与循环序列层的模型——近期挑战了纯注意力 Transformer 作为大规模语言建模默认架构的地位。从理论上讲,混合模型由注意力和循环层的互补表达能力驱动:注意力允许从过去 Token 中检索信息,这对复制和括号匹配等句法任务有用;而循环层在构建和更新有序状态跟踪计算中的潜在状态方面具有优势(Merrill 等,2024 (https://arxiv.org/html/2606.20936#bib.bib21);Grazzi 等,2025 (https://arxiv.org/html/2606.20936#bib.bib7))。从理论上讲,混合模型继承了这两种优势,并且实证上,它们可以在相同的预训练预算下,在损失和下游基准测试中超越 Transformer(Waleffe 等,2024 (https://arxiv.org/html/2606.20936#bib.bib26);Merrill 等,2026 (https://arxiv.org/html/2606.20936#bib.bib11))。虽然这些实证结果令人印象深刻,但尚不清楚添加混合层究竟改善了哪些细粒度的预测,或者这些改善与混合模型的理论优势有多大关联。因此,在本工作中,我们旨在理解 Transformer 和混合模型之间在*Token 级别*上的细粒度预测差异,提出以下两个问题:

1. 1.*混合模型在哪类 Token 和预测上下文中比 Transformer 预测得更好?*更具体地说,哪些单独的 Token 出现导致了混合模型相对于匹配 Transformer 的平均损失更低?
2. 2.*这些 Token 出现是否与各组件架构的理论优势相匹配?*更具体地说,混合模型偏好的 Token 是否看起来与循环相关的表达能力优势(如有序状态跟踪)一致,而 Transformer 偏好的 Token 是否看起来与注意力相关的优势(如从可见前缀中回忆信息)一致?

我们通过比较同一配方家族中两个已发布的 7B 规模模型——Olmo 3 7B 和 Olmo Hybrid 7B——来研究这些问题(Olmo 等,2026 (https://arxiv.org/html/2606.20936#bib.bib10);Merrill 等,2026 (https://arxiv.org/html/2606.20936#bib.bib11))。对于目标位置 \(i\),使用前缀 \(x_{<i}\),我们计算 \(\Delta_i = \text{NLL}_{\text{transformer}}(x_i \mid x_{<i}) - \text{NLL}_{\text{hybrid}}(x_i \mid x_{<i})\)。因此 \(\Delta_i > 0\) 意味着混合模型在相同前缀下为观察到的下一个 Token 分配了更高的概率,即更低的 NLL。这个成对量让我们从“哪个模型损失更低?”的平均问题转向“哪些预测事件产生了增益?”的 Token 级别问题。

我们的第一个分析是观察性的。我们计算散文、代码和标记语言中的 \(\Delta_i\),然后将目标 Token 与表面标签对齐:散文的词性标签,以及结构化文本的源级类别,如标识符、字符串、注释、文本节点、属性、命令、括号和标签。我们报告原始的分层标签均值,这些均值描述了混合模型在真实语料库位置上的绝对优势,以及回归稳健性检查,这些检查问的是在控制难度、频率、位置、子词状态和局部复用后,相同的模式是否仍然存在。回归分析与原始摘要互补:它询问的是在控制难度、频率、位置、子词状态和局部复用后,标签级别的模式是否仍然存在。

自然 Token 结果是非均匀的。混合模型在大多数 Token 族上损失较低,但优势在开放类实词类别上最大。在散文中,实词的原始差距大于功能词,并且在控制变量后,实词-功能词的对比仍然显著。在结构化领域,混合模型偏好的类别包括标识符、字符串、注释、文本节点、属性值和命令。相反,混合模型在结束分隔符和刚性格式 Token 上的优势较小,并且在长重复 n-gram 上趋近于零。因此,尽管混合模型总体上获胜——尤其是在实词上——但 Transformer 在注意力是重要原语的上下文中仍然具有竞争力,有时甚至更受青睐:从已经存在于可见前缀中的材料中检索信息,或满足已开放的结构义务。

我们的第二个分析使用受控合成探针将延迟信息与目标所需的计算类型区分开来。在代词记忆探针中,模型看到带有角色的人物,随后必须选择查询角色对应人物的代词。在实体跟踪探针中,模型看到绑定到属性的实体,随后必须选择哪个实体具有查询的属性。在结构闭合探针中,模型看到已经打开的括号或标签区域,随后必须预测所需的闭合 Token。前两个探针需要读取维护的角色或实体-属性绑定,并有利于混合模型。闭合探针也涉及延迟信息,但答案已经由前缀中可见的开启符决定,并且有利于 Transformer。因此,相关的区别不仅仅是短依赖与长依赖,而是目标主要是状态条件选择、可见前缀复制还是闭合决策。

这些结果指出了 Token 级别分析的两种不同后续用途。第一种是用于设计受控状态跟踪基准。现有的状态跟踪任务通常要求模型根据一系列指令更新一小套固定符号,然后报告最终的符号或值。这类封闭世界任务很有用,因为它们隔离了有序更新和读取,但一旦架构解决了固定槽位设置,它们在区分未来的循环层方面就变得不那么有信息量了。我们的结果提出了一个更具挑战性的开放世界扩展:篇章状态跟踪。在这些任务中,输入可以随时间引入新的人物、对象、变量或文档区域,改变它们的属性或关系,并在之后要求一个上下文相关的预测,例如接下来应该出现哪个实体、值或实词。这种框架保持了与状态跟踪的联系,同时从固定符号槽转移到自然文本、代码和标记语言所需的、不断增长的关系状态。因此,受控的篇章状态跟踪任务将为开发线性 RNN 和混合序列层提供一个更具挑战性的测试平台。

第二种用途是在预训练实验期间比较不同的架构。在比较 Transformer、Hybrid 和纯 RNN 的 1B 规模开发运行中,聚合验证损失将不同的机制压缩成一个数字。过滤后的 Token 损失可能是在这种情况下比较和对比架构的有用方式:混合模型偏好的非复制 Token 上的损失能够更清晰地分离不同架构,而仅复制过滤器则揭示了注意力模型在可见前缀复用上优于纯 RNN 的互补机制。由于这些过滤器是从与标准验证相同的每个 Token NLL 计算得出的,它们增加的额外开销很小,同时提供了对训练进展更具能力分辨率的视角。因此,将过滤后的 Token 损失与聚合验证损失一起报告,不仅可以显示设计是否提高了整体困惑度,还可以显示它改善或牺牲了哪些预测能力。

## 2 表达能力背景与实证假设

表达能力理论提供了一种有用的方法,来区分可以隐藏在下一次 Token 预测内部的不同计算。我们按架构原语来组织背景:注意力、循环以及它们在混合模型中的组合。

**Transformer 表达能力:复制/回忆与结构匹配。** 注意力为 Transformer 提供了一种选择可见前缀中位置的直接机制。在标准形式化下,这让 Transformer 能够表达回忆风格的计算,如 n-gram 检索,并且通过使相关较早位置或开启符可访问,它还支持许多括号匹配或结构匹配问题(Weiss 等,2021 (https://arxiv.org/html/2606.20936#bib.bib32);Yao 等,2023 (https://arxiv.org/html/2606.20936#bib.bib31))。因此,当下一个 Token 可以通过复用已可见的材料或匹配显式的结构开启符来恢复时,注意力应该特别有用:

1. (1) John works for the National Hamburger Association of America. The National Hamburger Association of America...
2. (2) \( [ ] [ \{ ( ) \} ] \). 

第一个例子要求从可见前缀中复制/回忆,而第二个例子要求与可见的开启符进行结构匹配。相反,复制/回忆是具有有界状态的纯循环模型的已知局限性:复制或回忆任意前缀信息可能需要存储比固定大小的循环状态能够保留的更多信息(Arora 等,2024 (https://arxiv.org/html/2606.20936#bib.bib23);Jelassi 等,2024 (https://arxiv.org/html/2606.20936#bib.bib9);Merrill 等,2026 (https://arxiv.org/html/2606.20936#bib.bib11))。

**RNN 表达能力:有序状态跟踪。** 固定深度 Transformer 的互补局限性是有序状态组合。在标准的固定深度和对数精度假设下,Transformer 的下一 Token 预测器被包含在低深度阈值电路类中,如 \(\mathsf{TC}^0\);因此,除非 \(\mathsf{TC}^0 = \mathsf{NC}^1\),否则它们无法表达一般的 \(\mathsf{NC}^1\)-完全的有序状态组合问题(Merrill and Sabharwal, 2023 (https://arxiv.org/html/2606.20936#bib.bib3);Chiang, 2025 (https://arxiv.org/html/2606.20936#bib.bib5))。相比之下,具有足够表达能力的转移矩阵(包括具有负特征值的 DeltaNet/GDN 变体)的现代线性 RNN 可以表达此类状态跟踪计算(Merrill 等,2024 (https://arxiv.org/html/2606.20936#bib.bib21);Grazzi 等,2025 (https://arxiv.org/html/2606.20936#bib.bib7);Merrill 等,2026 (https://arxiv.org/html/2606.20936#bib.bib11))。这些结果激发了互补假设:需要有序状态更新的预测应该更有利于具有循环层的模型,而不是纯 Transformer。一个简单的程序状态示例是:

1. (3) a,b,c = 1,2,3; a,c = c,a; assert a == 3.

**混合模型表达能力:将回忆与状态相结合。** 混合模型结合了支持从可见前缀中回忆的注意力层和支持有序状态更新的循环层。这种组合应该使它们能够处理像第 1、2 和 3 项那样的上下文,在这些上下文中,纯 RNN 或纯 Transformer 缺少其中一个相关的原语。此外,混合模型不仅仅是两种独立能力的并集:Merrill 等人(2026)表明,GDN-注意力混合模型可以解决*基于状态的回忆*问题——模型必须跟踪指针的更新,然后使用结果指针从前缀中检索一个值——而纯 Transformer 或纯 GDN 模型在标准假设下都无法表达整个问题。一个类似代码的示例是:

1. (4) bits = [0,1,0,0,...]; a,b,c = 3,1,2; a,c = c,a; assert bits[a] == 0.

这种表达能力图景为本文的其余部分提供了实证假设。下一 Token 预测并非单一的同质计算:我们将每个前缀视为引发一个潜在的篇章/程序状态,并将每个目标 Token 视为对该状态某方面的查询或更新。一些目标可以从可见前缀中恢复;另一些则需要有序状态构建和状态条件读取;还有一些则同时组合了这两者。因此,我们预期注意力密集型的 Transformer 在可见前缀复用和结构闭合上具有竞争力,循环层有助于状态条件的预测,而混合模型则在自然语言、代码或标记语言需要两者兼具时最强。本文的其余部分将检验这些机制在自然语言、代码和标记语言的普通下一 Token 预测中出现在何处。

## 3 实证方法

我们询问哪些*单个的下一 Token 预测*导致了混合模型与匹配 Transformer 之间的损失差距。分析的基本单元是一个目标位置。对于打包的 Token 序列 \(x_{1:L}\) 和目标位置 \(i\),两个模型都在相同的前缀 \(x_{<i}\) 上进行评估。我们计算 \(\Delta_i = \text{NLL}_{\text{transformer}}(x_i \mid x_{<i}) - \text{NLL}_{\text{hybrid}}(x_i \mid x_{<i})\)。因此 \(\Delta_i > 0\) 意味着在位置 \(i\),混合模型对观察到的下一个 Token 分配了比 Transformer 更高的概率。本节中所有自然 Token 分析都聚合了这些逐位置的数量。

**模型、领域与评估。** 我们比较同一配方家族中两个已发布的 7B 规模模型:Olmo 3 7B 和 Olmo Hybrid 7B(Olmo 等,2026;Merrill 等,2026)。这一对模型在分词器、数据混合和训练配方上紧密匹配,使得每个 Token 的差距主要反映了架构差异(序列混合器)。我们在散文和结构化文本上进行评估,涵盖自然语言、代码和标记语言(散文:PG-19、新闻、维基百科、论文、教科书和科学论文;结构化:Python、HTML、LaTeX)。文本被打包成长度 \(L = 8192\) 的序列,我们在每个位置计算下一 Token 的 NLL。除非另有说明,所有 7B 级别的 Token 和合成分析都使用最终发布的检查点对。关于额外预处理和检查点细节,请参见附录 A (https://arxiv.org/html/2606.20936#)。

相似文章

混合模型能更好地预测哪些令牌?

Hugging Face Blog

一项在令牌级别比较Olmo Hybrid和Olmo 3 Transformer的研究显示,混合模型能更好地预测有意义的令牌(如名词/动词),而Transformer模型则擅长从输入中复制令牌。

Olmo Hybrid:从理论到实践再回到理论

arXiv cs.CL

本论文介绍了Olmo Hybrid,一个包含70亿参数的语言模型,结合了注意力机制和Gated DeltaNet递归层,相比纯Transformer架构展现出理论和实证优势。该工作表明混合模型具有更强的表达能力,在预训练中扩展效率更高,且性能优于可比的Transformer基线。

状态预测分离假说

Hugging Face Daily Papers

本文提出了状态预测分离假说,认为在Transformer中将状态预测与令牌预测分离,能在不同规模上提升语言建模的性能和效率,实验表明该方法持续带来改进。

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。