混合模型能更好地预测哪些令牌?
摘要
一项在令牌级别比较Olmo Hybrid和Olmo 3 Transformer的研究显示,混合模型能更好地预测有意义的令牌(如名词/动词),而Transformer模型则擅长从输入中复制令牌。
查看缓存全文
缓存时间: 2026/06/25 17:10
混合模型在哪些 Token 上预测得更好?
来源:https://huggingface.co/blog/allenai/hybrid-token-prediction
返回文章列表 (https://huggingface.co/blog)
Kyle Wiggers 的头像 (https://huggingface.co/Ai2Comms)
- 注意力机制 vs 循环机制,以及衡量差异 (https://huggingface.co/blog/allenai/hybrid-token-prediction#attention-versus-recurrence-and-measuring-the-difference)
- 真实文本揭示的结果 (https://huggingface.co/blog/allenai/hybrid-token-prediction#what-real-text-shows)
- 这对我们意味着什么 (https://huggingface.co/blog/allenai/hybrid-token-prediction#where-this-leaves-us)
📄**技术报告:**https://arxiv.org/abs/2606.20936
混合 Token 预测博客草稿也将发布到 Hugging Face - 图片-1 (https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/5-hA9oXDAmu9e__tV-FYM.png)
模型擅长预测哪些类型的 Token,又不擅长哪些?这个问题对于混合模型来说尤其引人入胜。混合模型是一种开始挑战标准 Transformer 的语言模型架构,我们正通过 Olmo Hybrid (https://allenai.org/blog/olmohybrid) 对其进行研究。
混合模型在标准基准上可以媲美甚至超越 Transformer,但这些概括性数字并未揭示混合模型相比 Transformer 具体有哪些优势。
为了揭示这些 Token 级别的行为,我们最近进行了实验,将我们自家最强的 7B Transformer 模型 Olmo 3 (https://allenai.org/blog/olmo3) 与混合模型 Olmo Hybrid 进行正面比较。具体来说,我们以细粒度方式比较了模型在不同类型 Token(即作为 LLM 输入的信息单元)上的预测差异。
由于 Olmo 3 和 Olmo Hybrid 在设计上尽可能保持一致——仅在架构上不同,数据、分词器和训练方案都高度匹配——因此两者预测的差异基本反映了架构本身的影响。在 Token 层面观察这些差异,使我们能够洞悉混合模型相对于 Transformer 的特定优势。
我们的研究结果 (https://arxiv.org/abs/2606.20936) 显示,混合模型在众多 Token 上确实具有优势,但并非全部。Olmo Hybrid 在承载意义的 Token(如名词、动词和形容词)上表现最强,在需要通过追踪上下文才能预测的 Token(如代词所指的人)上也表现出色。但是,混合模型在那些仅仅重复输入中出现过的 Token——即从更早位置逐字复制而来的词或短语——上几乎没有什么优势,因为答案就在那里等着被查找。而这正是 Transformer 的强项。
https://huggingface.co/blog/allenai/hybrid-token-prediction#attention-versus-recurrence-and-measuring-the-difference注意力机制 vs 循环机制,以及衡量差异
语言模型由多层重复的层堆叠而成,每一层都利用周围的 Token 来优化每个 Token 的表示。
Transformer 在每一层都使用注意力机制。模型可以同时直接利用之前的所有 Token,并权衡每个 Token 对当前预测的相关性。这使得注意力机制擅长精确回忆某个特定的早期 Token,即使该 Token 出现在输入中较远的位置。但缺点是,每个 Token 都需要与所有之前的 Token 进行比较,因此随着输入增长,注意力机制的成本急剧上升。此外,虽然注意力机制擅长回忆和聚合信息,但在表示随时间顺序演进的信息方面却较为吃力。
混合模型保留了几层注意力层,但将其余层替换为循环层。与注意力层不同,循环层从左到右读取 Token,并携带一个固定大小的记忆,每遇到一个新 Token 就将其融入记忆,这样处理每个 Token 的成本不随输入长度变化。这种记忆是压缩且有损的,因此循环层无法像注意力层那样回溯到某个确切的早期 Token。但它非常适合在模型读取 Token 时保持对变化内容的持续追踪,从而提供与注意力互补的优势。
为了隔离注意力和循环层的优势与劣势区域,我们向 Olmo 3 和 Olmo Hybrid 输入了多种文本段落:文章、维基百科条目、书籍和科学论文,以及诸如 Python、HTML 和 LaTeX 等结构化文本。我们根据每个模型在给定样本中根据之前的 Token 预测当前 Token 的能力来评分。
两个模型都看到了相同的早期 Token,并为每个可能的后续 Token 分配了概率。我们记录了它们赋予实际后续 Token 的概率。然后,通过计算损失差距(即两个模型之间损失值的差异),我们逐 Token 总结了两个模型的差异。正差距表示混合模型预测得更好,负差距表示 Transformer 预测得更好。
为了找出损失差距可能集中的地方,我们进行了多项分析。首先,我们将每个 Token 归入一个类别,并计算这些类别内的平均损失差距。由于原始平均值可能受到其他因素(如某个类别的罕见程度或 Token 在文本样本中的重复频率)的影响,我们通过回归分析对每个模式进行了复核,该回归在控制其他因素不变的情况下估计了类别自身的效果。
https://huggingface.co/blog/allenai/hybrid-token-prediction#what-real-text-shows真实文本揭示的结果
混合 Token 预测社交媒体文案 - 图片-2 (https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/jhU9qFfYhuKlt4BqOGyIh.png)
我们发现,Olmo Hybrid 在大多数类型的 Token 上损失低于 Olmo 3,但并非每个类型下降幅度相同。
在散文中,最明显的分界线是实义词(承载意义的名词、动词和形容词)与功能词(如“the”、“of”、“is”)之间的区别。混合模型预测实义词的能力优于 Transformer,损失差距约为 0.04,而功能词的损失差距接近 0.02。
特别是在实义词类别(如副词和形容词)中,混合模型的优势尤为突出,尽管某些功能词类别(如存在性词汇“there”)也显示出混合模型的明显优势。简而言之,混合模型在表达句子核心内容的词汇上优势最大,而在任何模型几乎都能凭借语法猜测到的语法词上优势最小。
相比之下,我们发现了一些特定上下文,其中混合模型相对于 Transformer 的优势消失了。第一个是闭合括号(而非开放括号),这一模式在语言、代码和标记语言的括号中都很稳健。为什么?因为已知注意力机制足以表示括号匹配,这暗示仅凭注意力机制就能完成闭合括号的预测。
混合 Token 预测社交媒体文案 - 图片-3 (https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/O_9IONHpoc8kd31TP1MnR.png)
混合模型优势几乎消失的第二种情况是,下一个 Token 仅仅是重复段落中已经出现的某个内容。我们通过查找重复的 n-gram 来发现这些情况:即那些完成一个序列的 Token 此前在同样段落中逐字出现过。重复序列越长,混合模型的领先优势就越小,直至接近零。
最后,受这些发现的启发,我们探索使用特定类型 Token 上的过滤损失作为评估指标,以便在预训练实验中更好地比较不同架构。我们使用了来自早期 Olmo Hybrid 工作 (https://example.com/) 的三个 1B 参数模型:一个 Transformer、一个混合模型,以及一个完全没有注意力的纯循环模型。
在非重复的承载意义的 Token 上,混合模型和纯循环模型超越了 Transformer,其中混合模型表现最佳。在重复 Token 上,纯循环模型——由于没有注意力来追溯副本——落后于混合模型和 Transformer。
因此,这些过滤后的 Token 损失揭示了架构之间不同的细粒度差异,包括复制能力以及实义词上的差异,这些差异在训练早期以其他方式是无法显现的。
https://huggingface.co/blog/allenai/hybrid-token-prediction#where-this-leaves-us这对我们意味着什么
混合 Token 预测社交媒体文案 - 图片-4 (https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/6i5GcnfYp7U6KfYpsN3e2.png)
过滤后的 Token 损失在 1B 预训练期间揭示了架构差异。Transformer、混合模型和纯循环神经网络(RNN)在 WSD 退火检查点处的 Token 损失曲线。
这项工作带来了两点启示。
首先,单一的总体损失——模型在所有 Token 上的平均误差——过于粗糙,不足以比较 Transformer 和混合架构。仅对测试特定模型能力的 Token 进行损失评分,可以揭示关键差异。
其次,对于混合模型而言,我们发现了其在开放式类别 Token 上的特定优势,这可能与 RNN 层的状态跟踪能力有关。
作为下一步,我们将把这些发现应用到我们正在进行的混合建模工作中。我们相信,最好的混合架构将来自于逐 Token 地理解模型每个组件的长处。我们希望类似的研究能够帮助整个 AI 社区加深这种理解。
我们鼓励您阅读我们的完整报告 (https://arxiv.org/abs/2606.20936),探索 Olmo 3 (https://allenai.org/blog/olmo3),尝试 Olmo Hybrid (https://allenai.org/blog/olmohybrid),并深入研究它们相关的开放工件。
相似文章
在词元级别上比较Transformer和混合模型
本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。
@_albertgu:Transformer 更擅长复制,而 RNN 更擅长建模“承载意义的词——名词、动词和形容词……”
来自 Ai2 的一篇讨论比较了 transformer(Olmo 3)和混合模型(Olmo Hybrid),发现 transformer 在复制方面表现出色,而 RNN 在建模承载意义的词汇上更胜一筹,凸显了混合架构日益增长的可行性。
Olmo Hybrid:从理论到实践再回到理论
本论文介绍了Olmo Hybrid,一个包含70亿参数的语言模型,结合了注意力机制和Gated DeltaNet递归层,相比纯Transformer架构展现出理论和实证优势。该工作表明混合模型具有更强的表达能力,在预训练中扩展效率更高,且性能优于可比的Transformer基线。
当分词与语言建模联合优化时,会学习到哪些词元?
本文研究了当分词与语言建模联合优化时所学习到的词元,比较了跨多种语言的无分词器方法,发现它们为自然语言处理生成了独特而高效的词汇表。
现代 Transformer 是隐式的混合体:从功能分化到原则性混合架构设计
本文提出了基于干预的指标,以区分 RoPE Transformer 中的检索头和位置头,从而推导出一种原则性混合架构 (HwH),该架构结合了全注意力和线性注意力,以改善语言建模和长上下文外推。