混合模型能更好地预测哪些令牌?

Hugging Face Blog 论文

摘要

一项在令牌级别比较Olmo Hybrid和Olmo 3 Transformer的研究显示,混合模型能更好地预测有意义的令牌(如名词/动词),而Transformer模型则擅长从输入中复制令牌。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/25 17:10

混合模型在哪些 Token 上预测得更好?

来源:https://huggingface.co/blog/allenai/hybrid-token-prediction
返回文章列表 (https://huggingface.co/blog)

Kyle Wiggers 的头像 (https://huggingface.co/Ai2Comms)

  • 注意力机制 vs 循环机制,以及衡量差异 (https://huggingface.co/blog/allenai/hybrid-token-prediction#attention-versus-recurrence-and-measuring-the-difference)
  • 真实文本揭示的结果 (https://huggingface.co/blog/allenai/hybrid-token-prediction#what-real-text-shows)
  • 这对我们意味着什么 (https://huggingface.co/blog/allenai/hybrid-token-prediction#where-this-leaves-us)

📄**技术报告:**https://arxiv.org/abs/2606.20936

混合 Token 预测博客草稿也将发布到 Hugging Face - 图片-1 (https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/5-hA9oXDAmu9e__tV-FYM.png)

模型擅长预测哪些类型的 Token,又不擅长哪些?这个问题对于混合模型来说尤其引人入胜。混合模型是一种开始挑战标准 Transformer 的语言模型架构,我们正通过 Olmo Hybrid (https://allenai.org/blog/olmohybrid) 对其进行研究。

混合模型在标准基准上可以媲美甚至超越 Transformer,但这些概括性数字并未揭示混合模型相比 Transformer 具体有哪些优势。

为了揭示这些 Token 级别的行为,我们最近进行了实验,将我们自家最强的 7B Transformer 模型 Olmo 3 (https://allenai.org/blog/olmo3) 与混合模型 Olmo Hybrid 进行正面比较。具体来说,我们以细粒度方式比较了模型在不同类型 Token(即作为 LLM 输入的信息单元)上的预测差异。

由于 Olmo 3 和 Olmo Hybrid 在设计上尽可能保持一致——仅在架构上不同,数据、分词器和训练方案都高度匹配——因此两者预测的差异基本反映了架构本身的影响。在 Token 层面观察这些差异,使我们能够洞悉混合模型相对于 Transformer 的特定优势。

我们的研究结果 (https://arxiv.org/abs/2606.20936) 显示,混合模型在众多 Token 上确实具有优势,但并非全部。Olmo Hybrid 在承载意义的 Token(如名词、动词和形容词)上表现最强,在需要通过追踪上下文才能预测的 Token(如代词所指的人)上也表现出色。但是,混合模型在那些仅仅重复输入中出现过的 Token——即从更早位置逐字复制而来的词或短语——上几乎没有什么优势,因为答案就在那里等着被查找。而这正是 Transformer 的强项。

https://huggingface.co/blog/allenai/hybrid-token-prediction#attention-versus-recurrence-and-measuring-the-difference注意力机制 vs 循环机制,以及衡量差异

语言模型由多层重复的层堆叠而成,每一层都利用周围的 Token 来优化每个 Token 的表示。

Transformer 在每一层都使用注意力机制。模型可以同时直接利用之前的所有 Token,并权衡每个 Token 对当前预测的相关性。这使得注意力机制擅长精确回忆某个特定的早期 Token,即使该 Token 出现在输入中较远的位置。但缺点是,每个 Token 都需要与所有之前的 Token 进行比较,因此随着输入增长,注意力机制的成本急剧上升。此外,虽然注意力机制擅长回忆和聚合信息,但在表示随时间顺序演进的信息方面却较为吃力。

混合模型保留了几层注意力层,但将其余层替换为循环层。与注意力层不同,循环层从左到右读取 Token,并携带一个固定大小的记忆,每遇到一个新 Token 就将其融入记忆,这样处理每个 Token 的成本不随输入长度变化。这种记忆是压缩且有损的,因此循环层无法像注意力层那样回溯到某个确切的早期 Token。但它非常适合在模型读取 Token 时保持对变化内容的持续追踪,从而提供与注意力互补的优势。

为了隔离注意力和循环层的优势与劣势区域,我们向 Olmo 3 和 Olmo Hybrid 输入了多种文本段落:文章、维基百科条目、书籍和科学论文,以及诸如 Python、HTML 和 LaTeX 等结构化文本。我们根据每个模型在给定样本中根据之前的 Token 预测当前 Token 的能力来评分。

两个模型都看到了相同的早期 Token,并为每个可能的后续 Token 分配了概率。我们记录了它们赋予实际后续 Token 的概率。然后,通过计算损失差距(即两个模型之间损失值的差异),我们逐 Token 总结了两个模型的差异。正差距表示混合模型预测得更好,负差距表示 Transformer 预测得更好。

为了找出损失差距可能集中的地方,我们进行了多项分析。首先,我们将每个 Token 归入一个类别,并计算这些类别内的平均损失差距。由于原始平均值可能受到其他因素(如某个类别的罕见程度或 Token 在文本样本中的重复频率)的影响,我们通过回归分析对每个模式进行了复核,该回归在控制其他因素不变的情况下估计了类别自身的效果。

https://huggingface.co/blog/allenai/hybrid-token-prediction#what-real-text-shows真实文本揭示的结果

混合 Token 预测社交媒体文案 - 图片-2 (https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/jhU9qFfYhuKlt4BqOGyIh.png)

我们发现,Olmo Hybrid 在大多数类型的 Token 上损失低于 Olmo 3,但并非每个类型下降幅度相同。

在散文中,最明显的分界线是实义词(承载意义的名词、动词和形容词)与功能词(如“the”、“of”、“is”)之间的区别。混合模型预测实义词的能力优于 Transformer,损失差距约为 0.04,而功能词的损失差距接近 0.02。

特别是在实义词类别(如副词和形容词)中,混合模型的优势尤为突出,尽管某些功能词类别(如存在性词汇“there”)也显示出混合模型的明显优势。简而言之,混合模型在表达句子核心内容的词汇上优势最大,而在任何模型几乎都能凭借语法猜测到的语法词上优势最小。

相比之下,我们发现了一些特定上下文,其中混合模型相对于 Transformer 的优势消失了。第一个是闭合括号(而非开放括号),这一模式在语言、代码和标记语言的括号中都很稳健。为什么?因为已知注意力机制足以表示括号匹配,这暗示仅凭注意力机制就能完成闭合括号的预测。

混合 Token 预测社交媒体文案 - 图片-3 (https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/O_9IONHpoc8kd31TP1MnR.png)

混合模型优势几乎消失的第二种情况是,下一个 Token 仅仅是重复段落中已经出现的某个内容。我们通过查找重复的 n-gram 来发现这些情况:即那些完成一个序列的 Token 此前在同样段落中逐字出现过。重复序列越长,混合模型的领先优势就越小,直至接近零。

最后,受这些发现的启发,我们探索使用特定类型 Token 上的过滤损失作为评估指标,以便在预训练实验中更好地比较不同架构。我们使用了来自早期 Olmo Hybrid 工作 (https://example.com/) 的三个 1B 参数模型:一个 Transformer、一个混合模型,以及一个完全没有注意力的纯循环模型。

在非重复的承载意义的 Token 上,混合模型和纯循环模型超越了 Transformer,其中混合模型表现最佳。在重复 Token 上,纯循环模型——由于没有注意力来追溯副本——落后于混合模型和 Transformer。

因此,这些过滤后的 Token 损失揭示了架构之间不同的细粒度差异,包括复制能力以及实义词上的差异,这些差异在训练早期以其他方式是无法显现的。

https://huggingface.co/blog/allenai/hybrid-token-prediction#where-this-leaves-us这对我们意味着什么

混合 Token 预测社交媒体文案 - 图片-4 (https://cdn-uploads.huggingface.co/production/uploads/638e39b249de7ae552d977b5/6i5GcnfYp7U6KfYpsN3e2.png)

过滤后的 Token 损失在 1B 预训练期间揭示了架构差异。Transformer、混合模型和纯循环神经网络(RNN)在 WSD 退火检查点处的 Token 损失曲线。

这项工作带来了两点启示。

首先,单一的总体损失——模型在所有 Token 上的平均误差——过于粗糙,不足以比较 Transformer 和混合架构。仅对测试特定模型能力的 Token 进行损失评分,可以揭示关键差异。

其次,对于混合模型而言,我们发现了其在开放式类别 Token 上的特定优势,这可能与 RNN 层的状态跟踪能力有关。

作为下一步,我们将把这些发现应用到我们正在进行的混合建模工作中。我们相信,最好的混合架构将来自于逐 Token 地理解模型每个组件的长处。我们希望类似的研究能够帮助整个 AI 社区加深这种理解。

我们鼓励您阅读我们的完整报告 (https://arxiv.org/abs/2606.20936),探索 Olmo 3 (https://allenai.org/blog/olmo3),尝试 Olmo Hybrid (https://allenai.org/blog/olmohybrid),并深入研究它们相关的开放工件。

相似文章

在词元级别上比较Transformer和混合模型

Lobsters Hottest

本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。

Olmo Hybrid:从理论到实践再回到理论

arXiv cs.CL

本论文介绍了Olmo Hybrid,一个包含70亿参数的语言模型,结合了注意力机制和Gated DeltaNet递归层,相比纯Transformer架构展现出理论和实证优势。该工作表明混合模型具有更强的表达能力,在预训练中扩展效率更高,且性能优于可比的Transformer基线。