Olmo Hybrid:从理论到实践再回到理论

arXiv cs.CL 论文

摘要

本论文介绍了Olmo Hybrid,一个包含70亿参数的语言模型,结合了注意力机制和Gated DeltaNet递归层,相比纯Transformer架构展现出理论和实证优势。该工作表明混合模型具有更强的表达能力,在预训练中扩展效率更高,且性能优于可比的Transformer基线。

arXiv:2604.03444v3 宣告类型:替换-交叉 摘要:近期研究表明了非Transformer语言模型的潜力,特别是线性递归神经网络(RNN)和混合了递归与注意力的混合模型。然而,对于这些新架构的潜在优势是否足以证明其扩展的风险和努力,还没有达成共识。为了解决这一问题,我们从多个角度提供了混合模型相比纯Transformer的优势证据。首先,从理论上讲,我们证明了混合模型不仅继承了Transformer和线性RNN的表达能力,还能表达超越两者的任务,例如代码执行。将理论付诸实践,我们训练了Olmo Hybrid,一个70亿参数的模型,在很大程度上与Olmo 3 7B相当,但将滑动窗口层替换为Gated DeltaNet层。我们证明了Olmo Hybrid在标准预训练和中期训练评估中均优于Olmo 3,展示了混合模型在受控的大规模设置中的优势。我们发现混合模型的扩展效率明显高于Transformer,解释了其更优的性能。然而,为什么特定形式问题上更强的表达能力应该导致更好的扩展效率或在与这些问题无关的下游任务上性能更优,这一点仍不明确。为了解释这一明显的差距,我们回到理论,论证为什么增强的表达能力应该转化为更好的扩展效率,完成整个循环。总体而言,我们的结果表明,混合了注意力和递归层的混合模型是语言建模范式的强大扩展:不仅可以在推理过程中减少内存占用,而且是获得表达能力更强的模型的根本方式,能在预训练期间取得更好的扩展效率。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:33

# Olmo Hybrid:从理论到实践再回到理论
来源:https://arxiv.org/abs/2604.03444
作者:William Merrill (https://arxiv.org/search/cs?searchtype=author&query=Merrill,+W),Yanhong Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+Y),Tyler Romero (https://arxiv.org/search/cs?searchtype=author&query=Romero,+T),Anej Svete (https://arxiv.org/search/cs?searchtype=author&query=Svete,+A),Caia Costello (https://arxiv.org/search/cs?searchtype=author&query=Costello,+C),Pradeep Dasigi (https://arxiv.org/search/cs?searchtype=author&query=Dasigi,+P),Dirk Groeneveld (https://arxiv.org/search/cs?searchtype=author&query=Groeneveld,+D),David Heineman (https://arxiv.org/search/cs?searchtype=author&query=Heineman,+D),Bailey Kuehl (https://arxiv.org/search/cs?searchtype=author&query=Kuehl,+B),Nathan Lambert (https://arxiv.org/search/cs?searchtype=author&query=Lambert,+N),Chuan Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+C),Kyle Lo (https://arxiv.org/search/cs?searchtype=author&query=Lo,+K),Saumya Malik (https://arxiv.org/search/cs?searchtype=author&query=Malik,+S),DJ Matusz (https://arxiv.org/search/cs?searchtype=author&query=Matusz,+D),Benjamin Minixhofer (https://arxiv.org/search/cs?searchtype=author&query=Minixhofer,+B),Jacob Morrison (https://arxiv.org/search/cs?searchtype=author&query=Morrison,+J),Luca Soldaini (https://arxiv.org/search/cs?searchtype=author&query=Soldaini,+L),Finbarr Timbers (https://arxiv.org/search/cs?searchtype=author&query=Timbers,+F),Pete Walsh (https://arxiv.org/search/cs?searchtype=author&query=Walsh,+P),Noah A. Smith (https://arxiv.org/search/cs?searchtype=author&query=Smith,+N+A),Hannaneh Hajishirzi (https://arxiv.org/search/cs?searchtype=author&query=Hajishirzi,+H),Ashish Sabharwal (https://arxiv.org/search/cs?searchtype=author&query=Sabharwal,+A)

查看 PDF (https://arxiv.org/pdf/2604.03444)

> 摘要:近期研究表明了非 Transformer 语言模型的潜力,特别是线性循环神经网络(RNN)以及混合循环和注意力机制的混合模型。然而,关于这些新型架构的潜在优势是否足以证明大规模扩展所需的风险和努力,业界还没有达成共识。为了解决这个问题,我们从多个方面提供了混合模型相比纯 Transformer 的优势证据。首先,从理论上讲,我们证明了混合模型不仅继承了 Transformer 和线性 RNN 的表达能力,还能表达超越两者的任务,比如代码执行。将这一理论付诸实践,我们训练了 Olmo Hybrid,一个 7B 参数的模型,在很大程度上与 Olmo 3 7B 相当,但其滑动窗口层被 Gated DeltaNet 层所替代。我们证明了 Olmo Hybrid 在标准预训练和中期训练评估上的表现超越了 Olmo 3,展示了混合模型在大规模控制设置中的优势。我们发现混合模型的扩展效率明显高于 Transformer,这解释了其更优的性能。然而,为什么在特定形式化问题上的更强表达能力应该导致更好的扩展效率或在与这些问题无关的下游任务上的性能提升,这一点并不清楚。为了解释这一明显的差距,我们回到理论,论证为什么更强的表达能力应该转化为更高的扩展效率,完成了这个循环。总体而言,我们的结果表明,混合注意力和循环层的混合模型是语言建模范式的强大扩展:不仅可以减少推理期间的内存消耗,更是获得表达能力更强、预训练期间扩展效率更高的模型的根本方法。

## 提交历史

来自:William Merrill [查看邮箱 (https://arxiv.org/show-email/6449a88f/2604.03444)] **[[v1]](https://arxiv.org/abs/2604.03444v1)** 2026年4月3日星期五 20:36:34 UTC (1,124 KB) **[[v2]](https://arxiv.org/abs/2604.03444v2)** 2026年4月7日星期二 06:15:48 UTC (1,124 KB) **[v3]** 2026年4月16日星期四 18:50:04 UTC (1,124 KB)

相似文章

在词元级别上比较Transformer和混合模型

Lobsters Hottest

本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。

混合模型能更好地预测哪些令牌?

Hugging Face Blog

一项在令牌级别比较Olmo Hybrid和Olmo 3 Transformer的研究显示,混合模型能更好地预测有意义的令牌(如名词/动词),而Transformer模型则擅长从输入中复制令牌。

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。