Olmo Hybrid:从理论到实践再回到理论
摘要
本论文介绍了Olmo Hybrid,一个包含70亿参数的语言模型,结合了注意力机制和Gated DeltaNet递归层,相比纯Transformer架构展现出理论和实证优势。该工作表明混合模型具有更强的表达能力,在预训练中扩展效率更高,且性能优于可比的Transformer基线。
查看缓存全文
缓存时间: 2026/04/20 08:33
# Olmo Hybrid:从理论到实践再回到理论 来源:https://arxiv.org/abs/2604.03444 作者:William Merrill (https://arxiv.org/search/cs?searchtype=author&query=Merrill,+W),Yanhong Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+Y),Tyler Romero (https://arxiv.org/search/cs?searchtype=author&query=Romero,+T),Anej Svete (https://arxiv.org/search/cs?searchtype=author&query=Svete,+A),Caia Costello (https://arxiv.org/search/cs?searchtype=author&query=Costello,+C),Pradeep Dasigi (https://arxiv.org/search/cs?searchtype=author&query=Dasigi,+P),Dirk Groeneveld (https://arxiv.org/search/cs?searchtype=author&query=Groeneveld,+D),David Heineman (https://arxiv.org/search/cs?searchtype=author&query=Heineman,+D),Bailey Kuehl (https://arxiv.org/search/cs?searchtype=author&query=Kuehl,+B),Nathan Lambert (https://arxiv.org/search/cs?searchtype=author&query=Lambert,+N),Chuan Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+C),Kyle Lo (https://arxiv.org/search/cs?searchtype=author&query=Lo,+K),Saumya Malik (https://arxiv.org/search/cs?searchtype=author&query=Malik,+S),DJ Matusz (https://arxiv.org/search/cs?searchtype=author&query=Matusz,+D),Benjamin Minixhofer (https://arxiv.org/search/cs?searchtype=author&query=Minixhofer,+B),Jacob Morrison (https://arxiv.org/search/cs?searchtype=author&query=Morrison,+J),Luca Soldaini (https://arxiv.org/search/cs?searchtype=author&query=Soldaini,+L),Finbarr Timbers (https://arxiv.org/search/cs?searchtype=author&query=Timbers,+F),Pete Walsh (https://arxiv.org/search/cs?searchtype=author&query=Walsh,+P),Noah A. Smith (https://arxiv.org/search/cs?searchtype=author&query=Smith,+N+A),Hannaneh Hajishirzi (https://arxiv.org/search/cs?searchtype=author&query=Hajishirzi,+H),Ashish Sabharwal (https://arxiv.org/search/cs?searchtype=author&query=Sabharwal,+A) 查看 PDF (https://arxiv.org/pdf/2604.03444) > 摘要:近期研究表明了非 Transformer 语言模型的潜力,特别是线性循环神经网络(RNN)以及混合循环和注意力机制的混合模型。然而,关于这些新型架构的潜在优势是否足以证明大规模扩展所需的风险和努力,业界还没有达成共识。为了解决这个问题,我们从多个方面提供了混合模型相比纯 Transformer 的优势证据。首先,从理论上讲,我们证明了混合模型不仅继承了 Transformer 和线性 RNN 的表达能力,还能表达超越两者的任务,比如代码执行。将这一理论付诸实践,我们训练了 Olmo Hybrid,一个 7B 参数的模型,在很大程度上与 Olmo 3 7B 相当,但其滑动窗口层被 Gated DeltaNet 层所替代。我们证明了 Olmo Hybrid 在标准预训练和中期训练评估上的表现超越了 Olmo 3,展示了混合模型在大规模控制设置中的优势。我们发现混合模型的扩展效率明显高于 Transformer,这解释了其更优的性能。然而,为什么在特定形式化问题上的更强表达能力应该导致更好的扩展效率或在与这些问题无关的下游任务上的性能提升,这一点并不清楚。为了解释这一明显的差距,我们回到理论,论证为什么更强的表达能力应该转化为更高的扩展效率,完成了这个循环。总体而言,我们的结果表明,混合注意力和循环层的混合模型是语言建模范式的强大扩展:不仅可以减少推理期间的内存消耗,更是获得表达能力更强、预训练期间扩展效率更高的模型的根本方法。 ## 提交历史 来自:William Merrill [查看邮箱 (https://arxiv.org/show-email/6449a88f/2604.03444)] **[[v1]](https://arxiv.org/abs/2604.03444v1)** 2026年4月3日星期五 20:36:34 UTC (1,124 KB) **[[v2]](https://arxiv.org/abs/2604.03444v2)** 2026年4月7日星期二 06:15:48 UTC (1,124 KB) **[v3]** 2026年4月16日星期四 18:50:04 UTC (1,124 KB)
相似文章
在词元级别上比较Transformer和混合模型
本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。
混合模型能更好地预测哪些令牌?
一项在令牌级别比较Olmo Hybrid和Olmo 3 Transformer的研究显示,混合模型能更好地预测有意义的令牌(如名词/动词),而Transformer模型则擅长从输入中复制令牌。
@_albertgu:Transformer 更擅长复制,而 RNN 更擅长建模“承载意义的词——名词、动词和形容词……”
来自 Ai2 的一篇讨论比较了 transformer(Olmo 3)和混合模型(Olmo Hybrid),发现 transformer 在复制方面表现出色,而 RNN 在建模承载意义的词汇上更胜一筹,凸显了混合架构日益增长的可行性。
重新思考高效注意力在混合架构中的作用
本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。
Nemotron 3 Ultra:用于智能体推理的高效开源混合专家Mamba-Transformer模型
Nemotron 3 Ultra 是一个550B参数的混合Mamba-Attention专家混合语言模型,在20T tokens上预训练,扩展至1M上下文,并通过SFT、RL和MOPD进行后训练。相比同等精度的一流LLM,其推理吞吐量最高可提升6倍,并已开源。