变形为混合注意力模型

Hugging Face Daily Papers 论文

摘要

FlashMorph 是一种高效的层选择方法,将混合层选择表述为预算约束优化问题,利用可变形模型和线性化正则化来提高 Transformers 中的长上下文效率。

混合注意力模型通过仅保留一部分全注意力层并将其余层替换为线性注意力,提高了长上下文效率。然而,Transformer 到混合模型的转换效果关键取决于哪些层保留了全注意力。现有的混合层选择方法通常依赖启发式策略,如固定放置模式或逐层评分,隐含地将层重要性视为孤立的,忽略了全局混合配置下层的相互影响。在这项工作中,我们将混合层选择形式化为一个预算约束的子集优化问题。我们进一步提出了 FlashMorph(Fast LAyer Selection for Hybrid MORPHing),一种高效、可扩展的 Transformer 到混合模型转换的层选择方法。FlashMorph 首先通过为每个全注意力层配备一个转换后的线性注意力分支来构建可变形模型。然后冻结所有模型权重,在合成长上下文检索数据上联合优化逐层门控,并采用线性化正则化鼓励模型依赖线性注意力以实现高效性。学习到的门控在预设的全注意力预算下离散化以实例化混合架构,随后进行标准的 logits 蒸馏和长上下文微调。大量实验表明,与现有的层选择方法相比,FlashMorph 发现了更有效的混合配置,在显著降低层选择成本的同时保持了强大的长上下文召回和通用基准性能,证明了其有效性、高效性和可扩展性。
查看原文
查看缓存全文

缓存时间: 2026/07/03 03:52

论文页面 - 变形为混合注意力模型

来源:https://huggingface.co/papers/2606.30562

摘要

FlashMorph 是一种高效的层选择方法,它将混合层选择形式化为一个受预算约束的优化问题,利用可变形模型和线性化正则化来提升 Transformer 在长上下文场景下的效率。

混合注意力模型 (https://huggingface.co/papers?q=Hybrid%20attention%20models) 通过仅保留部分全注意力层 (https://huggingface.co/papers?q=full-attention%20layers) 并用线性注意力 (https://huggingface.co/papers?q=linear%20attention) 替换其余层,从而提升长上下文效率。然而,Transformer 到混合模型转换 (https://huggingface.co/papers?q=Transformer-to-hybrid%20conversion) 的有效性关键取决于哪些层保留全注意力。现有的混合层选择方法通常依赖启发式策略,如固定放置模式或逐层评分,隐式地将层重要性视为孤立因素,忽略了全局混合配置下的层间相互影响。在这项工作中,我们将混合层选择形式化为一个受预算约束的子集优化问题 (https://huggingface.co/papers?q=subset%20optimization%20problem)。我们进一步提出 FlashMorph(快速混合变形的层选择方法),一种用于 Transformer 到混合模型转换 (https://huggingface.co/papers?q=Transformer-to-hybrid%20conversion) 的高效、可扩展的层选择方法。FlashMorph 首先通过为每个全注意力层配备一个已转换的线性注意力分支来构建可变形模型 (https://huggingface.co/papers?q=morphable%20model)。然后冻结所有模型权重,在合成长上下文检索数据 (https://huggingface.co/papers?q=synthetic%20long-context%20retrieval%20data) 上联合优化逐层门控 (https://huggingface.co/papers?q=layerwise%20gates),并采用线性化正则化 (https://huggingface.co/papers?q=linearization%20regularization) 鼓励模型依赖线性注意力 (https://huggingface.co/papers?q=linear%20attention) 以提高效率。学习到的门控在预设的全注意力预算下进行离散化,以实例化混合架构,随后进行标准的 logits 蒸馏 (https://huggingface.co/papers?q=logits%20distillation) 和长上下文微调 (https://huggingface.co/papers?q=long-context%20finetuning)。大量实验表明,FlashMorph 能发现更有效的混合配置,在保持强大的长上下文召回率和通用基准性能的同时,与现有层选择方法相比大幅降低了层选择成本,证明了其有效性、高效性和可扩展性。

查看 arXiv 页面 (https://arxiv.org/abs/2606.30562)查看 PDF (https://arxiv.org/pdf/2606.30562)GitHub4 (https://github.com/LanDisen/FlashMorph)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.30562)

在您的 agent 中获取此论文:

hf papers read 2606\.30562

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

请在模型 README.md 中引用 arxiv.org/abs/2606.30562 以从此页面链接。

引用此论文的数据集0

没有数据集关联此论文

请在数据集 README.md 中引用 arxiv.org/abs/2606.30562 以从此页面链接。

引用此论文的 Spaces0

没有 Space 关联此论文

请在 Space README.md 中引用 arxiv.org/abs/2606.30562 以从此页面链接。

包含此论文的合集0

没有合集包含此论文

请将此论文添加到合集 (https://huggingface.co/new-collection) 中以从此页面链接。

相似文章

重新思考高效注意力在混合架构中的作用

arXiv cs.CL

本文系统分析了高效注意力模块在混合语言模型架构中的作用,发现不同设计在充分训练下长上下文性能趋于一致,且长距离检索主要由全注意力承担,而高效注意力塑造了优化轨迹,揭示了一个称为“大窗口懒惰”的现象。

HydraHead:从头部级功能异质性到专注意力混合

Hugging Face Daily Papers

HydraHead 是一种新颖的注意力混合架构,通过在头部层级结合完全注意力和线性注意力,利用可解释性驱动的选择和尺度归一化融合,实现长上下文性能卓越并减少训练开销。

在词元级别上比较Transformer和混合模型

Lobsters Hottest

本文分析了使用Olmo 3和Olmo Hybrid的Transformer与混合注意力-循环模型在词元级别上的预测差异,发现混合模型在语义状态追踪方面有所改进,而Transformer在n元组复制和语法括号匹配方面表现出色。