Taylor-Calibrate:混合线性注意力蒸馏的原则性初始化
摘要
Taylor-Calibrate提出了一种用于混合线性注意力模型的原则性初始化方法,显著提高了将预训练Transformer蒸馏为Gated DeltaNet学生模型的效率,实现了高达88倍的改进,并将训练token数量减少了4.9至9.2倍。
查看缓存全文
缓存时间: 2026/06/20 14:27
论文页面 - Taylor-Calibrate: 混合线性注意力蒸馏的初始化原则方法
来源:https://huggingface.co/papers/2606.16429
摘要
混合线性注意力模型可以通过一种新颖的初始化技术得到改进,该技术利用教师注意力统计和对齐步骤,增强了从预训练Transformer的转换效果。
混合线性注意力模型(https://huggingface.co/papers?q=Hybrid%20linear%20attention%20models)提供了一条实现更快长上下文推理的诱人路径:它们既降低了完全softmax注意力(https://huggingface.co/papers?q=full%20softmax%20attention)的二次成本和KV缓存负担,又能保留Transformer模型的大部分质量。获得此类模型的一种实用方法是转换预训练Transformer,而不是从头开始预训练新架构,但这种转换仍不稳定。仅仅将教师注意力投影(https://huggingface.co/papers?q=attention%20projections)复制到Gated DeltaNet(https://huggingface.co/papers?q=Gated%20DeltaNet)(GDN)学生模型中,并不能指定新的循环衰减、写入和输出门控动态。因此,转换后的模型往往处于不良的动态区域,需要花费大量蒸馏令牌(https://huggingface.co/papers?q=distillation%20tokens)来修复初始化,而非学习剩余的教师行为。我们提出Taylor-Calibrate,一种针对混合GDN学生模型的轻量级初始化方法。该方法利用泰勒引导的教师注意力统计来设置值投影、记忆时间尺度(https://huggingface.co/papers?q=memory%20timescale)、写入门(https://huggingface.co/papers?q=write%20gates)和输出门(https://huggingface.co/papers?q=output%20gate),然后应用一个短的逐层对齐步骤,使每个转换后的层与教师输出匹配。在四种教师设置和三种保留层策略下,Taylor-Calibrate产生了显著更强的零样本学生模型,在代表性消融实验中实现了高达88倍的改进,并且达到匹配恢复目标所需的训练令牌数比朴素转换减少了4.9倍至9.2倍。
查看arXiv页面(https://arxiv.org/abs/2606.16429)查看PDF(https://arxiv.org/pdf/2606.16429)GitHub1(https://github.com/FutureMLS-Lab/Taylor-Calibrate)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.16429)
在你的代理中获取这篇论文:
hf papers read 2606\.16429
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有与此论文关联的模型
在模型 README.md 中引用 arxiv.org/abs/2606.16429 以从本页面链接到它。
引用此论文的数据集0
没有与此论文关联的数据集
在数据集 README.md 中引用 arxiv.org/abs/2606.16429 以从本页面链接到它。
引用此论文的 Spaces0
没有与此论文关联的 Space
在 Space README.md 中引用 arxiv.org/abs/2606.16429 以从本页面链接到它。
包含此论文的收藏集0
没有包含此论文的收藏集
将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)以从本页面链接到它。
相似文章
利用测试时训练线性化视觉Transformer
本文提出了一种方法,将预训练的Softmax注意力模型转换为线性复杂度的测试时训练(TTT)架构,在显著加速推理的同时,实现了与微调Softmax模型相当的文生图质量。该方法通过对Stable Diffusion 3.5进行线性化得到SD3.5-T^5,在1K分辨率下实现1.32倍加速。
Delta Attention Residuals
Delta Attention Residuals 通过关注特征变化(增量)而非累积隐藏状态,改进了Transformer模型中的逐层路由,在220M到7.6B参数的规模上实现了1.7-8.2%的验证困惑度提升。
线性注意力架构:机制、权衡与跨层路由
本文对比了softmax注意力与四种线性注意力架构(DeltaNet、Gated DeltaNet、Kimi Delta Attention、Gated DeltaNet-2),并介绍了跨层路由机制。在350M参数规模的实验表明,使用Muon优化器的Kimi Delta Attention取得了最低的验证损失,而使用AdamW的纯Gated DeltaNet吞吐量最高。
多教师策略蒸馏中工具调用边界漂移的诊断与校准
本文诊断并提出SoftClamp校准方法,可减少智能语言模型在多教师策略蒸馏中的工具调用边界漂移,在保持准确率的同时降低过度调用。
Parallax: 参数化局部线性注意力机制用于语言建模
介绍Parallax,一种参数化局部线性注意力机制,结合硬件感知优化,提升LLM预训练效率和性能,在0.6B和1.7B规模实现帕累托改进。