Taylor-Calibrate:混合线性注意力蒸馏的原则性初始化
摘要
Taylor-Calibrate提出了一种用于混合线性注意力模型的原则性初始化方法,显著提高了将预训练Transformer蒸馏为Gated DeltaNet学生模型的效率,实现了高达88倍的改进,并将训练token数量减少了4.9至9.2倍。
查看缓存全文
缓存时间: 2026/06/20 14:27
论文页面 - Taylor-Calibrate: 混合线性注意力蒸馏的初始化原则方法
来源:https://huggingface.co/papers/2606.16429
摘要
混合线性注意力模型可以通过一种新颖的初始化技术得到改进,该技术利用教师注意力统计和对齐步骤,增强了从预训练Transformer的转换效果。
混合线性注意力模型(https://huggingface.co/papers?q=Hybrid%20linear%20attention%20models)提供了一条实现更快长上下文推理的诱人路径:它们既降低了完全softmax注意力(https://huggingface.co/papers?q=full%20softmax%20attention)的二次成本和KV缓存负担,又能保留Transformer模型的大部分质量。获得此类模型的一种实用方法是转换预训练Transformer,而不是从头开始预训练新架构,但这种转换仍不稳定。仅仅将教师注意力投影(https://huggingface.co/papers?q=attention%20projections)复制到Gated DeltaNet(https://huggingface.co/papers?q=Gated%20DeltaNet)(GDN)学生模型中,并不能指定新的循环衰减、写入和输出门控动态。因此,转换后的模型往往处于不良的动态区域,需要花费大量蒸馏令牌(https://huggingface.co/papers?q=distillation%20tokens)来修复初始化,而非学习剩余的教师行为。我们提出Taylor-Calibrate,一种针对混合GDN学生模型的轻量级初始化方法。该方法利用泰勒引导的教师注意力统计来设置值投影、记忆时间尺度(https://huggingface.co/papers?q=memory%20timescale)、写入门(https://huggingface.co/papers?q=write%20gates)和输出门(https://huggingface.co/papers?q=output%20gate),然后应用一个短的逐层对齐步骤,使每个转换后的层与教师输出匹配。在四种教师设置和三种保留层策略下,Taylor-Calibrate产生了显著更强的零样本学生模型,在代表性消融实验中实现了高达88倍的改进,并且达到匹配恢复目标所需的训练令牌数比朴素转换减少了4.9倍至9.2倍。
查看arXiv页面(https://arxiv.org/abs/2606.16429)查看PDF(https://arxiv.org/pdf/2606.16429)GitHub1(https://github.com/FutureMLS-Lab/Taylor-Calibrate)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.16429)
在你的代理中获取这篇论文:
hf papers read 2606\.16429
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有与此论文关联的模型
在模型 README.md 中引用 arxiv.org/abs/2606.16429 以从本页面链接到它。
引用此论文的数据集0
没有与此论文关联的数据集
在数据集 README.md 中引用 arxiv.org/abs/2606.16429 以从本页面链接到它。
引用此论文的 Spaces0
没有与此论文关联的 Space
在 Space README.md 中引用 arxiv.org/abs/2606.16429 以从本页面链接到它。
包含此论文的收藏集0
没有包含此论文的收藏集
将这篇论文添加到一个收藏集(https://huggingface.co/new-collection)以从本页面链接到它。
相似文章
利用测试时训练线性化视觉Transformer
本文提出了一种方法,将预训练的Softmax注意力模型转换为线性复杂度的测试时训练(TTT)架构,在显著加速推理的同时,实现了与微调Softmax模型相当的文生图质量。该方法通过对Stable Diffusion 3.5进行线性化得到SD3.5-T^5,在1K分辨率下实现1.32倍加速。
Retrofitting Linear Attention into Diffusion Language Models
This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.
Delta Attention Residuals
Delta Attention Residuals 通过关注特征变化(增量)而非累积隐藏状态,改进了Transformer模型中的逐层路由,在220M到7.6B参数的规模上实现了1.7-8.2%的验证困惑度提升。
线性注意力架构:机制、权衡与跨层路由
本文对比了softmax注意力与四种线性注意力架构(DeltaNet、Gated DeltaNet、Kimi Delta Attention、Gated DeltaNet-2),并介绍了跨层路由机制。在350M参数规模的实验表明,使用Muon优化器的Kimi Delta Attention取得了最低的验证损失,而使用AdamW的纯Gated DeltaNet吞吐量最高。
多教师策略蒸馏中工具调用边界漂移的诊断与校准
本文诊断并提出SoftClamp校准方法,可减少智能语言模型在多教师策略蒸馏中的工具调用边界漂移,在保持准确率的同时降低过度调用。