标签
Video DeltaNet提出了一种混合注意力机制,结合Softmax和线性注意力,以提高视频生成模型的效率,实现了比基线方法快14.5倍的加速。
本文分解了固定状态递归网络中的联想记忆,发现卷积和课程学习对性能至关重要,并提出了针对干扰而非容量限制的干预措施。
谱移引入了一种谱重参数化方法,通过重塑衰减谱来有效扩展门控 DeltaNet 模型的上下文窗口,并通过持续预训练提升其长上下文处理能力。
介绍了卡尔曼增量网络,该网络通过将线性注意力重新表述为带有卡尔曼滤波更新的线性高斯状态空间模型来改进语言建模,以追踪记忆不确定性,从而产生比现有线性注意力模型性能更优的高效近似。
本文提出了基于干预的指标,以区分 RoPE Transformer 中的检索头和位置头,从而推导出一种原则性混合架构 (HwH),该架构结合了全注意力和线性注意力,以改善语言建模和长上下文外推。
本文解释了为什么将混合LLM中循环Gated DeltaNet层完全量化为4位NVFP4能在长上下文基准测试中保持精度,详细阐述了异常值定位和鲁棒delta规则动态等机制。
本文讨论了Test Time Training作为AI开发中潜在的新扩展轴,分析了一篇将其定位为线性注意力形式的论文,并探讨了其对模型训练和持续学习的影响。
带有sink的滑动窗口注意力在长上下文任务上优于经过后训练的线性注意力,无需重新训练,为LLMs提供更便宜、更可靠的推理解决方案。
本文介绍了 Spatially-Sparse Linear Attention,用于事件相机的低延迟目标检测,以比先前异步方法低20倍的计算量实现了最先进的精度。
作者推测 Qwen 4 的可能架构,并基于对 Deepseek 的逆向工程讨论了潜在设计,例如嵌入卸载的线性注意力或多头潜在注意力混合架构。
介绍了用于线性注意力模型的查询派生擦除方向(QED),以提升检索性能并将可用上下文长度大约加倍,在S-NIAH-1基准测试中得到验证。
本文首次系统研究了混合线性注意力大语言模型中的大规模激活现象,揭示了由抵消时机控制的注意力前尖峰和尖峰间平台期,并展示了其形态如何在完全注意力极限下恢复。
This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.
本文研究了在单块GPU上将Qwen3-0.6B-Base的注意力层转换为KDA线性注意力的失败模式,识别出一种“接口损伤”——模型预测选项标签而非内容,并提出了一个针对格式的KL阶段来修复该问题。
一条推文强调,像Qwen3.8-Max这样的主要开源模型可能使用线性注意力,并引用了阿里巴巴宣布即将发布Qwen3.8-Max(2.4万亿参数)和Qwen3.8-27B开放权重版本的消息。
一份指南,推荐基础论文和 Kimi 模型报告的最佳阅读顺序,以理解 Moonshot AI 的 Kimi K3 架构,涵盖线性注意力、MoE 和残差连接。
这篇博客文章逐步推导了从标准softmax注意力经过线性注意力和DeltaNet变体到Kimi Delta Attention的过程,并解释了近期Qwen和Kimi模型使用的状态更新方程。
Kimi Linear 提出了一种新的线性注意力架构,旨在增强Transformer模型的表达能力和效率,由 Moonshot AI 的 Kimi 团队贡献。
NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。
Kimi发布了K3,一个2.8T参数的开源模型,采用delta attention避免KV缓存增长,实现了百万token上下文窗口,内存成本线性增长。