linear-attention

标签

Cards List
#linear-attention

Video DeltaNet: 面向直播视频生成的视频原生混合注意力机制

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

Video DeltaNet提出了一种混合注意力机制,结合Softmax和线性注意力,以提高视频生成模型的效率,实现了比基线方法快14.5倍的加速。

0 人收藏 0 人点赞
#linear-attention

固定状态递归中联想记忆的解剖:匹配状态分解、干扰壁垒与破解它的课程学习

arXiv cs.LG ↗ · 2026-09-16 缓存

本文分解了固定状态递归网络中的联想记忆,发现卷积和课程学习对性能至关重要,并提出了针对干扰而非容量限制的干预措施。

0 人收藏 0 人点赞
#linear-attention

谱移(SpectralShift):通过谱重参数化有效扩展门控 DeltaNet 的上下文窗口

Hugging Face Daily Papers ↗ · 2026-09-13 缓存

谱移引入了一种谱重参数化方法,通过重塑衰减谱来有效扩展门控 DeltaNet 模型的上下文窗口,并通过持续预训练提升其长上下文处理能力。

0 人收藏 0 人点赞
#linear-attention

卡尔曼增量网络:不确定性感知的联想记忆

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

介绍了卡尔曼增量网络,该网络通过将线性注意力重新表述为带有卡尔曼滤波更新的线性高斯状态空间模型来改进语言建模,以追踪记忆不确定性,从而产生比现有线性注意力模型性能更优的高效近似。

0 人收藏 0 人点赞
#linear-attention

现代 Transformer 是隐式的混合体:从功能分化到原则性混合架构设计

arXiv cs.LG ↗ · 2026-09-04 缓存

本文提出了基于干预的指标,以区分 RoPE Transformer 中的检索头和位置头,从而推导出一种原则性混合架构 (HwH),该架构结合了全注意力和线性注意力,以改善语言建模和长上下文外推。

0 人收藏 0 人点赞
#linear-attention

为什么Gated DeltaNet能承受4位量化:针对混合27B LLM中循环部分的NVFP4 W4A4方案

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

本文解释了为什么将混合LLM中循环Gated DeltaNet层完全量化为4位NVFP4能在长上下文基准测试中保持精度,详细阐述了异常值定位和鲁棒delta规则动态等机制。

0 人收藏 0 人点赞
#linear-attention

Test Time Training(3分钟阅读)

TLDR AI ↗ · 2026-09-03 缓存

本文讨论了Test Time Training作为AI开发中潜在的新扩展轴,分析了一篇将其定位为线性注意力形式的论文,并探讨了其对模型训练和持续学习的影响。

0 人收藏 0 人点赞
#linear-attention

滑动窗口优于线性注意力

Hugging Face Daily Papers ↗ · 2026-08-28 缓存

带有sink的滑动窗口注意力在长上下文任务上优于经过后训练的线性注意力,无需重新训练,为LLMs提供更便宜、更可靠的推理解决方案。

0 人收藏 0 人点赞
#linear-attention

@davsca1:来看看我们的 #ECCV2026 论文 "Low-latency Event-based Object Detection with Spatially-Sparse Linear Attention",其中…

X AI KOLs Timeline ↗ · 2026-08-26 缓存

本文介绍了 Spatially-Sparse Linear Attention,用于事件相机的低延迟目标检测,以比先前异步方法低20倍的计算量实现了最先进的精度。

0 人收藏 0 人点赞
#linear-attention

Qwen 4 架构:我们了解多少?

Reddit r/LocalLLaMA ↗ · 2026-08-25

作者推测 Qwen 4 的可能架构,并基于对 Deepseek 的逆向工程讨论了潜在设计,例如嵌入卸载的线性注意力或多头潜在注意力混合架构。

0 人收藏 0 人点赞
#linear-attention

查询知道该遗忘什么:线性注意力的第二擦除方向

arXiv cs.LG ↗ · 2026-08-17 缓存

介绍了用于线性注意力模型的查询派生擦除方向(QED),以提升检索性能并将可用上下文长度大约加倍,在S-NIAH-1基准测试中得到验证。

0 人收藏 0 人点赞
#linear-attention

混合线性注意力大语言模型中的大规模激活:注意力前尖峰与尖峰间平台期

Hugging Face Daily Papers ↗ · 2026-08-12 缓存

本文首次系统研究了混合线性注意力大语言模型中的大规模激活现象,揭示了由抵消时机控制的注意力前尖峰和尖峰间平台期,并展示了其形态如何在完全注意力极限下恢复。

0 人收藏 0 人点赞
#linear-attention

Retrofitting Linear Attention into Diffusion Language Models

arXiv cs.LG ↗ · 2026-08-10 缓存

This paper introduces block-hybrid attention, which combines exact softmax attention within active denoising blocks and linear attention over previous blocks, to accelerate inference in pretrained diffusion language models. The authors retrofit this hybrid attention into LLaDA 2.1, achieving up to 1.7x higher decoding throughput with minimal post-training.

0 人收藏 0 人点赞
#linear-attention

卡在“A”:0.6B语言模型注意力到KDA线性化中的接口损伤诊断与修复

arXiv cs.CL ↗ · 2026-08-05 缓存

本文研究了在单块GPU上将Qwen3-0.6B-Base的注意力层转换为KDA线性注意力的失败模式,识别出一种“接口损伤”——模型预测选项标签而非内容,并提出了一个针对格式的KL阶段来修复该问题。

0 人收藏 0 人点赞
#linear-attention

@eliebakouch:所以...世界上最大的两个开源模型使用线性注意力?

X AI KOLs Timeline ↗ · 2026-08-03 缓存

一条推文强调,像Qwen3.8-Max这样的主要开源模型可能使用线性注意力,并引用了阿里巴巴宣布即将发布Qwen3.8-Max(2.4万亿参数)和Qwen3.8-27B开放权重版本的消息。

0 人收藏 0 人点赞
#linear-attention

从第一性原理理解 Kimi K3:给任何想搞懂这个庞然大物的人推荐的阅读顺序

Reddit r/ArtificialInteligence ↗ · 2026-07-29

一份指南,推荐基础论文和 Kimi 模型报告的最佳阅读顺序,以理解 Moonshot AI 的 Kimi K3 架构,涵盖线性注意力、MoE 和残差连接。

0 人收藏 0 人点赞
#linear-attention

你也能提出Kimi Delta Attention

Hacker News Top ↗ · 2026-07-28 缓存

这篇博客文章逐步推导了从标准softmax注意力经过线性注意力和DeltaNet变体到Kimi Delta Attention的过程,并解释了近期Qwen和Kimi模型使用的状态更新方程。

0 人收藏 0 人点赞
#linear-attention

Kimi Linear: 一种富有表现力且高效的注意力架构

Hacker News Top ↗ · 2026-07-28 缓存

Kimi Linear 提出了一种新的线性注意力架构,旨在增强Transformer模型的表达能力和效率,由 Moonshot AI 的 Kimi 团队贡献。

0 人收藏 0 人点赞
#linear-attention

Nvidia 的新型长视频生成技术(12分钟阅读)

TLDR AI ↗ · 2026-07-27 缓存

NVIDIA Research 推出了 SANA-Video 2.0,这是一种混合视频扩散变换器,能够在单个 GPU 上生成高质量 720p 视频,通过混合线性-softmax 注意力和块注意力残差,实现了相比 Wan 2.2-14B 高达 120 倍的速度提升。

0 人收藏 0 人点赞
#linear-attention

@akshay_pachaar: 一个矩阵取代了KV缓存。(该技术100%开源)Kimi刚刚发布了K3,一个前沿规模的开源模型…

X AI KOLs Following ↗ · 2026-07-24 缓存

Kimi发布了K3,一个2.8T参数的开源模型,采用delta attention避免KV缓存增长,实现了百万token上下文窗口,内存成本线性增长。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈