sparse-attention

标签

Cards List
#sparse-attention

Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

arXiv cs.CL · 5天前 缓存

AoH is a data-free method that identifies retrieval and streaming heads from the spectral geometry of query-key projections, enabling sparse attention without runtime attention scores. At 50% sparsity it retains 96.5% of full-attention performance while reducing prefill/decode latency and KV-cache memory.

0 人收藏 0 人点赞
#sparse-attention

OasisKV:利用前瞻稀疏预取将解码中KV缓存扩展到HBM之外

Hugging Face Daily Papers · 2026-08-08 缓存

OasisKV是一个以内存为中心的LLM推理系统,通过使用来自推测解码的前瞻令牌预取稀疏且重要的KV块,将完整KV缓存存储与HBM解耦,与密集vLLM相比实现了高达2.1倍的吞吐量提升,且精度损失极小。

0 人收藏 0 人点赞
#sparse-attention

基于二值主成分的无训练哈希注意力

arXiv cs.LG · 2026-08-06 缓存

介绍了BinaryPC,一种面向长上下文大语言模型的无训练哈希稀疏注意力方法,利用二值主成分构建哈希码,在保持准确率的同时,解码吞吐量较FlashAttention提升了3.56倍。

0 人收藏 0 人点赞
#sparse-attention

ATFlash: Per-RoPE-Wavelength Attention Windows for Compute/Memory-Efficient LLM Inference

arXiv cs.LG · 2026-08-05 缓存

ATFlash introduces a per-RoPE-wavelength distance window that prunes query-key inner-product terms proportional to each frequency pair's wavelength, cutting 37-48% of attention compute with minimal quality loss and up to 1.31x speedups on long-context LLM inference.

0 人收藏 0 人点赞
#sparse-attention

图注意力何时应稀疏?学习逐边的 Tsallis 指数

arXiv cs.LG · 2026-08-05 缓存

本文提出了 LTGA,一种图注意力层,学习逐边的 Tsallis 熵指数,以在重尾、softmax 和紧支撑注意力之间插值,提供可解释的稀疏注意力,并在图基准上取得有竞争力的性能。

0 人收藏 0 人点赞
#sparse-attention

@ModelScope2022: 每 token 仅激活约 3B 参数,即可支持 1M token 上下文。Meituan 的 LongCat-Flash-Lite-Sparse 带来稀疏注意力……

X AI KOLs Timeline · 2026-08-03 缓存

Meituan 发布了 LongCat-Flash-Lite-Sparse,这是一款稀疏注意力模型,支持 1M token 上下文,每 token 仅激活约 3B 参数,在 MIT 许可下取得了强劲的 SWE-Bench 成绩。

0 人收藏 0 人点赞
#sparse-attention

先召回再排序:基于相似性引导的 Top-$K$ 复用于高效长上下文注意力

arXiv cs.CL · 2026-07-31 缓存

ReTopK 是一种无需训练的方法,通过复用历史查询-支持对来加速长上下文大语言模型中的动态 Top-K 稀疏注意力,从而避免全上下文评分和全局 Top-K 选择。在 128K 上下文下,相比精确 Top-K,它实现了最高 3.07 倍的加速,且困惑度仅增加 0.50%。

0 人收藏 0 人点赞
#sparse-attention

CoSA: 通过代理-内核协同设计的稀疏注意力加速长上下文推理

arXiv cs.CL · 2026-07-29 缓存

CoSA 提出了一种无需训练的稀疏注意力方法,该方法协同设计了内核感知代理和有序跳过内核,以加速长上下文推理,实现了高达 4.93 倍的注意力加速和 2.53 倍的端到端 TTFT 降低,且性能下降可忽略不计。

0 人收藏 0 人点赞
#sparse-attention

Wonder:更优的视频世界模型

Hugging Face Daily Papers · 2026-07-28 缓存

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。

0 人收藏 0 人点赞
#sparse-attention

RIS-Kernel:一种通过稀疏注意力实现长上下文LLM推理的模型无关架构

arXiv cs.LG · 2026-07-27 缓存

RIS-Kernel 提出了一种模型无关的稀疏注意力架构(RIS),将长上下文 LLM 推理中的自注意力复杂度从 O(N^2) 降低到 O(N log N),使得无需 GPU 加速即可在普通 CPU 硬件上运行。

0 人收藏 0 人点赞
#sparse-attention

基于压缩内容选择的无参数自适应稀疏注意力

arXiv cs.LG · 2026-07-27 缓存

本文提出了一种无参数的自适应稀疏注意力方法,利用gzip压缩比动态选择非冗余块进行长程注意力,在PG-19语言建模上相较于固定和学习的稀疏注意力基线取得了显著的困惑度提升。

0 人收藏 0 人点赞
#sparse-attention

学习重点:使用因果证据集监督稀疏注意力路由

arXiv cs.LG · 2026-07-27 缓存

本文测试了注意力权重能揭示模型输出实际依赖内容的假设,发现注意力与因果依赖常不一致。作者提出将干预掩码获得的因果证据集作为稀疏注意力路由器的监督信号,在注意力蒸馏路由器失败的检索任务上实现了近乎完美的准确率。

0 人收藏 0 人点赞
#sparse-attention

@songhan_mit: 光速块稀疏注意力:

X AI KOLs Following · 2026-07-21 缓存

Sol-Engine 每周更新宣布集成 Sol Attention,一种用于视频扩散的无需训练的稀疏注意力方法,完整论文将于下周发布。

0 人收藏 0 人点赞
#sparse-attention

介绍 DWARF-55M-Base

Reddit r/LocalLLaMA · 2026-07-20

DWARF-55M-Base 是一种新型语言模型,采用近乎全稀疏注意力架构(DSQG),仅包含一个完整因果注意力层,能够实现高达2048 token的可靠检索,并可外推至该上下文长度的3倍。该模型作为研究原型发布,供社区实验使用。

0 人收藏 0 人点赞
#sparse-attention

FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡

Hugging Face Daily Papers · 2026-07-17 缓存

FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。

0 人收藏 0 人点赞
#sparse-attention

LiteTopK:利用维度灾难实现长上下文稀疏注意力中的融合索引器-TopK核

arXiv cs.LG · 2026-07-15 缓存

LiteTopK是一种用于长上下文稀疏注意力的融合索引器-top-k核,它利用维度灾难来减少内存流量并提高效率,在预填充阶段将GLM 5.2加速1.2倍。

0 人收藏 0 人点赞
#sparse-attention

@seclink: MiniMax M3开源了。 一般愿意开源的,都是过时的,还有未开源的弹药未释放。 Hugging Face 主仓库(推荐): https://huggingface.co/MiniMaxAI/MiniMax-M3… 这里提供完整模型权重…

X AI KOLs Timeline · 2026-07-14 缓存

MiniMax 开源了其原生多模态大模型 M3,参数约 428B(激活约 23B),支持 1M 上下文,并引入了 MiniMax Sparse Attention (MSA) 技术以提升长上下文效率。

0 人收藏 0 人点赞
#sparse-attention

Flash-MSA: 利用稀疏注意力内核加速百万token训练

Hacker News Top · 2026-07-12 缓存

介绍Flash-MSA,首个针对MiniMax稀疏注意力在Hopper和Blackwell GPU上的高性能开源训练内核,实现高效的百万token训练。

0 人收藏 0 人点赞
#sparse-attention

@_avichawla: 英伟达研究人员构建了一种新的Transformer变体。对层结构做了一个小改动:- 解码速度提升1.7倍 - long-…

X AI KOLs Timeline · 2026-07-12 缓存

英伟达研究人员推出了SparDA,这是一种新的Transformer变体,它增加了一个第四投影(Forecast)来预测下一层的KV块,从而支持从CPU内存预取并降低选择成本,实现了解码速度提升1.7倍,并在长程推理任务上准确率提升6.5个百分点。

0 人收藏 0 人点赞
#sparse-attention

@VukRosic99: 长上下文Transformer面临两大瓶颈:二次注意力计算和KV缓存(在1M tokens时可达数百GB)…

X AI KOLs Timeline · 2026-07-11 缓存

MiniCPM-SALA是一款9B参数的混合注意力模型,通过在稀疏注意力和线性注意力之间交替插入(每3个线性层插入1个稀疏层)来克服长上下文Transformer的二次计算和KV缓存瓶颈。在256K tokens下,其推理速度比Qwen3-8B快3.5倍,并能在消费级GPU上支持高达1M tokens。该模型采用经济高效的持续训练方法,训练成本降低约75%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈