sparse-attention

标签

Cards List
#sparse-attention

@ModelScope2022: 每 token 仅激活约 3B 参数,即可支持 1M token 上下文。Meituan 的 LongCat-Flash-Lite-Sparse 带来稀疏注意力……

X AI KOLs Timeline ↗ · 2026-08-03 缓存

Meituan 发布了 LongCat-Flash-Lite-Sparse,这是一款稀疏注意力模型,支持 1M token 上下文,每 token 仅激活约 3B 参数,在 MIT 许可下取得了强劲的 SWE-Bench 成绩。

0 人收藏 0 人点赞
#sparse-attention

先召回再排序:基于相似性引导的 Top-$K$ 复用于高效长上下文注意力

arXiv cs.CL ↗ · 2026-07-31 缓存

ReTopK 是一种无需训练的方法,通过复用历史查询-支持对来加速长上下文大语言模型中的动态 Top-K 稀疏注意力,从而避免全上下文评分和全局 Top-K 选择。在 128K 上下文下,相比精确 Top-K,它实现了最高 3.07 倍的加速,且困惑度仅增加 0.50%。

0 人收藏 0 人点赞
#sparse-attention

CoSA: 通过代理-内核协同设计的稀疏注意力加速长上下文推理

arXiv cs.CL ↗ · 2026-07-29 缓存

CoSA 提出了一种无需训练的稀疏注意力方法,该方法协同设计了内核感知代理和有序跳过内核,以加速长上下文推理,实现了高达 4.93 倍的注意力加速和 2.53 倍的端到端 TTFT 降低,且性能下降可忽略不计。

0 人收藏 0 人点赞
#sparse-attention

Wonder:更优的视频世界模型

Hugging Face Daily Papers ↗ · 2026-07-28 缓存

Wonder是一个通用的视频世界模型,能够从一张图像或条件视频中实现实时、可控制摄像头的世界探索。它通过密集坐标场引入摄像头条件化,采用稀疏注意力记忆机制,并改进蒸馏技术,从而支持以16 FPS生成分钟级的视频。

0 人收藏 0 人点赞
#sparse-attention

RIS-Kernel:一种通过稀疏注意力实现长上下文LLM推理的模型无关架构

arXiv cs.LG ↗ · 2026-07-27 缓存

RIS-Kernel 提出了一种模型无关的稀疏注意力架构(RIS),将长上下文 LLM 推理中的自注意力复杂度从 O(N^2) 降低到 O(N log N),使得无需 GPU 加速即可在普通 CPU 硬件上运行。

0 人收藏 0 人点赞
#sparse-attention

基于压缩内容选择的无参数自适应稀疏注意力

arXiv cs.LG ↗ · 2026-07-27 缓存

本文提出了一种无参数的自适应稀疏注意力方法,利用gzip压缩比动态选择非冗余块进行长程注意力,在PG-19语言建模上相较于固定和学习的稀疏注意力基线取得了显著的困惑度提升。

0 人收藏 0 人点赞
#sparse-attention

学习重点:使用因果证据集监督稀疏注意力路由

arXiv cs.LG ↗ · 2026-07-27 缓存

本文测试了注意力权重能揭示模型输出实际依赖内容的假设,发现注意力与因果依赖常不一致。作者提出将干预掩码获得的因果证据集作为稀疏注意力路由器的监督信号,在注意力蒸馏路由器失败的检索任务上实现了近乎完美的准确率。

0 人收藏 0 人点赞
#sparse-attention

@songhan_mit: 光速块稀疏注意力:

X AI KOLs Following ↗ · 2026-07-21 缓存

Sol-Engine 每周更新宣布集成 Sol Attention,一种用于视频扩散的无需训练的稀疏注意力方法,完整论文将于下周发布。

0 人收藏 0 人点赞
#sparse-attention

介绍 DWARF-55M-Base

Reddit r/LocalLLaMA ↗ · 2026-07-20

DWARF-55M-Base 是一种新型语言模型,采用近乎全稀疏注意力架构(DSQG),仅包含一个完整因果注意力层,能够实现高达2048 token的可靠检索,并可外推至该上下文长度的3倍。该模型作为研究原型发布,供社区实验使用。

0 人收藏 0 人点赞
#sparse-attention

FVAttn: 用于视频生成的自适应稀疏注意力与运行时负载均衡

Hugging Face Daily Papers ↗ · 2026-07-17 缓存

FVAttn是一种无需训练的稀疏注意力系统,利用运行时负载均衡提升多GPU序列并行下自适应稀疏注意力的分布式执行效率。在基于步骤蒸馏的Wan2.2 I2V上,相比于FlashAttention,注意力速度提升最高达4.41倍,推理速度提升2.11倍,同时保持有竞争力的视频质量。

0 人收藏 0 人点赞
#sparse-attention

LiteTopK:利用维度灾难实现长上下文稀疏注意力中的融合索引器-TopK核

arXiv cs.LG ↗ · 2026-07-15 缓存

LiteTopK是一种用于长上下文稀疏注意力的融合索引器-top-k核,它利用维度灾难来减少内存流量并提高效率,在预填充阶段将GLM 5.2加速1.2倍。

0 人收藏 0 人点赞
#sparse-attention

@seclink: MiniMax M3开源了。 一般愿意开源的,都是过时的,还有未开源的弹药未释放。 Hugging Face 主仓库(推荐): https://huggingface.co/MiniMaxAI/MiniMax-M3… 这里提供完整模型权重…

X AI KOLs Timeline ↗ · 2026-07-14 缓存

MiniMax 开源了其原生多模态大模型 M3,参数约 428B(激活约 23B),支持 1M 上下文,并引入了 MiniMax Sparse Attention (MSA) 技术以提升长上下文效率。

0 人收藏 0 人点赞
#sparse-attention

Flash-MSA: 利用稀疏注意力内核加速百万token训练

Hacker News Top ↗ · 2026-07-12 缓存

介绍Flash-MSA,首个针对MiniMax稀疏注意力在Hopper和Blackwell GPU上的高性能开源训练内核,实现高效的百万token训练。

0 人收藏 0 人点赞
#sparse-attention

@_avichawla: 英伟达研究人员构建了一种新的Transformer变体。对层结构做了一个小改动:- 解码速度提升1.7倍 - long-…

X AI KOLs Timeline ↗ · 2026-07-12 缓存

英伟达研究人员推出了SparDA,这是一种新的Transformer变体,它增加了一个第四投影(Forecast)来预测下一层的KV块,从而支持从CPU内存预取并降低选择成本,实现了解码速度提升1.7倍,并在长程推理任务上准确率提升6.5个百分点。

0 人收藏 0 人点赞
#sparse-attention

@VukRosic99: 长上下文Transformer面临两大瓶颈:二次注意力计算和KV缓存(在1M tokens时可达数百GB)…

X AI KOLs Timeline ↗ · 2026-07-11 缓存

MiniCPM-SALA是一款9B参数的混合注意力模型,通过在稀疏注意力和线性注意力之间交替插入(每3个线性层插入1个稀疏层)来克服长上下文Transformer的二次计算和KV缓存瓶颈。在256K tokens下,其推理速度比Qwen3-8B快3.5倍,并能在消费级GPU上支持高达1M tokens。该模型采用经济高效的持续训练方法,训练成本降低约75%。

0 人收藏 0 人点赞
#sparse-attention

tencent/HiLS-Attention-7B · Hugging Face

Reddit r/LocalLLaMA ↗ · 2026-07-10 缓存

腾讯发布了HiLS-Attention-7B,一个70亿参数的模型,采用新颖的块状稀疏注意力机制,端到端地学习块选择,从而实现高效的长上下文建模,并能在超过4倍训练长度的场景下进行强大的外推。

0 人收藏 0 人点赞
#sparse-attention

MiniMax M3:稀疏注意力如何让长程智能体变得实用(11分钟阅读)

TLDR AI ↗ · 2026-07-08 缓存

MiniMax M3通过稀疏注意力保持上下文成本可预测且低廉,使500KToken的上下文在质量损失极小的情况下实现显著的速度提升,从而让长程智能体变得实用。

0 人收藏 0 人点赞
#sparse-attention

Hierarchical Global Attention (HGA)

arXiv cs.LG ↗ · 2026-07-01 缓存

Hierarchical Global Attention (HGA) 是一种可直接替换预训练长上下文Transformer中密集因果注意力的方法。它采用分层两级路由机制,使得能够对一个小规模路由工作集进行精确注意力计算,从而允许像 Qwen3-30B 这样的模型在单个 RTX 5090 上以64K上下文运行,且质量损失极小。

0 人收藏 0 人点赞
#sparse-attention

深度交错斐波那契间距的稀疏注意力:静态调度超越学习型膨胀,并在密集注意力失败处实现外推

arXiv cs.CL ↗ · 2026-06-30 缓存

本文研究了具有斐波那契间距偏移和逐层缩放因子的稀疏自注意力,发现静态逐层调度优于学习型或固定型调度,且稀疏变体在训练长度4倍时仍能稳健外推,而密集注意力则崩溃。

0 人收藏 0 人点赞
#sparse-attention

@eliebakouch: 该模型引入的新型稀疏注意力方法基本上是对现有方法组件的组合……

X AI KOLs Following ↗ · 2026-06-30 缓存

美团推出了 LongCat-2.0,这是一个 1.6 万亿参数的 MoE 模型,拥有 480 亿活跃参数和 100 万上下文长度,采用了新的 LongCat 稀疏注意力(LSA)方法,该方法结合了现有稀疏注意力技术的组件。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈