sparse-attention

标签

Cards List
#sparse-attention

@karminski3: 魔法! DeepSeekV4 上下文内存压缩到1/10! 大家都知道 DeepSeekV4 是支持1M上下文的, 而且经过了极度优化, 如果要真的用到1M上下文, 显存占用只需要10G左右, (对比之下 DeepSeek-V3.2 大概需…

X AI KOLs Following · 2026-06-12 缓存

FlashMemory-DeepSeek-V4提出了一种名为Lookahead Sparse Attention(LSA)的新型推理范式,通过神经内存索引器主动预测未来上下文需求,将物理KV缓存占用压缩至全上下文基线的13.5%,同时平均精度提升0.6%。该方法采用解耦训练策略,无需加载基座模型即可独立训练索引器,显著降低训练成本。

0 人收藏 0 人点赞
#sparse-attention

Avatar V:可规模化的视频参考虚拟化身视频生成

Hugging Face Daily Papers · 2026-06-11 缓存

Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。

0 人收藏 0 人点赞
#sparse-attention

MiniMax 稀疏注意力

Hugging Face Daily Papers · 2026-06-11 缓存

MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。

0 人收藏 0 人点赞
#sparse-attention

FlashMemory DeepSeek-V4 检索器(GitHub仓库)

TLDR AI · 2026-06-10 缓存

介绍了FlashMemory DeepSeek-V4检索器,这是一个轻量级模型,通过预测接下来将关注哪些块来稀疏化DeepSeek-V4的CSA KV缓存,仅保留约10-15%在设备上,同时匹配全注意力性能。

0 人收藏 0 人点赞
#sparse-attention

SparDA:用于高效长上下文 LLM 推理的稀疏解耦注意力

arXiv cs.CL · 2026-06-04 缓存

SparDA 提出了一种解耦稀疏注意力架构,通过添加轻量级"Forecast"投影来预测未来的 KV 缓存需求,从而实现从 CPU 到 GPU 的预取(lookahead prefetching),并降低选择开销。在基于稀疏预训练的 8B 模型上,其 prefill 速度最高可提升 1.25×,decode 速度最高可提升 1.7×,相比非 offload 基线,decode 吞吐量最高可提升 5.3×。

0 人收藏 0 人点赞
#sparse-attention

@akshay_pachaar: 1) 稀疏注意力 它通过以下方式将注意力计算限制在部分令牌上:- 使用局部注意力(令牌仅关注其相邻令牌)…

X AI KOLs Timeline · 2026-06-03 缓存

解释了Transformer中的稀疏注意力,通过仅关注部分令牌(使用局部或学习到的注意力模式)来降低计算复杂度。

0 人收藏 0 人点赞
#sparse-attention

局部性并不意味着可达性:块稀疏因果注意力中的边界修复

arXiv cs.LG · 2026-06-03 缓存

本文研究了固定块稀疏因果注意力中序列局部性与注意力图可达性之间的不匹配,形式化了边界伪影,并提出了诊断覆盖函数和一种名为边界桥注意力的最小修复方法。

0 人收藏 0 人点赞
#sparse-attention

MiniMaxAI/MiniMax-M3

Hugging Face Models Trending · 2026-06-02 缓存

MiniMax 发布 M3,一款原生多模态模型,拥有100万上下文和约4280亿参数,采用 MiniMax Sparse Attention (MSA) 实现高效长上下文处理,达到前沿级别的编码和智能体性能。

0 人收藏 0 人点赞
#sparse-attention

@AdinaYakup: Keye VL 2.0-30B-A3B 来自 @KwaiKeye 的新多模态模型 30B/3B 激活 - Apache 2.0 通过 DeepSeek Sparse Att… 提供 256K 上下文

X AI KOLs Following · 2026-06-01 缓存

KwaiKeye 发布 Keye VL 2.0-30B-A3B,这是一个多模态模型,拥有 30B 总参数/3B 激活参数,通过 DeepSeek Sparse Attention 提供 256K 上下文,采用 Apache 2.0 许可证,声称其准确性可与 Qwen3 VL 和 Gemini 3 媲美。

0 人收藏 0 人点赞
#sparse-attention

@sdrzn: MiniMax的新m3模型在terminal-bench 2.1上得分与opus 4.7相同,计算/成本仅为前一代模…

X AI KOLs Following · 2026-06-01 缓存

MiniMax新推出的m3模型在terminal-bench 2.1上取得了与Opus 4.7相同的分数,但计算量和成本仅为原来的二十分之一,这归功于其全新的MiniMax Sparse Attention架构。

0 人收藏 0 人点赞
#sparse-attention

@RyanLeeMiniMax: MiniMax-M3 将于下周在 HuggingFace 上以开源权重形式发布!

X AI KOLs Following · 2026-06-01 缓存

MiniMax 宣布推出 MiniMax-M3,这是一款结合前沿编程和代理能力的开源权重模型,采用稀疏注意力机制扩展至 1M 上下文,计划于下周在 HuggingFace 上线。

0 人收藏 0 人点赞
#sparse-attention

@MiniMax_AI:介绍MiniMax M3:首个结合三大前沿能力的开源权重模型——编程与智能体前沿…

X AI KOLs Timeline · 2026-06-01 缓存

MiniMax发布了MiniMax M3,这是首个开源权重AI模型,集成了编码和智能体任务的前沿能力,通过稀疏注意力扩展到100万上下文,取得了强劲的基准分数。

0 人收藏 0 人点赞
#sparse-attention

MiniMax M3 - 编码与智能体前沿,百万级上下文,多模态

Reddit r/LocalLLaMA · 2026-06-01 缓存

MiniMax 发布了 M3,这是一个开源权重模型,具备前沿编码能力、智能体能力、百万级上下文和原生多模态能力,在编码和智能体任务上取得了顶级基准成绩,并支持自主任务分解和长上下文。

0 人收藏 0 人点赞
#sparse-attention

MiniMax M3(2分钟阅读)

TLDR AI · 2026-06-01 缓存

MiniMax 推出了 M3,这是首个结合编程、智能体与多模态能力的开源权重模型,通过稀疏注意力机制支持高达 100 万 token 的上下文。

0 人收藏 0 人点赞
#sparse-attention

学习跳跃块:自我发现的超度量路由用于硬件加速稀疏注意力

Reddit r/artificial · 2026-05-30

本文介绍了动态超度量注意力(Dynamic Ultrametric Attention),这是一个框架,其中Transformer在训练期间学习每头块稀疏路由拓扑,然后在推理时将这些拓扑卸载到自定义的Triton块稀疏内核上,与密集注意力相比,实现了高达28倍的加速和98.4%的内存减少。

0 人收藏 0 人点赞
#sparse-attention

LVSA: 用于长视频扩散的无训练稀疏注意力

Hugging Face Daily Papers · 2026-05-29 缓存

LVSA 为视频扩散模型引入了一种无训练稀疏注意力机制,将计算量减少高达 3.17 倍,同时能够在训练时长之外进行生成,且无质量损失。

0 人收藏 0 人点赞
#sparse-attention

MiniMax 预告即将推出的 M3 模型:全新稀疏注意力机制,长上下文响应速度提升 15.6 倍(12 分钟阅读)

TLDR AI · 2026-05-29 缓存

MiniMax 发布了关于其 M2 系列的详细技术报告,并预告了即将推出的 M3 模型。该模型采用一种新颖的稀疏注意力机制,在百万 token 上下文中实现高达 15.6 倍的解码速度提升。

0 人收藏 1 人点赞
#sparse-attention

推理时上下文稀疏性:幻象还是机遇?

arXiv cs.AI · 2026-05-26 缓存

本文认为,极端的上下文稀疏性是LLM推理的一个有原则且可行的基础,展示了当前模型能够容忍高达100倍的稀疏性而无质量损失,并且稀疏解码内核可以在现有硬件上将处理速度提升10倍。

0 人收藏 0 人点赞
#sparse-attention

Kwai-Keye/Keye-VL-2.0-30B-A3B

Hugging Face Models Trending · 2026-05-25 缓存

Kwai-Keye 发布了 Keye-VL-2.0-30B-A3B,这是一款 30B 级别的视觉语言模型,具备先进的视频理解、稀疏注意力机制和智能体能力,在多项基准测试中达到顶尖水平。

0 人收藏 0 人点赞
#sparse-attention

@rohanpaul_ai:新阿里与南京大学论文声称百万token预填充速度可提升9.36倍(与FlashAttention-2相比)……

X AI KOLs Timeline · 2026-05-24 缓存

来自阿里巴巴和南京大学的新论文介绍了RTPurbo,这是一种通过仅在必要处选择性应用完整注意力机制(无需重新训练模型)将百万token预填充速度相比FlashAttention-2提升最多9.36倍的方法。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈