sparse-attention

标签

Cards List
#sparse-attention

SMat-Attention:结构化长上下文序列建模

arXiv cs.AI ↗ · 21小时前 缓存

SMat-Attention 引入了具有可调 VC 维度的结构化因果掩码,在 softmax attention 与 linear attention 之间架起桥梁,实现了亚二次方的 prefill、常数时间的解码(缓存状态为 O(T^{1-1/d})),并在召回能力上优于 Mamba-2 和 Gated DeltaNet 等骨干网络。

0 人收藏 0 人点赞
#sparse-attention

WorldAttention: 一个用于交互式视频世界模型的高效注意力架构

Hugging Face Daily Papers ↗ · 3天前 缓存

WorldAttention 提出了一种高效的注意力架构,采用 Hybrid Sparse Attention 和 Hierarchical KV Cache,用于交互式视频世界模型,在 VBench-Long 和 InterVBench 等基准测试上实现了最先进的性能。

0 人收藏 0 人点赞
#sparse-attention

注意力路由早期稳定:循环语言模型的工作集推理

arXiv cs.CL ↗ · 6天前 缓存

本文分析了循环语言模型中注意力路由的演变,并提出了WISE,一种无需训练的推理方法,该方法重用已稳定的稀疏注意力支持,以实现高达1.76倍的注意力加速,同时在多跳问答基准测试上保持性能。

0 人收藏 0 人点赞
#sparse-attention

Elastic Threshold Attention:用于长上下文解码的学习上下文稀疏性

arXiv cs.LG ↗ · 2026-09-21 缓存

Elastic Threshold Attention (ETA) 是一种可训练的稀疏注意力架构,它通过使用从查询表示中预测的动态阈值,在不降低质量的情况下提高长上下文解码速度。

0 人收藏 0 人点赞
#sparse-attention

RBS-Attention:面向长上下文大语言模型的半径约束稀疏预填充方法

arXiv cs.AI ↗ · 2026-09-21 缓存

RBS-Attention引入了一种无需训练的稀疏预填充方法,采用双分支选择来缓解长上下文LLM推理中的均值稀释问题,在H100 GPU上实现最高20.65倍加速,同时在基准测试中保持接近稠密模型的质量。

0 人收藏 0 人点赞
#sparse-attention

@peony__snow: 高达1000倍的长度外推——只需替换softmax。密集注意力在长输入上分散。ASEntmax 提供 …

X AI KOLs Timeline ↗ · 2026-09-11 缓存

本文介绍了 Adaptive-Scalable Entmax (ASEntmax),一种可学习的稀疏注意力机制,在transformers中实现高达1000倍的长度外推,提升长上下文泛化能力的同时保持短上下文性能。

0 人收藏 0 人点赞
#sparse-attention

@samsja19:我们非常看好稀疏注意力 + HiSparse,并且一直与 vLLM 团队合作

X AI KOLs Timeline ↗ · 2026-09-08 缓存

HiSparse 和稀疏注意力技术正被集成到 vLLM 中,以减少内存使用并提高并发性,从而提升强化学习的推理吞吐量。

0 人收藏 0 人点赞
#sparse-attention

@omarsar0:来自 Google DeepMind 及其同事的重磅论文。(收藏它)一个模型在每次生成时读取其整个 KV 缓存……

X AI KOLs Following ↗ · 2026-09-03 缓存

这篇论文介绍了声明式注意力,一种允许语言模型声明其在思维链中关注位置的协议,在 Gemma-4-31B 上减少 52% 的关注令牌,在 Qwen-3.6-27B 上减少 31.1%,精度损失最小。

0 人收藏 0 人点赞
#sparse-attention

@ArizePhoenix: 对于智能体,活跃参数是你在延迟和成本上支付的东西,而智能体循环会重新发送上下文,重试工具调用……

X AI KOLs Following ↗ · 2026-09-03

Arize Phoenix 推出了M3,它增加了稀疏注意力和1M令牌上下文窗口,通过将长工具历史保留在上下文中来减少AI智能体的延迟和成本。

0 人收藏 0 人点赞
#sparse-attention

CRISP:基于结构化质量驱动的路由的悬崖感知输入自适应稀疏预填充

arXiv cs.LG ↗ · 2026-09-03 缓存

CRISP 引入了一种方法,通过使用结构化路由解决噪声累积问题,改进长上下文LLM推理中的稀疏预填充,在检索任务上实现了加速和性能提升。

0 人收藏 0 人点赞
#sparse-attention

Graph Machine: 通过边实现更优预训练

Hugging Face Daily Papers ↗ · 2026-09-02 缓存

本文介绍了Graph Machine,一种通过动态指针将Transformer中的密集注意力层替换为稀疏层的方法,从而在预训练期间提高效率并保持或增强性能。

0 人收藏 0 人点赞
#sparse-attention

语言模型能够控制自身的注意力

Hugging Face Daily Papers ↗ · 2026-09-02 缓存

本文介绍了一种名为Declarative Attention的方法,该方法使语言模型能够在推理时声明相关上下文区域,从而显著减少键值缓存的读取次数,在长上下文任务中仅带来轻微的精度损失。

0 人收藏 0 人点赞
#sparse-attention

RouteSparse: 输入条件模式路由用于预算化长上下文预填充

arXiv cs.CL ↗ · 2026-09-01 缓存

RouteSparse 是一种用于长上下文预填充的输入条件模式路由方法,与密集注意力相比,在最小精度损失下实现了高达6.5倍的加速。

0 人收藏 0 人点赞
#sparse-attention

关于Qwen3.8-Next架构设计:评估、效率与训练稳定性

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

本文介绍了Qwen3.8-Flash-Next,一种稀疏混合专家AI模型,通过混合注意力和n-gram嵌入等架构创新,提升了效率、能力和训练稳定性。

0 人收藏 0 人点赞
#sparse-attention

Qwen3.8-Flash-Next 针对 Mac 优化版

Reddit r/LocalLLaMA ↗ · 2026-08-30

本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。

0 人收藏 0 人点赞
#sparse-attention

GLM-5.3 在 HF Viewer 中

Reddit r/LocalLLaMA ↗ · 2026-08-28

GLM-5.3 是一个与 GLM-5.2 架构相同的 AI 模型,通过训练取得了显著改进,现在可在 HF Viewer 中可视化,展示稀疏注意力和 MoE 路由等复杂功能。

0 人收藏 0 人点赞
#sparse-attention

腾讯/Hy4-preview 770B-A49B 模型权重发布

Reddit r/LocalLLaMA ↗ · 2026-08-28 缓存

腾讯发布Hy4-preview,这是一款新的旗舰AI模型,采用混合专家架构,总参数为770B,每个token激活49B参数,具备如Gated DeepSeek Sparse Attention和identity Hyper-Connections等先进技术。

0 人收藏 0 人点赞
#sparse-attention

ClusterAttention:一种无训练双向注意力加速方法

arXiv cs.LG ↗ · 2026-08-28 缓存

本文介绍了ClusterAttention,这是一种无训练方法,通过使用递归聚类实现块稀疏注意力,加速Transformer模型中的双向注意力。在表格数据上实现了2-6倍的加速,在视频生成上实现了1.8倍的加速,同时保持了高准确度。

0 人收藏 0 人点赞
#sparse-attention

信任质量:KV-Cache淘汰中的强制权重

arXiv cs.LG ↗ · 2026-08-27 缓存

本文分析了稀疏注意力模型中的KV-Cache淘汰策略,表明选择最大权重近乎最优,且已发表的差距源于内存和查询信息,其中ContourKV取得了强劲性能。

0 人收藏 0 人点赞
#sparse-attention

FastVideo/FastVideo-FastH3-四步-预览版-v1-VSA-无数据

Hugging Face Models Trending ↗ · 2026-08-27 缓存

FastVideo 发布 FastH3 预览版 v1,这是一个 AI 模型检查点,能够从文本生成同步视频和音频,使用四次 Transformer 前向传播,通过无数据 DMD2 和 VSA-H3 在 90% 稀疏度下训练。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈