标签
SMat-Attention 引入了具有可调 VC 维度的结构化因果掩码,在 softmax attention 与 linear attention 之间架起桥梁,实现了亚二次方的 prefill、常数时间的解码(缓存状态为 O(T^{1-1/d})),并在召回能力上优于 Mamba-2 和 Gated DeltaNet 等骨干网络。
WorldAttention 提出了一种高效的注意力架构,采用 Hybrid Sparse Attention 和 Hierarchical KV Cache,用于交互式视频世界模型,在 VBench-Long 和 InterVBench 等基准测试上实现了最先进的性能。
本文分析了循环语言模型中注意力路由的演变,并提出了WISE,一种无需训练的推理方法,该方法重用已稳定的稀疏注意力支持,以实现高达1.76倍的注意力加速,同时在多跳问答基准测试上保持性能。
Elastic Threshold Attention (ETA) 是一种可训练的稀疏注意力架构,它通过使用从查询表示中预测的动态阈值,在不降低质量的情况下提高长上下文解码速度。
RBS-Attention引入了一种无需训练的稀疏预填充方法,采用双分支选择来缓解长上下文LLM推理中的均值稀释问题,在H100 GPU上实现最高20.65倍加速,同时在基准测试中保持接近稠密模型的质量。
本文介绍了 Adaptive-Scalable Entmax (ASEntmax),一种可学习的稀疏注意力机制,在transformers中实现高达1000倍的长度外推,提升长上下文泛化能力的同时保持短上下文性能。
HiSparse 和稀疏注意力技术正被集成到 vLLM 中,以减少内存使用并提高并发性,从而提升强化学习的推理吞吐量。
这篇论文介绍了声明式注意力,一种允许语言模型声明其在思维链中关注位置的协议,在 Gemma-4-31B 上减少 52% 的关注令牌,在 Qwen-3.6-27B 上减少 31.1%,精度损失最小。
Arize Phoenix 推出了M3,它增加了稀疏注意力和1M令牌上下文窗口,通过将长工具历史保留在上下文中来减少AI智能体的延迟和成本。
CRISP 引入了一种方法,通过使用结构化路由解决噪声累积问题,改进长上下文LLM推理中的稀疏预填充,在检索任务上实现了加速和性能提升。
本文介绍了Graph Machine,一种通过动态指针将Transformer中的密集注意力层替换为稀疏层的方法,从而在预训练期间提高效率并保持或增强性能。
本文介绍了一种名为Declarative Attention的方法,该方法使语言模型能够在推理时声明相关上下文区域,从而显著减少键值缓存的读取次数,在长上下文任务中仅带来轻微的精度损失。
RouteSparse 是一种用于长上下文预填充的输入条件模式路由方法,与密集注意力相比,在最小精度损失下实现了高达6.5倍的加速。
本文介绍了Qwen3.8-Flash-Next,一种稀疏混合专家AI模型,通过混合注意力和n-gram嵌入等架构创新,提升了效率、能力和训练稳定性。
本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。
GLM-5.3 是一个与 GLM-5.2 架构相同的 AI 模型,通过训练取得了显著改进,现在可在 HF Viewer 中可视化,展示稀疏注意力和 MoE 路由等复杂功能。
腾讯发布Hy4-preview,这是一款新的旗舰AI模型,采用混合专家架构,总参数为770B,每个token激活49B参数,具备如Gated DeepSeek Sparse Attention和identity Hyper-Connections等先进技术。
本文介绍了ClusterAttention,这是一种无训练方法,通过使用递归聚类实现块稀疏注意力,加速Transformer模型中的双向注意力。在表格数据上实现了2-6倍的加速,在视频生成上实现了1.8倍的加速,同时保持了高准确度。
本文分析了稀疏注意力模型中的KV-Cache淘汰策略,表明选择最大权重近乎最优,且已发表的差距源于内存和查询信息,其中ContourKV取得了强劲性能。
FastVideo 发布 FastH3 预览版 v1,这是一个 AI 模型检查点,能够从文本生成同步视频和音频,使用四次 Transformer 前向传播,通过无数据 DMD2 和 VSA-H3 在 90% 稀疏度下训练。