@ModelScope2022: 每 token 仅激活约 3B 参数,即可支持 1M token 上下文。Meituan 的 LongCat-Flash-Lite-Sparse 带来稀疏注意力……
摘要
Meituan 发布了 LongCat-Flash-Lite-Sparse,这是一款稀疏注意力模型,支持 1M token 上下文,每 token 仅激活约 3B 参数,在 MIT 许可下取得了强劲的 SWE-Bench 成绩。
查看缓存全文
缓存时间: 2026/08/03 13:43
仅约 3B 参数活跃即可处理 1M token 上下文。美团的 LongCat-Flash-Lite-Sparse 将稀疏注意力引入长上下文智能体。 https://modelscope.ai/models/meituan-longcat/LongCat-Flash-Lite-Sparse…
该稀疏变体在 SWE-Bench Verified 上得分为 68.2,在 SWE-Bench Multilingual 上得分为 59.33,而此前稠密版本分别为 54.4 和 38.1。 LongCat 稀疏注意力结合了流感知、跨层和分层索引,以在降低长上下文计算量的同时保持模型质量。 总参数 69B。MIT 许可证。
相似文章
@eliebakouch: 该模型引入的新型稀疏注意力方法基本上是对现有方法组件的组合……
美团推出了 LongCat-2.0,这是一个 1.6 万亿参数的 MoE 模型,拥有 480 亿活跃参数和 100 万上下文长度,采用了新的 LongCat 稀疏注意力(LSA)方法,该方法结合了现有稀疏注意力技术的组件。
@Meituan_LongCat:介绍 LongCat-2.0 1.6万亿参数 · MoE 约480亿活跃参数 · 100万上下文。这是 Owl Alpha 在 @OpenRouter 背后的完整模型…
Meituan 推出 LongCat-2.0,一个拥有 1.6万亿参数的 MoE 模型,约480亿活跃参数,支持100万上下文。该模型采用了 LongCat Sparse Attention 和 Zero-Compute Experts 等新颖架构,在编码和推理任务的基准测试中取得了优异成绩。
美团在API上推出1.6万亿参数的LongCat-2.0模型(2分钟阅读)
美团推出了LongCat-2.0,这是一个1.6万亿参数的混合专家模型,具有100万token的上下文窗口,可通过API用于智能编码、工具使用和复杂工作流。
MiniMax 预告即将推出的 M3 模型:全新稀疏注意力机制,长上下文响应速度提升 15.6 倍(12 分钟阅读)
MiniMax 发布了关于其 M2 系列的详细技术报告,并预告了即将推出的 M3 模型。该模型采用一种新颖的稀疏注意力机制,在百万 token 上下文中实现高达 15.6 倍的解码速度提升。
MiniMax 稀疏注意力
MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。