@ModelScope2022: 每 token 仅激活约 3B 参数,即可支持 1M token 上下文。Meituan 的 LongCat-Flash-Lite-Sparse 带来稀疏注意力……

X AI KOLs Timeline 模型

摘要

Meituan 发布了 LongCat-Flash-Lite-Sparse,这是一款稀疏注意力模型,支持 1M token 上下文,每 token 仅激活约 3B 参数,在 MIT 许可下取得了强劲的 SWE-Bench 成绩。

每 token 仅激活约 3B 参数即可支持 1M token 上下文。Meituan 的 LongCat-Flash-Lite-Sparse 将稀疏注意力引入长上下文智能体。 https://modelscope.ai/models/meituan-longcat/LongCat-Flash-Lite-Sparse… 该稀疏变体在 SWE-Bench Verified 上得分为 68.2,在 SWE-Bench Multilingual 上得分为 59.33,而其密集前代分别为 54.4 和 38.1。 LongCat Sparse Attention 结合了流式感知、跨层和分层索引,在保持模型质量的同时减少长上下文计算。 总参数 69B。MIT 许可。
查看原文
查看缓存全文

缓存时间: 2026/08/03 13:43

仅约 3B 参数活跃即可处理 1M token 上下文。美团的 LongCat-Flash-Lite-Sparse 将稀疏注意力引入长上下文智能体。 https://modelscope.ai/models/meituan-longcat/LongCat-Flash-Lite-Sparse…

该稀疏变体在 SWE-Bench Verified 上得分为 68.2,在 SWE-Bench Multilingual 上得分为 59.33,而此前稠密版本分别为 54.4 和 38.1。 LongCat 稀疏注意力结合了流感知、跨层和分层索引,以在降低长上下文计算量的同时保持模型质量。 总参数 69B。MIT 许可证。

相似文章

MiniMax 稀疏注意力

Hugging Face Daily Papers

MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。