@no_stp_on_snek: 与此同时,我们其他人都在埋头苦干。我现在正试图为mlx-swift-lm解决稀疏注意力问题。进展不错……
摘要
开发者报告在mlx-swift-lm中实现稀疏注意力的进展,在M5 Max上仅比密集注意力多4%的开销。
查看缓存全文
缓存时间: 2026/05/16 07:15
@AlexJonesax,与此同时我们其他人还在埋头苦干。我现在正尝试为 mlx-swift-lm 解决稀疏注意力问题,进展不错。在 M5 Max 上已经把稀疏注意力的开销控制到只比密集注意力高 4%。
相似文章
@rohanpaul_ai: 相当惊人,MiniMax Sparse Attention 在100万token时将注意力计算量减少28.4倍,预填充速度提升14.2倍,以及…
MiniMax Sparse Attention (MSA) 通过增加一个路由分支,选择性选择键值块进行注意力计算,在100万token时实现了注意力计算量最高减少28.4倍,在H800 GPU上实现了14.2倍更快的预填充和7.6倍更快的解码,同时匹配全注意力基准性能。
@no_stp_on_snek: 还有人谈论 mlx-swift-lm 吗?说我在休息一天……清理了鸡舍,锻炼了一下,然后…
作者描述了将 TurboQuant KV-cache 压缩集成到 Apple 的 mlx-swift-lm 中,实现了 2.7 倍压缩,质量与 8-bit 相当,并通过融合 Metal 内核将解码速度提升了 3-4 倍。
MiniMax 稀疏注意力
MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。
全注意力回归:在百步训练内将全注意力转化为稀疏注意力
RTPurbo 仅需数百步训练即可将全注意力大语言模型转化为稀疏模型,实现接近无损的准确率,并在预填充阶段最高提速 9.36 倍,解码阶段最高提速 2.01 倍。
@no_stp_on_snek: vllm-swift 0.6.3 和 longctx 0.3.2 已发布。亮点:triattentionv3 + longctx rescue path 在 Apple Silicon 上达到 256K NIAH…
vllm-swift 0.6.3 和 longctx 0.3.2 版本带来了 triattentionv3,在 Apple Silicon 上支持 256K 上下文;Gemma 4 MTP drafter 支持;带有自动恢复的 Hermes tool calling;以及用于扩展到 12M token 语料的 longctx-svc 守护进程。