@no_stp_on_snek: 与此同时,我们其他人都在埋头苦干。我现在正试图为mlx-swift-lm解决稀疏注意力问题。进展不错……

X AI KOLs Following 工具

摘要

开发者报告在mlx-swift-lm中实现稀疏注意力的进展,在M5 Max上仅比密集注意力多4%的开销。

@AlexJonesax 与此同时,我们其他人都在埋头苦干。我现在正试图为mlx-swift-lm解决稀疏注意力问题。进展不错。已将稀疏注意力的开销降低到在m5 max上仅比密集注意力多4%。
查看原文
查看缓存全文

缓存时间: 2026/05/16 07:15

@AlexJonesax,与此同时我们其他人还在埋头苦干。我现在正尝试为 mlx-swift-lm 解决稀疏注意力问题,进展不错。在 M5 Max 上已经把稀疏注意力的开销控制到只比密集注意力高 4%。

相似文章

MiniMax 稀疏注意力

Hugging Face Daily Papers

MiniMax 稀疏注意力 引入了一种分块稀疏注意力机制,针对超长上下文的大语言模型实现了显著的加速。在1M上下文长度下,每个token的注意力计算减少28.4倍,在H800 GPU上预填充阶段实际速度提升14.2倍,解码阶段提升7.6倍。该方法附带了一个开源推理内核以及一个公开发布的多模态模型。