标签
MiniMax M3通过稀疏注意力保持上下文成本可预测且低廉,使500KToken的上下文在质量损失极小的情况下实现显著的速度提升,从而让长程智能体变得实用。
讨论的是 MiniMax M3 在 GGUF 格式中尚未支持稀疏注意力,因此推理回退到密集注意力,可能每一步都使用全部 428B 权重,导致显著减速。