Qwen3.8-Flash-Next 针对 Mac 优化版

Reddit r/LocalLLaMA 模型

摘要

本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。

在 M1 Max 64 GB 上运行: - 张量的 SSD 流 - engrams 的 SSD 流 - MTP 的 SSD 流 这怎么可能? * 自定义 Q4 量化:对所有 Metal 张量进行基准测试,然后从多个 Unsloth 和 AtomicChat 量化中挑选并拼接张量,以实现最佳性能/位。 * 开发了自定义的 Metal 优化稀疏注意力机制,具有几乎线性的退化,而非标准的 llama.cpp 二次注意力。 * 使用 Q4_0 MTP - 与 unsloth Q8_0 相同的接受率,但 RAM 减半。 * 动态 MTP 推测大小 - 导致在上下文大小使 MTP 变为负面影响时禁用 MTP。 * 对 Metal 内核、qwen 图和 qwen 索引器的各种修复。 https://github.com/mihailescu2m/llama.cpp 特别感谢 Claude - 三周的代币和一些额外的自费使用积分使这一切成为可能。 欢迎反馈。 注意:启用 MTP 使用更多 RAM,这意味着用于张量的缓存减少,导致预填充从 180 tps 降至 170 tps(在 4K 时)。 对于 256K 上下文,KV 缓存需要更多 RAM,预填充降至 150 tps。 但使用 MTP,解码提升 +70%,达到 22 btps。 因此,如果您需要最高的预填充,请禁用 MTP。 A
查看原文

相似文章