Qwen3.8-Flash-Next 针对 Mac 优化版
摘要
本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。
在 M1 Max 64 GB 上运行: - 张量的 SSD 流 - engrams 的 SSD 流 - MTP 的 SSD 流 这怎么可能? * 自定义 Q4 量化:对所有 Metal 张量进行基准测试,然后从多个 Unsloth 和 AtomicChat 量化中挑选并拼接张量,以实现最佳性能/位。 * 开发了自定义的 Metal 优化稀疏注意力机制,具有几乎线性的退化,而非标准的 llama.cpp 二次注意力。 * 使用 Q4_0 MTP - 与 unsloth Q8_0 相同的接受率,但 RAM 减半。 * 动态 MTP 推测大小 - 导致在上下文大小使 MTP 变为负面影响时禁用 MTP。 * 对 Metal 内核、qwen 图和 qwen 索引器的各种修复。 https://github.com/mihailescu2m/llama.cpp 特别感谢 Claude - 三周的代币和一些额外的自费使用积分使这一切成为可能。 欢迎反馈。 注意:启用 MTP 使用更多 RAM,这意味着用于张量的缓存减少,导致预填充从 180 tps 降至 170 tps(在 4K 时)。 对于 256K 上下文,KV 缓存需要更多 RAM,预填充降至 150 tps。 但使用 MTP,解码提升 +70%,达到 22 btps。 因此,如果您需要最高的预填充,请禁用 MTP。 A
相似文章
在128 GB M5 Max上运行Qwen3.8-Flash-Next(79 GB,2-bit)以350K上下文持续3.5小时——速度与上下文深度权衡,100轮对话,一张图表
本文报告了在MacBook Pro M5 Max上运行Qwen3.8-Flash-Next模型的情况,对100轮对话中速度与上下文深度进行基准测试,并深入分析性能及长上下文下角色混淆等问题。
Show HN: 在48GB Mac上运行104GB Qwen3.8-Flash-Next,速度约12 tok/s
slotstream 是一个开源工具,它通过从SSD流式传输模型权重,使得在内存有限的Mac上运行像Qwen3.8-Flash-Next这样的大型AI模型成为可能,在48GB Mac上实现了大约12 tokens每秒的速度。
Qwen3.8-Flash-Next: 一种新架构,迈向极致成本效率
Qwen3.8-Flash-Next 引入了一种新的人工智能架构,专注于实现模型性能的极致成本效率。
Qwen3.8-Flash-Next. 一旦权重发布,这个架构可能会出人意料地适合本地运行。 👀
本文提供了Qwen3.8-Flash-Next模型的内存估计,表明通过量化技术,它可能适合本地运行。
Qwen3.8-Next 流式传输 - M5 Air 上预填充 150 tps,解码 3.6 tps
一位用户在 Apple M5 Air 上测试了 Qwen3.8-Next 模型,采用 3 位量化,实现了预填充 150 令牌/秒和解码 3.6 令牌/秒,在某些指标上超过了密集 270 亿参数模型。