在空气中超越光速:32GB M4 MacBook Air上的8-22 tg/s Qwen3.8-Flash-Next (Q4/Q4ish)
摘要
Cherenkov是一个新的Apple Silicon推理引擎,使用预测专家流和混合精度执行,实现对像Qwen3.8-Flash-Next这样的大型AI模型的高效内存受限推理。
我相信我可能目前保持着在Apple Silicon上对Qwen3.8–Flash-Next进行内存受限推理的记录——仅需约21GB的分配。介绍Cherenkov,一个结合预测专家流和可选混合精度执行的Apple Silicon推理引擎。它通过在统一内存中保持一个有界的专家工作集来工作,而不是加载整个模型。一个一层前瞻预测下一个需要的专家并启动SSD读取。如果没有足够的时间加载完整的目标专家,Cherenkov可选地回退到即时加载更小的Q3/Q2量化版本。
相似文章
Qwen3.8-27B在M5 Max MacBook Pro上实现144 tok/s速度
Inco Splash是一款针对Apple silicon优化的开源推理引擎,在M系列MacBook上运行Qwen3.8-27B等AI模型时提供了显著的速度提升。
Qwen3.8-Flash-Next 针对 Mac 优化版
本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。
Show HN: 在48GB Mac上运行104GB Qwen3.8-Flash-Next,速度约12 tok/s
slotstream 是一个开源工具,它通过从SSD流式传输模型权重,使得在内存有限的Mac上运行像Qwen3.8-Flash-Next这样的大型AI模型成为可能,在48GB Mac上实现了大约12 tokens每秒的速度。
Qwen3.8-Flash-Next (95.5 GiB) 在 64GB Mac 上以约 27 tok/s 运行,检查点与叉版本
作者优化了 Qwen3.8-Flash-Next 模型,使其能在 64GB Mac 上运行,使用专家流式处理和其他技术,通过发布检查点和 llama.cpp 叉版本达到约 27 tok/s 的速度。
在4080与64GB DDR5上运行Qwen Flash Q4_K_M,约8tk/s,98304上下文。
作者演示了如何在4080 GPU和64GB DDR5上运行182B的Qwen模型,通过将ngrams转移到SSD,实现了比27B模型更快、更智能的性能,使大型模型推理在消费级硬件上变得可行。