在空气中超越光速:32GB M4 MacBook Air上的8-22 tg/s Qwen3.8-Flash-Next (Q4/Q4ish)

Reddit r/LocalLLaMA 工具

摘要

Cherenkov是一个新的Apple Silicon推理引擎,使用预测专家流和混合精度执行,实现对像Qwen3.8-Flash-Next这样的大型AI模型的高效内存受限推理。

我相信我可能目前保持着在Apple Silicon上对Qwen3.8–Flash-Next进行内存受限推理的记录——仅需约21GB的分配。介绍Cherenkov,一个结合预测专家流和可选混合精度执行的Apple Silicon推理引擎。它通过在统一内存中保持一个有界的专家工作集来工作,而不是加载整个模型。一个一层前瞻预测下一个需要的专家并启动SSD读取。如果没有足够的时间加载完整的目标专家,Cherenkov可选地回退到即时加载更小的Q3/Q2量化版本。
查看原文

相似文章

Qwen3.8-Flash-Next 针对 Mac 优化版

Reddit r/LocalLLaMA

本文详细介绍了在 Mac M1 Max 硬件上运行 Qwen3.8-Flash-Next AI 模型的自定义优化,包括 SSD 流、自定义量化和稀疏注意力机制,以提升性能。