标签
作者在本地新机器上使用Qwen3.6-35B-A3B模型和oMLX工具进行日常任务,发现速度和效果远超预期,甚至在PA和Coding场景下优于远程LLM,体现了端侧AI能力的显著提升。
为exo本地推理工具添加了对Qwen3.6 MLX模型的原生多token预测(MTP)支持,在M5 Max笔记本上对27B模型实现了高达2倍的加速,同时保持精确度。