@no_stp_on_snek:在自定义Rust内核和Swift调度领域忙碌的一晚。9个PR中有3个是真正新增或修改的Metal内核……

X AI KOLs Timeline 工具

摘要

在自定义Rust内核和Swift调度逻辑的优化下,Qwen3.6-35b-A3B模型的预填速度在2k提示下从255 tok/s提升到1058 tok/s,实现了约4倍的加速,解码和困惑度未受影响。

在自定义Rust内核和Swift调度领域忙碌的一晚。 9个PR中有3个是真正新增或修改的Metal内核。另外6个是Swift端的调度逻辑,用于连接这些内核或重构现有内核的调用方式。 净效果:qwen3.6-35b-a3b的预填速度在2k提示下从255 tok/s提升到1058 tok/s,大约4倍。解码和困惑度没有变化。 还有很多工作要做。
查看原文
查看缓存全文

缓存时间: 2026/07/07 05:25

繁忙的夜晚,涉及自定义Rust内核和Swift调度逻辑。

9个PR中有3个是全新或修改后的金属内核。另外6个是Swift端的调度逻辑,要么负责连接这些内核,要么重构现有内核的调用方式。

最终效果:Qwen3.6-35b-a3b的预填充速度从255 tok/s提升到1058 tok/s(2K提示长度下),大约提升了4倍。解码速度和困惑度保持不变。

仍有大量工作要做。

相似文章

Qwen3.6:35b UD Q4_K_M 在 Nvidia P40 上实现 80 tok/s

Reddit r/LocalLLaMA

一位用户分享在单个 Nvidia P40 上使用 TheTom 的 TurboQuant 版 llama.cpp,以 Q4_K_M 量化方式和 100k 上下文运行 Qwen3.6 35B 模型,实现了 80 tok/s,并强调了多种优化。