@atomic_chat_hq: MTP 将 Qwen 速度提升 2.5 倍,在 Atomic Chat 中稠密模型与 MoE 模型在双 RTX 5090 上 Qwen3.6 27B: 51 → 117 tps +137% Qwen3.6 35B-…
摘要
Atomic Chat 的 MTP 技术利用推测解码,在双 RTX 5090 上将 Qwen 稠密模型的速度提升 2.5 倍,MoE 模型提升 25%,同时保持零精度损失,仅增加约 1 GB 显存,通过一次前向传播草拟并验证多个 token。
查看缓存全文
缓存时间: 2026/05/21 08:24
MTP 在 Atomic Chat 中将 Qwen 加速 2.5 倍
在 2× RTX 5090 上的密集模型与 MoE 模型对比 Qwen3.6 27B:51 → 117 tps,提升 137% Qwen3.6 35B-A3B:218 → 267 tps,提升 25%
MTP 会预先起草多个 token,并在一次前向中验证它们。加速效果取决于每次前向移动的内存。密集模型 27B 每 token 读取全部 27B 参数,而 MoE 35B-A3B 仅读取 3B 活跃参数。密集模型通过批处理能节省更多。
基准 tps 也不同(218 vs 51),同样出于另一方面的原因。Token 生成受限于内存带宽,MoE 每 token 移动约 8 倍更少的内存,因此其基准已经领先 4 倍。
约 80% 的草稿被接受。零精度损失。额外占用约 1 GB 显存。
开源代码与本地 AI 应用 —— 详见评论区
相似文章
RTX 5080 16GB:Qwen3.6 35B MoE 在 128k 上下文下的表现——56 tok/s,以及 MTP 为何无济于事
Qwen3.6 35B MoE 在 RTX 5080 16GB 上的详细基准测试表明,MTP(多令牌预测)由于显存限制,在 128k 上下文中无法提升推理速度;最佳配置为不带 MTP 的 Q4_K_XL,在 128k 上下文下生成速度约 56 tok/s。
@Snixtp: https://x.com/Snixtp/status/2055734339346768225
某用户使用llama.cpp在单张RTX 3090上对Qwen3.6 27B的MTP变体与普通版本进行了基准测试,发现MTP在长上下文(32k-64k)下生成速度最高可提升2.37倍,但预填充较慢且暂不支持并发。
Qwen3.6 27B 在 RTX 5090 上,调整 MTP/缓存设置后的 6.4k 采样 token/s 分布
在 RTX 5090 上运行 Qwen3.6 27B,调整 MTP 和缓存设置后达到每秒 6.4k 个 token,展示了推理优化技术。
成功运行 MTP + TurboQuant — Qwen3.6-27B 在单 RTX 4090 上实现 262K 上下文 80+ token/秒
开发者通过将 MTP(多 Token 预测)与 TurboQuant 的无损 KV缓存压缩技术相结合,在单张 RTX 4090 上实现了 Qwen3.6-27B 模型在 262K 上下文下 80+ token/秒的推理速度,并分享了实现分支和技术细节。
@atomic_chat_hq: 在本地运行1位Hy3,速度比其API快2.2倍,质量相同!我们为两个模型分配了相同的任务并比较…
腾讯的Hy3 295B模型现已提供1位和4位GGUF格式,相比云端API,本地推理速度提升2.2倍,同时保持质量,如在4块RTX 5090显卡(128GB显存)上所展示的。