@atomic_chat_hq: MTP 将 Qwen 速度提升 2.5 倍,在 Atomic Chat 中稠密模型与 MoE 模型在双 RTX 5090 上 Qwen3.6 27B: 51 → 117 tps +137% Qwen3.6 35B-…

X AI KOLs Timeline 工具

摘要

Atomic Chat 的 MTP 技术利用推测解码,在双 RTX 5090 上将 Qwen 稠密模型的速度提升 2.5 倍,MoE 模型提升 25%,同时保持零精度损失,仅增加约 1 GB 显存,通过一次前向传播草拟并验证多个 token。

MTP 在 Atomic Chat 中将 Qwen 速度提升 2.5 倍 在双 RTX 5090 上的稠密模型与 MoE 模型 Qwen3.6 27B: 51 → 117 tps +137% Qwen3.6 35B-A3B: 218 → 267 tps +25% MTP 提前草拟多个 token 并在一次前向传播中进行验证。加速效果取决于每次前向传播所移动的内存。稠密模型 27B 每 token 读取全部 27B 参数,而 MoE 35B-A3B 仅读取 3B 活跃参数。稠密模型通过批处理节省了更多内存。 基准 tps 也不同(218 对 51),原因同样来自另一方面。Token 生成受内存带宽限制,MoE 每 token 移动的内存少约 8 倍,因此其基准已经领先 4 倍。 约 80% 的草稿接受率。零精度损失。约 1 GB 额外显存。 开源代码及本地 AI 应用 – 见评论
查看原文
查看缓存全文

缓存时间: 2026/05/21 08:24

MTP 在 Atomic Chat 中将 Qwen 加速 2.5 倍

在 2× RTX 5090 上的密集模型与 MoE 模型对比 Qwen3.6 27B:51 → 117 tps,提升 137% Qwen3.6 35B-A3B:218 → 267 tps,提升 25%

MTP 会预先起草多个 token,并在一次前向中验证它们。加速效果取决于每次前向移动的内存。密集模型 27B 每 token 读取全部 27B 参数,而 MoE 35B-A3B 仅读取 3B 活跃参数。密集模型通过批处理能节省更多。

基准 tps 也不同(218 vs 51),同样出于另一方面的原因。Token 生成受限于内存带宽,MoE 每 token 移动约 8 倍更少的内存,因此其基准已经领先 4 倍。

约 80% 的草稿被接受。零精度损失。额外占用约 1 GB 显存。

开源代码与本地 AI 应用 —— 详见评论区

相似文章

@Snixtp: https://x.com/Snixtp/status/2055734339346768225

X AI KOLs Timeline

某用户使用llama.cpp在单张RTX 3090上对Qwen3.6 27B的MTP变体与普通版本进行了基准测试,发现MTP在长上下文(32k-64k)下生成速度最高可提升2.37倍,但预填充较慢且暂不支持并发。