@danyurkin: i don't think i need cloud models anymore

X AI KOLs Following News

Summary

A tweet demonstrates that Multi-Token Prediction (MTP) achieves significant speedups for Qwen models on dual RTX 5090 hardware, suggesting that local inference can now rival cloud-model performance.

i don't think i need cloud models anymore
Original Article
View Cached Full Text

Cached at: 05/22/26, 09:45 AM

i don’t think i need cloud models anymore

atomic.chat (@atomic_chat_hq): MTP speedup Qwen by 2.5x in Atomic Chat

Dense vs MoE models on 2x RTX 5090 Qwen3.6 27B: 51 → 117 tps +137% Qwen3.6 35B-A3B: 218 → 267 tps +25%

MTP drafts several tokens ahead and verifies them in one pass. The speedup depends on memory moved per pass. Dense 27B reads all 27B

Similar Articles