极高的解码速度(tok/s)真的有用吗?

Reddit r/LocalLLaMA 新闻

摘要

讨论:对于Qwen 3.5 397B或GLM-5.2等大模型,极高的解码速度(1k-10k tok/s)是否能解锁新的应用场景,还是更适合用来加载更大的模型。

如果你有一台推理机器,能以1k tok/s甚至10k tok/s的速度进行解码,那真的有用吗?它能解锁新的应用场景吗?假设这是针对真正有用的模型,且是像Qwen 3.5 397B、GLM-5.2这样相当大的模型。或者,在这种速度下,是不是还不如用来加载更大的模型?如果是这样,问题仍然适用。例如,高速下的Kimi K3。
查看原文

相似文章

优化模型以快速进行代码生成(8分钟阅读)

TLDR AI

Morph LLC描述了三种关键技术——基于编码输出训练投机模型、在廉价GPU上自动搜索内核、以及编写自定义互连——以大幅加速像Qwen和DeepSeek这样的开放模型在编码代理工作负载上的运行,实现了最高3倍的投机解码加速,并在7000美元的GPU上达到97-162 tok/s。