极高的解码速度(tok/s)真的有用吗?
摘要
讨论:对于Qwen 3.5 397B或GLM-5.2等大模型,极高的解码速度(1k-10k tok/s)是否能解锁新的应用场景,还是更适合用来加载更大的模型。
如果你有一台推理机器,能以1k tok/s甚至10k tok/s的速度进行解码,那真的有用吗?它能解锁新的应用场景吗?假设这是针对真正有用的模型,且是像Qwen 3.5 397B、GLM-5.2这样相当大的模型。或者,在这种速度下,是不是还不如用来加载更大的模型?如果是这样,问题仍然适用。例如,高速下的Kimi K3。
相似文章
2倍 tok/s(在1块MI50上从19.4 tok/s提升到38.1 tok/s)尝试类似推测解码的假设……但不是用额外的侧模型,而是利用我可以同时运行多个计算,就好像内存里加载了两份Qwen3.6-27B一样——小量化不占用所有可用算力。
打包双推理(PTI)是一种通过单批解码中运行多个token序列来实现约2倍LLM吞吐量的技术,它利用了llama.cpp中的权重共享,无需草稿模型或额外VRAM。
优化模型以快速进行代码生成(8分钟阅读)
Morph LLC描述了三种关键技术——基于编码输出训练投机模型、在廉价GPU上自动搜索内核、以及编写自定义互连——以大幅加速像Qwen和DeepSeek这样的开放模型在编码代理工作负载上的运行,实现了最高3倍的投机解码加速,并在7000美元的GPU上达到97-162 tok/s。
运行 Qwen 3.6 27B 在 5-10 tok/s 的最低成本方案是什么(不使用投机解码)?
一个关于在不使用投机解码的情况下,以最低成本运行 Qwen 3.6 27B 达到 5-10 tok/s 的问题,聚焦于推理优化和成本降低。
@iotcoi:Qwen3.6-27B-FP8 + Dflash + DDTree,256k 上下文,10 个智能体,单颗 49W GB10 上峰值 200 tokens/s,平均解码 136 tokens/s
量化版 27B Qwen3.6 在单颗 49W GB10 GPU 上借助 Dflash+DDTree 优化,256k 上下文、10 智能体并发,峰值达 200 tok/s,平均 136 tok/s。
@zephyr_z9: 这太重要了,我认为这是第一个实用的推测解码方法,部署在大型准前沿模型上 M…
小米 MiMo 发布 MiMo-V2.5-Pro-UltraSpeed,通过推测解码在 1 万亿参数模型上实现每秒超过 1000 个 token,这是首次大规模实际部署如此速度。