@no_stp_on_snek: 感谢 @_EldarKurtic、@mgoin_ 和 @RedHat_AI 关于 TurboQuant 的详尽报告。H100 上原生 F… 的数据
摘要
一次技术讨论验证了在配备 FP8 Tensor Core 的 NVIDIA H100 GPU 上 TurboQuant 的性能数据,并承诺将带来非 H100 测试的更多见解。
感谢 @_EldarKurtic、@mgoin_ 和 @RedHat_AI 关于 TurboQuant 的详尽报告。在配备原生 FP8 Tensor Core 的 H100 上,数据对于所测试的内容看起来是正确的。还想补充一些非 H100 方面的情况,我的大部分测试都在那里:
相似文章
@_EldarKurtic: TurboQuant 近期备受瞩目,但随附的评测并未讲述全部故事。因此我们运行了……
Eldar Kurtic 带来了一项针对 TurboQuant 的综合研究,揭示了其超越初期评估之外的、在精度、延迟及吞吐量方面的真实世界影响。
@no_stp_on_snek: @antirez Turbo3 击败 fp8,在32K上下文下解码 tok/s 提升5%,还在调试中,但我一直在你的‘厨房’里折腾 TQ+
Turbo3 在32K上下文下,相比 fp8 解码速度提升了5%(每秒 tokens 数),这是量化或模型优化方面的性能改进。
成功运行 MTP + TurboQuant — Qwen3.6-27B 在单 RTX 4090 上实现 262K 上下文 80+ token/秒
开发者通过将 MTP(多 Token 预测)与 TurboQuant 的无损 KV缓存压缩技术相结合,在单张 RTX 4090 上实现了 Qwen3.6-27B 模型在 262K 上下文下 80+ token/秒的推理速度,并分享了实现分支和技术细节。
@rumgewieselt:现在变得疯狂了……三块 1080 Ti(Pascal架构,33GB VRAM)Qwen 3.6 27B MTP 搭配 196K TurboQuant,持续 ~28-30 t/s
一位用户成功在三个 GTX 1080 Ti GPU 上对 27B 参数的 Qwen 模型进行本地推理,通过 TurboQuant 优化达到了约 28-30 tokens/秒的速度。
@MichaelGannotti: https://x.com/MichaelGannotti/status/2074486390432149979
对NVIDIA的Nemotron-3 Mamba-Transformer混合模型在DGX Spark硬件上的全栈评估,包括架构分析、量化(NVFP4)、基准测试结果,以及开源测试套件smf-bench的介绍。