@WescheNex1q: 16人同时与Qwen3.6-35B聊天,仅用一台DGX Spark。这是真实截图,并非模拟:您看到的每个token均…

X AI KOLs Timeline 模型

摘要

一个实时演示展示了16个并发用户在同一台DGX Spark上与Qwen3.6-35B聊天,使用vLLM上的NVFP4 + MTP-3,达到总峰值440 tok/s,每用户105 tok/s。

16人同时与Qwen3.6-35B聊天 一台DGX Spark。 这是真实截图,并非模拟:您看到的每个token都会按实际测量的到达时间回放。总峰值约440 tok/s。单个用户获得105 tok/s。 NVFP4 + MTP-3 on vLLM. https://t.co/lwmYWrvYAP
查看原文
查看缓存全文

缓存时间: 2026/07/09 21:52

16人同时与Qwen3.6-35B聊天

一台DGX Spark。

这是真实截图,非模拟:你看到的每个token都按实际测得的到达时间回放。峰值约440 tok/s。单个用户可获得105 tok/s。 在vLLM上使用NVFP4 + MTP-3。https://t.co/lwmYWrvYAP

相似文章