@WescheNex1q: 16人同时与Qwen3.6-35B聊天,仅用一台DGX Spark。这是真实截图,并非模拟:您看到的每个token均…
摘要
一个实时演示展示了16个并发用户在同一台DGX Spark上与Qwen3.6-35B聊天,使用vLLM上的NVFP4 + MTP-3,达到总峰值440 tok/s,每用户105 tok/s。
查看缓存全文
缓存时间: 2026/07/09 21:52
16人同时与Qwen3.6-35B聊天
一台DGX Spark。
这是真实截图,非模拟:你看到的每个token都按实际测得的到达时间回放。峰值约440 tok/s。单个用户可获得105 tok/s。 在vLLM上使用NVFP4 + MTP-3。https://t.co/lwmYWrvYAP
相似文章
今日在双DGX Spark上运行Qwen3.8-Flash-Next时聚合吞吐量达到181 tok/s
使用2台DGX Spark集群,通过NVMe映射和推测解码等优化,在Qwen3.8-Flash-Next模型上实现了181令牌每秒的聚合吞吐量。
@onusoz: 16路并行 Gemma-4-26B-A4B-NVFP4 运行,每路18输出 token/s,合计300 tok/s 一台配备128GB统一内存的DGX Spark…
@onusoz 展示了在单一 DGX Spark(128GB统一内存)上运行16个并行实例的 NVIDIA 量化版 Gemma-4-26B-A4B-NVFP4 模型,合计达到300 tok/s,展示高并发能力且未使用 flashinfer。
40+ token/秒 - 在单台 DGX Spark 上使用 vLLM 运行 Qwen 3.5 122B Int4 的优化方案
用户分享了一种在单台 DGX Spark 上使用 vLLM 运行 Qwen 3.5 122B Int4 的优化方案,实现了每秒超过 40 个 token 的速度。他们邀请其他人尝试并进一步优化。
@rohanpaul_ai: Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上达到每秒34个token,本地使用 atomic[.]chat,接受率达90%,即……
Qwen 3.6 27B 在 MacBook Pro M5 Max 64GB 上本地运行,实现每秒34个token,草稿接受率达90%,通过 TurboQuant、GGUF 和 llama.cpp 实现,展示了笔记本AI推理的重大进步。
@losterror501:使用2dgx sparks,单会话25 tok/s,8会话峰值152 tok/s。实在疯狂……
宣布Qwable-v1,这是一个从Claude Fable-5蒸馏而来的开放权重模型,同时展示了在2dgx sparks硬件上的性能基准测试:单会话25 tok/s,8会话152 tok/s。