A 124B 在单台 DGX Spark 上单次响应生成了 15,128 个 token,解码速度全程保持 35.62 → 35.68 tok/s
摘要
对 Ling-3.0-flash (124B) 在单台 DGX Spark 上单次响应生成 15,128 个 token 的观察,解码吞吐稳定在约 35.6 tok/s,凸显了长上下文解码性能。
这是一次吞吐量观察,而非简单演示。机器和录屏来自 X 上的 sudoingX,经其同意后分享;我在 inclusionAI 参与 Ling 的开发。他在自己的 llama-server 的 Web UI 中输入了一个 33 token 的提示词——构建一个 GPU 监控仪表盘前端,使用虚拟数据,高端设计——然后让它运行。运行的是社区 Q5 GGUF 版本的 Ling-3.0-flash,单台 Spark。机器上除了 Xorg 没有其他负载。单次响应,无多轮对话:评估时间 = 424035.62 ms / 15128 tokens(每 token 28.03 ms,每秒 35.68 tokens),截断 = 0。总时间并不是有趣的部分。在 n_decoded 为 2793 时,日志显示 35.62 t/s。到 15062 时,显示 35.68。又增加了 12000 个 token 的 KV 缓存,解码速度依然稳定。生成的结果是一个基于模拟数据的仪表盘前端——使用 Math.random() 漂移,以及该机器并不存在的两块 GPU。这正是他要求的,所以不算失误,但它并没有读取真实的 GPU,而且“虚拟”这个词就明明白白地显示在屏幕上的提示词中。生成了七分钟。除了它能正常渲染之外,我无法对输出做连贯性检查。
相似文章
在一台 DGX Spark 上对 124B 模型进行了一周基准测试并全部公开——他找到的最快路径为 38.7 tok/s,比同机上的 DeepSeek V4 Flash 快 2.4 倍
sudoingX 的一项独立基准测试显示,在澄清官方 INT4 量化确实可用之后,Ling-3.0-flash 模型在单台 DGX Spark 上的运行速度为 38.7 tok/s,比同硬件上的 DeepSeek V4 Flash 快 2.4 倍。
@onusoz: 16路并行 Gemma-4-26B-A4B-NVFP4 运行,每路18输出 token/s,合计300 tok/s 一台配备128GB统一内存的DGX Spark…
@onusoz 展示了在单一 DGX Spark(128GB统一内存)上运行16个并行实例的 NVIDIA 量化版 Gemma-4-26B-A4B-NVFP4 模型,合计达到300 tok/s,展示高并发能力且未使用 flashinfer。
@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……
MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。
@antirez: DS4 正在 DGX Spark (GB10 / CUDA) 上运行,目前为私有分支。12 tokens/sec,此系统的内存带宽受限……
Antirez 报告了在 DGX Spark (GB10) 上对 DS4 推理进行的基准测试,指出生成速度为 12 tokens/sec,预填充性能较高,并计划在该代码库成熟后将其合并。
两个标志将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8提升到38.7 tok/s
本文介绍了两个配置标志,它们将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8 tok/s提升到38.7 tok/s,同时提醒需要使用特定的vLLM分支,并指出在长上下文性能方面的权衡。