@RayFernando1337: 让他发挥。现在拥有两台DGX Sparks真是太有趣了。
摘要
一位Twitter用户讨论拥有两台NVIDIA DGX Sparks系统,而另一位用户报告通过模型更新到DFlash2-7后,token吞吐量达到每秒67个。
让他发挥。现在拥有两台DGX Sparks真是太有趣了。
查看缓存全文
缓存时间: 2026/08/30 00:00
让他大展身手吧。现在拥有两台 DGX Sparks RN 正是充满乐趣的时刻。
Sufyan (@sfxnz): 默认模式现在是双序列的 DFlash2-7。
刚测出在上下文长度为327k时,结构化模式下可达67 tokens/s。之前在四序列的 DFlash2-5 上是51 tokens/s。
依然保持在327k上下文长度。
尽情享用吧。
相似文章
@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……
MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。
@TechMDAI:DGX spark 社区正火热
DGX spark 社区目前活动频繁且热情高涨。
1块RTX Pro 6000还是2台DGX Spark
针对AI计算任务,对单块RTX Pro 6000 GPU与两台DGX Spark系统进行比较。
@RayFernando1337: 我对 Local Studio 感到非常兴奋!我有两台 DGX Sparks 连接在一起,我将能够运行自己的智能体…
Ray Fernando 表达了对 Local Studio 的兴奋之情,这是一个开源界面,用于在两台相连的 DGX Sparks 上运行 AI 智能体,类似于 Codex。
@MiaAI_lab: 在您的@NVIDIAAI DGX Spark上可以运行的最佳模型是什么?1× DGX Spark * Qwen 3.6 35b NVFP4 - 256k ctx, 110 tok/s…
一条推文详细介绍了在Nvidia DGX Spark上可以运行的最佳AI模型,包括Qwen 3.6和DeepSeek v4 Flash变体,以及单机和多机设置下的token速度和上下文长度。