@YRSM_Simon:120 t/s!干得好,@UnslothAI
摘要
Unsloth AI 宣布推出 DSpark,使 DeepSeek-V4-Flash GGUF 模型在本地运行速度提升约 1.4–2 倍,达到 120 tokens/s,且准确率无变化。
查看缓存全文
缓存时间: 2026/08/07 04:50
120 t/s!干得漂亮,@UnslothAI
Unsloth AI (@UnslothAI): DeepSeek-V4-Flash 现在可以通过 DSpark 在本地以 2 倍速度运行!⚡️
DSpark 能让 V4-Flash-0731 的 GGUF 文件生成速度提升约 1.4–2 倍,且精度不变。
DeepSeek-V4-Flash-0731 可以达到 120 tokens/s。
GGUFs: https://t.co/ac6uOI8mZA 指南:
相似文章
@YRSM_Simon: 疯狂
DeepSeek-V4-Flash-DSpark 在 4 块 RTX PRO 6000 GPU 上实现了 328 tok/s 的单次推理和 1.7k tok/s 的批量吞吐量。
@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……
MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。
@Tono_Ken3: 哦天哪,我成功了!它成功了——DeepSeek-V4-Flash-FP8 8 parallel aggregate 400TPS!!本地LLM革命 耶耶耶耶耶!哈哈
在本地硬件上使用8个并行聚合以DeepSeek-V4-Flash-FP8实现了每秒400个token,标志着本地LLM推理的一个重要里程碑。
针对双GH200优化的DSv4-Flash:SGLang上PP达10,000 tok/s,TG超过300 tok/s
DeepSeek V4 Flash在双GH200工作站上的详细基准测试,比较了SGLang和vLLM在1M上下文长度下使用DSpark投机解码的表现,发现SGLang更快,约为317 tok/s对比276 tok/s。
@Ex0byt: 更新:通往GLM-5.2之路:我们快到了,各位!未量化、未剪枝的DeepSeek-v4-Flash。单台……上11 tok/s
关于在单台DGX Spark上使用sglang推理和自定义mega-kernel以11 tok/s运行未量化的DeepSeek-v4-Flash模型的更新,正在向GLM-5.2迈进。