@LotusDecoder: DeepSeek-V4.1-Flash-0910 解码速度 400 token/s 😋 将此部署到我的家用 DGX Spark 上是否也能达到这个速度?
摘要
一位用户在 X/Twitter 上询问,将 DeepSeek-V4.1-Flash-0910 模型部署在家用 DGX Spark 上是否能达到每秒 400 token 的解码速度。
DeepSeek-V4.1-Flash-0910 解码速度 400 token/s 😋 将此部署到我的家用 DGX Spark 上是否也能达到这个速度?
相似文章
@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……
MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。
Deepseek V4 flash 在 DGX Spark 上的性能
一位 Reddit 用户分享了在双华硕 GX10 DGX Spark 配置上运行 DeepSeek V4 Flash 的经验,详细介绍了性能指标、配置和功耗,并提供了不同上下文长度下的吞吐量基准测试结果。
A 124B 在单台 DGX Spark 上单次响应生成了 15,128 个 token,解码速度全程保持 35.62 → 35.68 tok/s
对 Ling-3.0-flash (124B) 在单台 DGX Spark 上单次响应生成 15,128 个 token 的观察,解码吞吐稳定在约 35.6 tok/s,凸显了长上下文解码性能。
@ViC305: 18小时后:DeepSeek-V4.1-Flash 现已量化至 4.75 bpw EXL3,适用于 4× DGX Spark TP4 目标。权重已完…
DeepSeek-V4.1-Flash 已量化至 4.75 bpw EXL3,以便部署在 4× DGX Spark 上,优化内存使用并实现高效本地推理,同时有计划进行验证和进一步优化。
在一台 DGX Spark 上对 124B 模型进行了一周基准测试并全部公开——他找到的最快路径为 38.7 tok/s,比同机上的 DeepSeek V4 Flash 快 2.4 倍
sudoingX 的一项独立基准测试显示,在澄清官方 INT4 量化确实可用之后,Ling-3.0-flash 模型在单台 DGX Spark 上的运行速度为 38.7 tok/s,比同硬件上的 DeepSeek V4 Flash 快 2.4 倍。