@YRSM_Simon: 疯狂

X AI KOLs Timeline 模型

摘要

DeepSeek-V4-Flash-DSpark 在 4 块 RTX PRO 6000 GPU 上实现了 328 tok/s 的单次推理和 1.7k tok/s 的批量吞吐量。

疯狂
查看原文
查看缓存全文

缓存时间: 2026/07/09 09:40

疯狂

AI✖️Satoshi⏩️(@AiXsatoshi): DeepSeek-V4-Flash-DSpark 在 4 块 RTX PRO 6000 上跑,进展相当不错了。

  • 单次推理:~328 tok/s
  • 批量吞吐:~1.7k tok/s

相似文章

Deepseek V4 Flash 在 RTX 5090 MoE 上运行

Reddit r/LocalLLaMA

用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。