@QuixiAI:我让 DeepSeek v4 Flash 0731 在 4x A100 上用 SlimServe 运行起来。单请求 175 tok/s,64 并发 1k tok/s…

X AI KOLs Timeline 新闻

摘要

QuixiAI 报告称,使用 SlimServe 在 4x A100 上运行 DeepSeek v4 Flash 0731,单请求达到 175 tok/s,64 并发请求达到 1k tok/s。

我让 DeepSeek v4 Flash 0731 在 4x A100 上用 SlimServe 运行起来了。 单请求 175 tok/s 64 并发请求 1k tok/s。https://t.co/wFQCRVe0qb
查看原文
查看缓存全文

缓存时间: 2026/08/11 05:40

我让DeepSeek v4 Flash 0731在4块A100上配合SlimServe运行起来。

单请求175 tok/s 64并发请求1k tok/s。https://t.co/wFQCRVe0qb

相似文章

DeepSeek-V4-Flash-0731 unsloth gguf 在 A100 上

Reddit r/LocalLLaMA

展示了 DeepSeek-V4-Flash-0731 在单块 40GB A100 上以 unsloth GGUF 量化版本运行,速度为 17.7 tok/s,并将 6 个专家加载到显存中,从而实现了完整的智能体编码循环。

DeepSeek-v4-Flash-Mini 54GB GGUF 运行速度约 20.5 t/s

Reddit r/LocalLLaMA

一个社区构建将 DeepSeek-V4-Flash 压缩为 54GB 的 IQ2_XXS GGUF 变体,采用激进的 2 位量化,在本地硬件上实现了约 20.5 tokens/s 的速度,同时大幅降低了显存/内存占用。

Deepseek V4 Flash 在 RTX 5090 MoE 上运行

Reddit r/LocalLLaMA

用户分享了在 RTX 5090 上使用 llama.cpp 的一个分支运行 DeepSeek-V4-Flash (Q2_K) 的优化基准测试结果,实现了 21.3 token/秒的生成速度和 100 万上下文大小。