@songhan_mit: 不只是快,而是快速迭代:
摘要
DeepSeek V4.1 Flash 现已在 Inco AI 上线,号称是最快的提供商,速度达到每秒532个令牌。
查看缓存全文
缓存时间: 2026/09/18 16:50
不仅快,更是迭代快:
Inco AI (@inco_ai): ⚡ 532 tokens/s!
DeepSeek V4.1 Flash 已在 Inco 平台上线,并且在 Artificial Analysis 测评中位列速度第一。输出速度遥遥领先,完全不在一个量级。
立即体验:https://t.co/OaukyhhRer 测评结果:
相似文章
@no_stp_on_snek:DeepSeek-V4.1-Flash 运行于 2 张 Sparks 上。thinking 设为高,TP=2。处理了 55M tokens。这是实际的内核优化工作,并非演示。它阅读了笔记并…
本文描述了针对 DeepSeek-V4.1-Flash AI 模型在 Metal 硬件上的一项优化,改进了注意力内核,使其仅启动必要的 tile 块,从而减少了计算浪费并提升了推理速度。
@QuixiAI:我让 DeepSeek v4 Flash 0731 在 4x A100 上用 SlimServe 运行起来。单请求 175 tok/s,64 并发 1k tok/s…
QuixiAI 报告称,使用 SlimServe 在 4x A100 上运行 DeepSeek v4 Flash 0731,单请求达到 175 tok/s,64 并发请求达到 1k tok/s。
DeepSeek V4 Flash(98GB)在单块4060 Ti加CPU上本周速度提升300% [从2t/s到7t/s]
DeepSeek V4 Flash(98GB)现在通过CPU卸载,在单块RTX 4060 Ti上运行速度可达每秒7个token,相比上周的2t/s提升了3倍。
@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……
MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。
@LotusDecoder: DeepSeek-V4.1-Flash-0910 解码速度 400 token/s 😋 将此部署到我的家用 DGX Spark 上是否也能达到这个速度?
一位用户在 X/Twitter 上询问,将 DeepSeek-V4.1-Flash-0910 模型部署在家用 DGX Spark 上是否能达到每秒 400 token 的解码速度。