@Oluwaphilemon1: Qwen3.8-27B at 56 tok/s on a 9-year-old GPU. Let that sink in. The GPU? NVIDIA V100 32GB. A card that launched at aroun…

X AI KOLs Timeline 新闻

摘要

在NVIDIA V100 GPU上实现Qwen3.8-27B模型每秒56个令牌的推理速度,展示了使用推测解码技术在旧硬件上进行经济高效的本地AI部署。

Qwen3.8-27B at 56 tok/s on a 9-year-old GPU. Let that sink in. The GPU? NVIDIA V100 32GB. 一张在发行时约11,500美元的显卡,现在二手价格大约650美元,它在本地AI方面仍然表现出惊人的能力。 使用DFlash2,Qwen3.8-27B可以达到约: → 代码生成速度56–63 tok/s → 思考和散文生成速度略低 → 当ECC禁用时,速度还有更多提升空间 有趣的是,推测解码在不同工作负载下的表现不同。 MTP在散文生成上往往占优,尤其是在GPU功率受限的情况下。 但对于持续的代码生成,DFlash2领先。 这是一个非常重要的区别。 不能孤立地问哪种推测解码方法“更快”。答案很大程度上取决于你生成什么内容、下一个令牌的可预测性以及GPU有多少可用功率。 所有这些都在PCIe 3.0和一个已过时几代的架构上运行。 这些在纸面上听起来是主要的劣势。 实际上呢? 软件栈已经足够好,以至于它们远没有你想象的那么致命。 这就是V100再次变得有趣的原因。 你不需要一块现代的2000美元以上的GPU来实验严肃的本地模型。 一块上个十年的二手数据中心加速器,在配合适当的运行时和推测解码时,仍然能提供惊人的推理性能。 我还在开发一个代码库,使设置更容易复现,这样你就不用花几个小时自己搞清楚配置了。 V100曾经是一块11,500美元的旗舰加速器。 今天,以大约650美元的二手价格,它仍然能以每秒数十个令牌的速度运行27B模型。 https://x.com/KyleHessling1/status/2093509375352799338/video/1…
查看原文
查看缓存全文

缓存时间: 2026/08/30 18:21

Qwen3.8-27B 在一块已有9年历史的显卡上达到了每秒56 token 的生成速度。

请仔细品味这一点。

这张显卡是?

NVIDIA V100 32GB。

一张发售价约11,500美元的显卡,现在二手价格大约650美元,但其本地运行AI的能力依然令人惊叹。

配合 DFlash2 推测解码,Qwen3.8-27B 的速度可达到:

→ 代码生成:约 56–63 tok/s → 思考与散文生成:速度略低 → 关闭 ECC 内存校验后,性能还有提升空间

有趣的是,推测解码的性能表现会因任务类型而异。

对于散文生成,MTP(多Token预测)往往表现更优,尤其在GPU功耗受限时。

但对于持续的代码生成任务,DFlash2 则更胜一筹。

这是一个相当重要的区别。

不能简单地孤立地问哪种推测解码方法“更快”。其答案高度取决于你生成的内容类型、下一个 token 的可预测性,以及 GPU 可用的功耗空间。

而这一切,都运行在 PCIe 3.0 接口和一个已经落后好几代的架构上。

这些在纸面上看似是明显的劣势。

实际情况呢?

软件生态的优化已经让它们的负面影响远不如预期。

这正是 V100 再次引起关注的原因。

你不需要一块价值2000美元以上的现代显卡,也能运行严肃的本地模型。

一块来自上个十年、价值约650美元的二手数据中心加速卡,在搭配合适的运行时环境和推测解码技术后,依然能提供惊人的推理性能。

我也在整理一个仓库,以便更轻松地复现这套配置,免去你花费数小时自行摸索的麻烦。

V100 曾是售价11,500美元的旗舰加速卡。

如今,以大约650美元的二手价格,它依然能以每秒数十 token 的速度驱动27B参数的模型。 https://x.com/KyleHessling1/status/2093509375352799338/video/1…

相似文章