@TheDavidTai:我们刚在 https://CUDA.fast 上达到了100%!另外看看这个快照中代表的所有不同模型。
摘要
Qwen 3.8 Flash Next 模型在 CUDA.fast 基准测试中取得了100%的得分,在 DGX Spark 上实现了117.8%的综合速度提升,利用了推测性解码技术。
查看缓存全文
缓存时间: 2026/09/12 06:50
我们刚在 https://t.co/86Std4k8Ox 达到了100%!
同时看看这个快照中展现的各种模型: https://t.co/vcECPmyon5
cuda.fast — Qwen 3.8 Flash Next,借助推测解码更快
来源: https://www.yukon.org/mlxfast?platform=cuda
Qwen 3.8 Flash Next 在DGX Spark 上运行速度提升117.8%。评分原理官方评分采用单流综合得分:预填充增益的0.25次方乘以解码增益的0.75次方,因此解码权重占四分之三。串行运行为1.0,任何超过该值的提升都来自真实的推测解码增益。benchd负责计算并验证该分数。
50%100%150%NVIDIA — CUDA 纪录
当前纪录
117.8%
相比官方串行基准的综合速度提升
56项晋级提交,14个求解器
按综合得分排序
优先显示单流综合得分最高的结果 · 展开求解器的晋级运行记录及其说明
相似文章
@MiaAI_lab: Nvidia又做到了!@NVIDIAAI的Qwen 3.6 27B NVFP4比Unsloth的Qwen 3.6 27B NVFP4在D…上快了约41%
Nvidia优化后的Qwen 3.6 27B NVFP4模型在DGX Spark上相比Unsloth版本,单次推理速度快41%,并发推理速度快23-25%。
今日在双DGX Spark上运行Qwen3.8-Flash-Next时聚合吞吐量达到181 tok/s
使用2台DGX Spark集群,通过NVMe映射和推测解码等优化,在Qwen3.8-Flash-Next模型上实现了181令牌每秒的聚合吞吐量。
Qwen3.8-Flash-Next NVFP4 在双DGX Spark上的配置:解码速度50t/s,预填充速度2,900t/s
用户分享了在双DGX Spark硬件上部署Qwen3.8-Flash-Next模型的优化配置,通过技术补丁和设置细节,实现了高达50t/s的解码速度和2,900t/s的预填充速度。
在4080与64GB DDR5上运行Qwen Flash Q4_K_M,约8tk/s,98304上下文。
作者演示了如何在4080 GPU和64GB DDR5上运行182B的Qwen模型,通过将ngrams转移到SSD,实现了比27B模型更快、更智能的性能,使大型模型推理在消费级硬件上变得可行。
昨天用一台NVIDIA DGX Spark,搭配Qwen3.8-Flash-Next(NVFP4,262K上下文)搭建的项目
一位开发者在单台NVIDIA DGX Spark上,使用Qwen3.8-Flash-Next模型在8小时内构建了一个项目,生成了约1万行代码,并消耗了80万token。