@TheDavidTai:我们刚在 https://CUDA.fast 上达到了100%!另外看看这个快照中代表的所有不同模型。

X AI KOLs Following 新闻

摘要

Qwen 3.8 Flash Next 模型在 CUDA.fast 基准测试中取得了100%的得分,在 DGX Spark 上实现了117.8%的综合速度提升,利用了推测性解码技术。

我们刚在 https://t.co/86Std4k8Ox 上达到了100%! 另外看看这个快照中代表的所有不同模型。 https://t.co/vcECPmyon5
查看原文
查看缓存全文

缓存时间: 2026/09/12 06:50

我们刚在 https://t.co/86Std4k8Ox 达到了100%!

同时看看这个快照中展现的各种模型: https://t.co/vcECPmyon5


cuda.fast — Qwen 3.8 Flash Next,借助推测解码更快

来源: https://www.yukon.org/mlxfast?platform=cuda

Qwen 3.8 Flash Next 在DGX Spark 上运行速度提升117.8%。评分原理官方评分采用单流综合得分:预填充增益的0.25次方乘以解码增益的0.75次方,因此解码权重占四分之三。串行运行为1.0,任何超过该值的提升都来自真实的推测解码增益。benchd负责计算并验证该分数。

50%100%150%NVIDIA — CUDA 纪录

当前纪录

117.8%

相比官方串行基准的综合速度提升

56项晋级提交,14个求解器

按综合得分排序

优先显示单流综合得分最高的结果 · 展开求解器的晋级运行记录及其说明

相似文章