@ivanfioravanti: DGX Spark 上下文基准测试基于 Qwen3.6-35B-A3B-UD-Q8_K_XL,使用 Mia 发布的 llamacpp 脚本。速度很快!是时候测试质…
摘要
基于 Qwen3.6-35B-A3B-UD-Q8_K_XL 在 DGX Spark 上的基准测试结果,使用 Mia 发布的 llama.cpp 脚本,展示了在不同上下文长度下快速的 token 生成时间。
查看缓存全文
缓存时间: 2026/07/06 20:20
DGX Spark 上 Qwen3.6-35B-A3B-UD-Q8_K_XL 的上下文基准测试 —— Mia 发布的 llamacpp 脚本
速度飞快!是时候测试质量以及 Hermes Agent 中的实际使用了!
Qwen3.6-35B-A3B-UD-Q8_K_XL llama.cpp 基准测试结果
硬件:aarch64,121.7GB RAM,20 个 CPU 核心
2k pp 1573 tg 79 t/s
4k pp 1659 tg 78 t/s
8k pp 1694 tg 79 t/s
16k pp 1652 tg 70 t/s
32k pp 1628 tg 68 t/s
64k pp 1519 tg 58 t/s
128k pp 1339 tg 42 t/s
256k pp 1052 tg 31 t/s
Mia (@MiaAI_lab):
在 @NVIDIAAI DGX Spark 及其他 96–128GB 显存机子上轻松运行 #1 代理工作流模型。⭐️ 简单的一键启动脚本
⭐️ 无需手动下载模型点此获取 👇
相似文章
DGX Spark 智能体使用数据
一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。
@MiaAI_lab: 在您的@NVIDIAAI DGX Spark上可以运行的最佳模型是什么?1× DGX Spark * Qwen 3.6 35b NVFP4 - 256k ctx, 110 tok/s…
一条推文详细介绍了在Nvidia DGX Spark上可以运行的最佳AI模型,包括Qwen 3.6和DeepSeek v4 Flash变体,以及单机和多机设置下的token速度和上下文长度。
在一台 DGX Spark 上对 124B 模型进行了一周基准测试并全部公开——他找到的最快路径为 38.7 tok/s,比同机上的 DeepSeek V4 Flash 快 2.4 倍
sudoingX 的一项独立基准测试显示,在澄清官方 INT4 量化确实可用之后,Ling-3.0-flash 模型在单台 DGX Spark 上的运行速度为 38.7 tok/s,比同硬件上的 DeepSeek V4 Flash 快 2.4 倍。
40+ token/秒 - 在单台 DGX Spark 上使用 vLLM 运行 Qwen 3.5 122B Int4 的优化方案
用户分享了一种在单台 DGX Spark 上使用 vLLM 运行 Qwen 3.5 122B Int4 的优化方案,实现了每秒超过 40 个 token 的速度。他们邀请其他人尝试并进一步优化。
昨天用一台NVIDIA DGX Spark,搭配Qwen3.8-Flash-Next(NVFP4,262K上下文)搭建的项目
一位开发者在单台NVIDIA DGX Spark上,使用Qwen3.8-Flash-Next模型在8小时内构建了一个项目,生成了约1万行代码,并消耗了80万token。