@ivanfioravanti: DGX Spark 上下文基准测试基于 Qwen3.6-35B-A3B-UD-Q8_K_XL,使用 Mia 发布的 llamacpp 脚本。速度很快!是时候测试质…

X AI KOLs Timeline 模型

摘要

基于 Qwen3.6-35B-A3B-UD-Q8_K_XL 在 DGX Spark 上的基准测试结果,使用 Mia 发布的 llama.cpp 脚本,展示了在不同上下文长度下快速的 token 生成时间。

DGX Spark 上下文基准测试基于 Qwen3.6-35B-A3B-UD-Q8_K_XL,使用 Mia 发布的 llamacpp 脚本。 速度很快!是时候测试质量以及在 Hermes Agent 中的实际使用情况了! Qwen3.6-35B-A3B-UD-Q8_K_XL llama.cpp 基准测试结果 硬件:aarch64,121.7GB RAM,20 个 CPU 核心 2k pp 1573 tg 79 t/s 4k pp 1659 tg 78 t/s 8k pp 1694 tg 79 t/s 16k pp 1652 tg 70 t/s 32k pp 1628 tg 68 t/s 64k pp 1519 tg 58 t/s 128k pp 1339 tg 42 t/s 256k pp 1052 tg 31 t/s
查看原文
查看缓存全文

缓存时间: 2026/07/06 20:20

DGX Spark 上 Qwen3.6-35B-A3B-UD-Q8_K_XL 的上下文基准测试 —— Mia 发布的 llamacpp 脚本

速度飞快!是时候测试质量以及 Hermes Agent 中的实际使用了!

Qwen3.6-35B-A3B-UD-Q8_K_XL llama.cpp 基准测试结果
硬件:aarch64,121.7GB RAM,20 个 CPU 核心

2k pp 1573 tg 79 t/s
4k pp 1659 tg 78 t/s
8k pp 1694 tg 79 t/s
16k pp 1652 tg 70 t/s
32k pp 1628 tg 68 t/s
64k pp 1519 tg 58 t/s
128k pp 1339 tg 42 t/s
256k pp 1052 tg 31 t/s

Mia (@MiaAI_lab):
在 @NVIDIAAI DGX Spark 及其他 96–128GB 显存机子上轻松运行 #1 代理工作流模型。

⭐️ 简单的一键启动脚本
⭐️ 无需手动下载模型

点此获取 👇

相似文章

DGX Spark 智能体使用数据

Reddit r/LocalLLaMA

一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。