@TheAhmadOsman: 像 Qwen 3.8 27B 这样的密集模型在 DGX Spark 这类统一内存系统上体验非常糟糕,顺便说一句,DGX Sparks 更适合……

X AI KOLs Following 新闻

摘要

Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。

像 Qwen 3.8 27B 这样的密集模型在 DGX Spark 这类统一内存系统上的体验非常糟糕,顺便说一句 DGX Sparks 更适合那些每个 token 激活参数相对较少的 MoE 模型 对于任何不只是聊天界面的场景,GPU > 统一内存 https://t.co/CeQx86NvOb
查看原文
查看缓存全文

缓存时间: 2026/08/08 21:13

像 Qwen 3.8 27B 这样的稠密模型,在 DGX Spark 这类统一内存系统上的体验非常糟糕,顺便说一下

DGX Spark 更适合那种每个 token 激活参数相对较少的 MoE 模型

GPU > 统一内存,只要不是纯聊天界面,都是如此 https://t.co/CeQx86NvOb

Ahmad (@TheAhmadOsman): 在一个约 200B 参数、约 10B 激活参数的模型上跑一次 20 万 token 上下文的智能体会话,在 2 台 DGX Spark 上大约需要 22 分钟。

同样的工作负载,在 2 块 RTX PRO 6000 上大约只需要 2-3 分钟。

而且这还是没考虑并发和 Tensor 并行的情况下,这两者都……

相似文章

4x RTX 3090 上的 Qwen3.5-27B、Qwen3.5-122B 和 Qwen3.6-35B —— MoE 模型在严格全局规则下的表现困境

Reddit r/LocalLLaMA

潜水多年的老用户,首次发帖。在 4 张 RTX 3090 上对三款 Qwen 模型分别进行了 20 多个会话的实时智能体工作测试——**Qwen3.5-27B** 稠密模型、**Qwen3.5-122B-A10B** MoE 和 **Qwen3.6-35B-A3B** MoE。以下数据均解析自持续真实负载下的 vLLM 日志,而非合成基准测试。**本文所有数据的关键负载背景:** 测试框架是一个多智能体编排器,同时运行 1-6 个并发的 OpenCode 会话,Prompt 长度为 30-60k token,并且强制执行**严格的 Bash 允许列表

DGX Spark 智能体使用数据

Reddit r/LocalLLaMA

一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。