@TheAhmadOsman: 像 Qwen 3.8 27B 这样的密集模型在 DGX Spark 这类统一内存系统上体验非常糟糕,顺便说一句,DGX Sparks 更适合……
摘要
Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。
查看缓存全文
缓存时间: 2026/08/08 21:13
像 Qwen 3.8 27B 这样的稠密模型,在 DGX Spark 这类统一内存系统上的体验非常糟糕,顺便说一下
DGX Spark 更适合那种每个 token 激活参数相对较少的 MoE 模型
GPU > 统一内存,只要不是纯聊天界面,都是如此 https://t.co/CeQx86NvOb
Ahmad (@TheAhmadOsman): 在一个约 200B 参数、约 10B 激活参数的模型上跑一次 20 万 token 上下文的智能体会话,在 2 台 DGX Spark 上大约需要 22 分钟。
同样的工作负载,在 2 块 RTX PRO 6000 上大约只需要 2-3 分钟。
而且这还是没考虑并发和 Tensor 并行的情况下,这两者都……
相似文章
@MiaAI_lab: 在您的@NVIDIAAI DGX Spark上可以运行的最佳模型是什么?1× DGX Spark * Qwen 3.6 35b NVFP4 - 256k ctx, 110 tok/s…
一条推文详细介绍了在Nvidia DGX Spark上可以运行的最佳AI模型,包括Qwen 3.6和DeepSeek v4 Flash变体,以及单机和多机设置下的token速度和上下文长度。
4x RTX 3090 上的 Qwen3.5-27B、Qwen3.5-122B 和 Qwen3.6-35B —— MoE 模型在严格全局规则下的表现困境
潜水多年的老用户,首次发帖。在 4 张 RTX 3090 上对三款 Qwen 模型分别进行了 20 多个会话的实时智能体工作测试——**Qwen3.5-27B** 稠密模型、**Qwen3.5-122B-A10B** MoE 和 **Qwen3.6-35B-A3B** MoE。以下数据均解析自持续真实负载下的 vLLM 日志,而非合成基准测试。**本文所有数据的关键负载背景:** 测试框架是一个多智能体编排器,同时运行 1-6 个并发的 OpenCode 会话,Prompt 长度为 30-60k token,并且强制执行**严格的 Bash 允许列表
DGX Spark 智能体使用数据
一位用户分享了在 NVIDIA DGX Spark 上使用 vLLM 运行 Qwen3.6 模型的基准测试结果和配置,重点关注包含并发请求和工具调用的智能体工作负载。
1块RTX Pro 6000还是2台DGX Spark
针对AI计算任务,对单块RTX Pro 6000 GPU与两台DGX Spark系统进行比较。
@cniongolo: 我不确定大家是否已经意识到,你实际上可以在双 GPU 上运行 Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF…
演示了在双路 Nvidia RTX PRO 6000 Blackwell GPU 上,使用 Hugging Face Inference 运行自定义 Qwen 模型(Qwen3.6-35B-A3B-Claude-4.7-Opus-abliterated-MTP-GGUF),达到每秒约 195 个 token 的处理速度。