标签
一个运行在NVIDIA DGX Spark上的AI Agent在数据中心获得优先冷却处理,突显了AI工作负载的基础设施需求。
成功在双机 DGX spark GB10 系统上本地部署了 DeepSeek-V4-Flash-0731 模型。
用户分享购买MSI DGX Spark的经历,用于运行DeepSeek V4 Flash和DeepSeek Harness等AI模型,并探索Minimax H3和Music功能。
作者观察到中文AI圈关注DeepSeek,英文AI圈关注DGX Spark,预计两者将融合。
一条推文,建议NVIDIA DGX Spark的所有者优先使用nvfp4以获得最佳性能。
对 Ling-3.0-flash (124B) 在单台 DGX Spark 上单次响应生成 15,128 个 token 的观察,解码吞吐稳定在约 35.6 tok/s,凸显了长上下文解码性能。
sudoingX 的一项独立基准测试显示,在澄清官方 INT4 量化确实可用之后,Ling-3.0-flash 模型在单台 DGX Spark 上的运行速度为 38.7 tok/s,比同硬件上的 DeepSeek V4 Flash 快 2.4 倍。
用户在 2× DGX Spark 集群上测试了 Meta 的 Muse Glimmer 30B,使用 YaRN 将上下文从 131K 扩展到 1M tokens,并确认在 832K tokens 下通过检索。报告称 DFlash 投机解码带来了约 3 倍加速,并分享了完整配置。
本文介绍了两个配置标志,它们将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8 tok/s提升到38.7 tok/s,同时提醒需要使用特定的vLLM分支,并指出在长上下文性能方面的权衡。
Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。
用户在使用 vLLM 在两台 DGX Spark 机器上部署 DeepSeek-V4-Flash-0731 时,寻求社区关于降低 VRAM 占用和释放操作系统 RAM 的建议,分享了详细的配置和内存测量数据。
Ray Fernando 表达了对 Local Studio 的兴奋之情,这是一个开源界面,用于在两台相连的 DGX Sparks 上运行 AI 智能体,类似于 Codex。
为构建 DGX Spark 集群选择 MikroTik 交换机(CRS504、CRS804、CRS812)的实用指南,包含定价及 8 路 DGX Spark 配置的真实用户案例。
作者在 DGX Spark 上对 MiniMax H3 与 LTX 2.3 Eros 视频生成模型进行了同条件实测,结果显示 H3 在叙事和指令遵循上更强且带音频,LTX 速度约快 1.76 倍。
对NVIDIA DGX Spark上的DeepSeek V4 Flash进行了14.7小时的浸泡测试,共971个请求,结果表明零崩溃或错误,但由于热节流,吞吐量下降了28%,而TTFT和推测接受率保持稳定。
一位用户分享说,他们使用 antirez 的 DwarfStar-4 配置,在 DGX Spark 上复现了 DeepSeek-V4-Flash-0731 的运行,证实了该设备在单机上的出色性能。
这个开源项目支持在 NVIDIA DGX Spark 上使用 Nix 和 NixOS,提供 USB 启动镜像和一个用于配置硬件的 NixOS 模块。
用户正在搭建一个16节点的DGX Spark集群,以便本地运行前沿开放模型,并讨论200与100 Gbit/s之间的网络权衡。
一种详细策略,通过将VRAM用作磁盘缓存,结合统一内存和llama.cpp设置,在单块DGX Spark上为Kimi K2.7实现了340 pp/s和9.6 tg/s。