标签
本文讨论了 NVIDIA DGX Spark 集群与 AMD Epyc 服务器在 AI 工作负载上的比较,重点关注成本、内存带宽以及 FP4 支持和张量并行等功能。
一位Twitter用户讨论拥有两台NVIDIA DGX Sparks系统,而另一位用户报告通过模型更新到DFlash2-7后,token吞吐量达到每秒67个。
使用2台DGX Spark集群,通过NVMe映射和推测解码等优化,在Qwen3.8-Flash-Next模型上实现了181令牌每秒的聚合吞吐量。
NVIDIA 发布了 Perplexity's Portable Computer,这是一个针对 NVIDIA DGX Spark 的本地优先智能体栈,提供一键本地推理和为始终在线的本地智能体优化的智能体体验。
Michael Gannotti 分享道,在完成模型训练后,他已将 DeepSeek 的 V4 Flash AI 模型在其 NVIDIA DGX 集群上重新上线,这使他能够恢复本地推理以运行智能体。
本文对比了NVIDIA DGX Spark和魔改RTX 4090在本地部署Qwen3.8-27B和Ling-3.0-flash模型的性能,提供了基准测试数据和购买建议。
一位用户宣布其全面开源AI技术栈已完成,该技术栈使用了Deepseek、Qwen和MiniMax的模型,运行在NVIDIA DGX Spark系统上。
Andrew Chen 分享了在双 NVIDIA DGX Sparks 上测试 DeepSeek V4 Flash 0731 并与 Opus 4.6 进行比较的兴奋之情。
Laguna S 2.1 118B-A8B 模型在 DGX Station 上使用 NVFP4 和 FP8 KV 缓存运行,对于 10 个并行代理(每个拥有 256k 上下文)达到约 1k tokens/秒 的速度。
一份详细的指南,介绍如何跨4个NVIDIA DGX Spark节点运行未剪枝的GLM-5.2模型(744B参数,256个专家),支持200K上下文,总吞吐量高达60.5 tok/s。包含性能基准测试、致谢和补丁。
AEON-7 发布了 Qwen3.6-27B 的完全无审查、能力增强的 ablitation 版本,针对 NVIDIA DGX Spark 进行了优化,采用 NVFP4 量化和 DFlash 推测解码以提升性能。
NVIDIA 通过 DGX Cloud 提供免费的 AI 推理,支持 DeepSeek、MiniMax、Kimi、GLM、Llama 等热门模型,API 兼容 OpenAI,5 分钟即可领取。