dgx-spark

标签

Cards List
#dgx-spark

A 124B 在单台 DGX Spark 上单次响应生成了 15,128 个 token,解码速度全程保持 35.62 → 35.68 tok/s

Reddit r/LocalLLaMA · 昨天

对 Ling-3.0-flash (124B) 在单台 DGX Spark 上单次响应生成 15,128 个 token 的观察,解码吞吐稳定在约 35.6 tok/s,凸显了长上下文解码性能。

0 人收藏 0 人点赞
#dgx-spark

在一台 DGX Spark 上对 124B 模型进行了一周基准测试并全部公开——他找到的最快路径为 38.7 tok/s,比同机上的 DeepSeek V4 Flash 快 2.4 倍

Reddit r/LocalLLaMA · 2天前

sudoingX 的一项独立基准测试显示,在澄清官方 INT4 量化确实可用之后,Ling-3.0-flash 模型在单台 DGX Spark 上的运行速度为 38.7 tok/s,比同硬件上的 DeepSeek V4 Flash 快 2.4 倍。

0 人收藏 0 人点赞
#dgx-spark

我在 1M 上下文下运行了 Muse Glimmer - 所有测试均通过。

Reddit r/LocalLLaMA · 4天前

用户在 2× DGX Spark 集群上测试了 Meta 的 Muse Glimmer 30B,使用 YaRN 将上下文从 131K 扩展到 1M tokens,并确认在 832K tokens 下通过检索。报告称 DFlash 投机解码带来了约 3 倍加速,并分享了完整配置。

0 人收藏 0 人点赞
#dgx-spark

两个标志将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8提升到38.7 tok/s

Reddit r/LocalLLaMA · 5天前

本文介绍了两个配置标志,它们将官方Ling-3.0-flash INT4在单个DGX Spark上的推理速度从20.8 tok/s提升到38.7 tok/s,同时提醒需要使用特定的vLLM分支,并指出在长上下文性能方面的权衡。

0 人收藏 0 人点赞
#dgx-spark

@TheAhmadOsman: 像 Qwen 3.8 27B 这样的密集模型在 DGX Spark 这类统一内存系统上体验非常糟糕,顺便说一句,DGX Sparks 更适合……

X AI KOLs Following · 6天前 缓存

Ahmad Osman 认为,像 Qwen 27B 这样的密集模型在 NVIDIA DGX Spark 等统一内存系统上表现不佳,并提出 MoE 模型更为合适;他还称,RTX PRO 6000 等独立 GPU 在智能体工作负载上能提供远为更好的性能。

0 人收藏 0 人点赞
#dgx-spark

在 2x DGX Spark 上部署 DeepSeek v4 Flash 0731 — 5-7 GB 操作系统余量,你会如何降低 VRAM 占用并增加操作系统可用 RAM?

Reddit r/LocalLLaMA · 2026-08-07

用户在使用 vLLM 在两台 DGX Spark 机器上部署 DeepSeek-V4-Flash-0731 时,寻求社区关于降低 VRAM 占用和释放操作系统 RAM 的建议,分享了详细的配置和内存测量数据。

0 人收藏 0 人点赞
#dgx-spark

@RayFernando1337: 我对 Local Studio 感到非常兴奋!我有两台 DGX Sparks 连接在一起,我将能够运行自己的智能体…

X AI KOLs Following · 2026-08-07 缓存

Ray Fernando 表达了对 Local Studio 的兴奋之情,这是一个开源界面,用于在两台相连的 DGX Sparks 上运行 AI 智能体,类似于 Codex。

0 人收藏 0 人点赞
#dgx-spark

@MiaAI_lab: https://x.com/MiaAI_lab/status/2084629608062673379

X AI KOLs Timeline · 2026-08-04 缓存

为构建 DGX Spark 集群选择 MikroTik 交换机(CRS504、CRS804、CRS812)的实用指南,包含定价及 8 路 DGX Spark 配置的真实用户案例。

0 人收藏 0 人点赞
#dgx-spark

@YRSM_Simon: 在 DGX Spark 上做了 MiniMax H3 与 LTX 2.3 Eros 的同条件实测:3 组 Prompt、864×480、5 秒。 (prompt 来自推友 seeddance 的例子) H3 的动作叙事、复杂指令遵循和角色…

X AI KOLs Following · 2026-08-03 缓存

作者在 DGX Spark 上对 MiniMax H3 与 LTX 2.3 Eros 视频生成模型进行了同条件实测,结果显示 H3 在叙事和指令遵循上更强且带音频,LTX 速度约快 1.76 倍。

0 人收藏 0 人点赞
#dgx-spark

@MichaelGannotti: https://x.com/MichaelGannotti/status/2084186867000279436

X AI KOLs Following · 2026-08-03 缓存

对NVIDIA DGX Spark上的DeepSeek V4 Flash进行了14.7小时的浸泡测试,共971个请求,结果表明零崩溃或错误,但由于热节流,吞吐量下降了28%,而TTFT和推测接受率保持稳定。

0 人收藏 0 人点赞
#dgx-spark

@no_stp_on_snek: 单个 Spark 能做的事情依然非常了不起。感谢 @NVIDIAAI

X AI KOLs Following · 2026-08-02 缓存

一位用户分享说,他们使用 antirez 的 DwarfStar-4 配置,在 DGX Spark 上复现了 DeepSeek-V4-Flash-0731 的运行,证实了该设备在单机上的出色性能。

0 人收藏 0 人点赞
#dgx-spark

Show HN: NixOS-DGX-Spark – 在 DGX Spark 上使用 Nix 和 NixOS

Hacker News Top · 2026-08-02 缓存

这个开源项目支持在 NVIDIA DGX Spark 上使用 Nix 和 NixOS,提供 USB 启动镜像和一个用于配置硬件的 NixOS 模块。

0 人收藏 0 人点赞
#dgx-spark

搭建16xGB10(DGX Spark)集群

Reddit r/LocalLLaMA · 2026-08-02

用户正在搭建一个16节点的DGX Spark集群,以便本地运行前沿开放模型,并讨论200与100 Gbit/s之间的网络权衡。

0 人收藏 0 人点赞
#dgx-spark

MoE的VRAM磁盘缓存使单块DGX Spark上的Kimi 2.7达到340 pp/s和9.6 tg/s

Reddit r/LocalLLaMA · 2026-07-22

一种详细策略,通过将VRAM用作磁盘缓存,结合统一内存和llama.cpp设置,在单块DGX Spark上为Kimi K2.7实现了340 pp/s和9.6 tg/s。

0 人收藏 0 人点赞
#dgx-spark

Nvidia DGX Spark 作为日常使用的电脑

Hacker News Top · 2026-07-19 缓存

作者评价了 NVIDIA DGX Spark 作为一款功能强大的通用计算机,尽管它主要是一款人工智能开发设备,但其性能、能效以及能够运行《孤岛危机》等游戏的能力都备受称赞。

0 人收藏 0 人点赞
#dgx-spark

@MiaAI_lab: 刚刚为您的 2 台 DGX Sparks 升级了 DeepSeek v4 Flash。单次每秒 66.6 tokens,6 个并发会话时可达 153.7 tokens/秒……

X AI KOLs Timeline · 2026-07-15 缓存

MiaAI Lab 发布了一项升级方案,用于在两台 DGX Spark 节点上使用 vLLM 结合 DSpark 推测解码和 NVFP4 KV-cache 来部署 DeepSeek V4 Flash,在六个并发会话中实现了高达 153.7 tokens/秒 的吞吐量。

0 人收藏 0 人点赞
#dgx-spark

@AgentSparko: 我在DGX Spark上测试了PrismML Bonsai 27B,但我觉得在构建llama.cpp时好像搞错了什么,因为速度…

X AI KOLs Timeline · 2026-07-15 缓存

用户测试了PrismML的新Bonsai 27B模型在Nvidia DGX Spark上的表现,报告了基准测试速度以及llama.cpp构建的问题,同时PrismML宣布该模型是首款能在手机上运行的27B级模型。

0 人收藏 0 人点赞
#dgx-spark

GLM-5.2-Int4-Int8 在 8× GB10 上:约 1,200 t/s 预填充,33–54 t/s 平均解码

Reddit r/LocalLLaMA · 2026-07-14 缓存

描述了在 8 节点 DGX Spark (GB10) 集群上使用定制 vLLM 分支部署和基准测试量化后的 GLM-5.2-Int4-Int8Mix 模型,实现了约 1,200 t/s 的预填充和约 35 t/s 的解码,支持 MTP 工具调用。

0 人收藏 0 人点赞
#dgx-spark

@MichaelGannotti: https://x.com/MichaelGannotti/status/2076024719371841537

X AI KOLs Timeline · 2026-07-11 缓存

一份详细报告,关于在 NVIDIA DGX Spark 上优化生产环境 vLLM 服务配置,纠正了导致 MTP acceptance 降低 34% 的标志设置。该结论基于对 90 多份 NVIDIA 官方文档的审阅以及一次包含 69 个场景的工具评估。

0 人收藏 0 人点赞
#dgx-spark

@WescheNex1q: 16人同时与Qwen3.6-35B聊天,仅用一台DGX Spark。这是真实截图,并非模拟:您看到的每个token均…

X AI KOLs Timeline · 2026-07-09 缓存

一个实时演示展示了16个并发用户在同一台DGX Spark上与Qwen3.6-35B聊天,使用vLLM上的NVFP4 + MTP-3,达到总峰值440 tok/s,每用户105 tok/s。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈