@xiaomovps: 公司开始用AI后,很快就会撞上几个硬问题:数据能不能外传、成本能不能控住、内部模型到底要不要自己养。 这篇记录的是一次很真实的周末操作——远程连上公司那台DGX Spark,亲手把Ling-3.0-flash跑通。没有停在“能不能跑”,而…
摘要
本文记录了作者在周末远程连接公司DGX Spark服务器,成功部署Ling-3.0-flash模型的完整过程,包括选型、部署、性能测试和开发工具对接,并分享了对本地部署作为可控中间态的见解。
查看缓存全文
缓存时间: 2026/08/18 12:26
公司开始用AI后,很快就会撞上几个硬问题:数据能不能外传、成本能不能控住、内部模型到底要不要自己养。
这篇记录的是一次很真实的周末操作——远程连上公司那台DGX Spark,亲手把Ling-3.0-flash跑通。没有停在“能不能跑”,而是把选型、部署、测速、对接开发工具的完整路径都写清楚了。
核心判断很干脆:这台机器更适合跑稀疏MoE,而不是大Dense。Ling总参数124B,每次只激活约5.1B,刚好能把统一内存吃透。推理引擎也直接上了vLLM,而不是更轻便的Ollama——在这个级别的硬件上,并发和吞吐差距太明显。
最有味道的是最后那段感受:本地部署不是终点,而是一种可控的中间态。外部API负责快速调用,内部机器负责敏感数据和持续推理。AI能辅助的尽量让它辅助,但流程原理最好自己搞清楚,否则出问题很难定位。
对正在纠结要不要给团队上本地模型的人,这篇比单纯的跑分有用得多。
相似文章
@MinLiBuilds: https://x.com/MinLiBuilds/status/2089338660386992295
本文对比了NVIDIA DGX Spark和魔改RTX 4090在本地部署Qwen3.8-27B和Ling-3.0-flash模型的性能,提供了基准测试数据和购买建议。
Ling-3.0-flash MXFP4 发布,并在单个 DGX Spark 上本地运行。
Ling-3.0-flash MXFP4 是一款量化模型,已发布并可在单个 DGX Spark 上本地运行,实现约 80 tok/s 的解码速度和 2,500–3,500 tok/s 的长输入预填充速度,从而为编码、智能体和离线批处理任务提供私有的设备端推理。
@zhixianio: 这两天新机器到了之后,我开始了「苦行僧」式的强迫自己使用本地模型来完成常见任务的修行 本以为会非常痛苦,没想到无论是速度还是质量都大大超出我的预期: 模型: Qwen3.6-35B-A3B-oQ6-fp16-mtp 运行:oMLX,开 N…
作者在本地新机器上使用Qwen3.6-35B-A3B模型和oMLX工具进行日常任务,发现速度和效果远超预期,甚至在PA和Coding场景下优于远程LLM,体现了端侧AI能力的显著提升。
@DeRonin_: 我目前的本机AI配置:- 2x DGX Spark 链接 (256gb) > GLM 5.2 @ 2bit, 推理 + 代理循环 - Mac Studio M3 Ultr…
一位用户描述了他们完全本地的AI堆栈,使用多个硬件设备运行GLM、Qwen和Kimi等中国模型,声称相比GPT-5.5和Opus 4.8等前沿模型节省了87%的成本,同时提到了自托管视频生成的计划。
@hkdom: 思前想後數星期,最終還是入手了 MSI 的 DGX Spark,主要用來跑 DeepSeek V4 Flash 0731 加 DeepSeek Harness,順便玩玩 Minimax H3 跟 Music
用户分享购买MSI DGX Spark的经历,用于运行DeepSeek V4 Flash和DeepSeek Harness等AI模型,并探索Minimax H3和Music功能。