@xiaomovps: 公司开始用AI后,很快就会撞上几个硬问题:数据能不能外传、成本能不能控住、内部模型到底要不要自己养。 这篇记录的是一次很真实的周末操作——远程连上公司那台DGX Spark,亲手把Ling-3.0-flash跑通。没有停在“能不能跑”,而…

X AI KOLs Timeline 新闻

摘要

本文记录了作者在周末远程连接公司DGX Spark服务器,成功部署Ling-3.0-flash模型的完整过程,包括选型、部署、性能测试和开发工具对接,并分享了对本地部署作为可控中间态的见解。

公司开始用AI后,很快就会撞上几个硬问题:数据能不能外传、成本能不能控住、内部模型到底要不要自己养。 这篇记录的是一次很真实的周末操作——远程连上公司那台DGX Spark,亲手把Ling-3.0-flash跑通。没有停在“能不能跑”,而是把选型、部署、测速、对接开发工具的完整路径都写清楚了。 核心判断很干脆:这台机器更适合跑稀疏MoE,而不是大Dense。Ling总参数124B,每次只激活约5.1B,刚好能把统一内存吃透。推理引擎也直接上了vLLM,而不是更轻便的Ollama——在这个级别的硬件上,并发和吞吐差距太明显。 最有味道的是最后那段感受:本地部署不是终点,而是一种可控的中间态。外部API负责快速调用,内部机器负责敏感数据和持续推理。AI能辅助的尽量让它辅助,但流程原理最好自己搞清楚,否则出问题很难定位。 对正在纠结要不要给团队上本地模型的人,这篇比单纯的跑分有用得多。
查看原文
查看缓存全文

缓存时间: 2026/08/18 12:26

公司开始用AI后,很快就会撞上几个硬问题:数据能不能外传、成本能不能控住、内部模型到底要不要自己养。

这篇记录的是一次很真实的周末操作——远程连上公司那台DGX Spark,亲手把Ling-3.0-flash跑通。没有停在“能不能跑”,而是把选型、部署、测速、对接开发工具的完整路径都写清楚了。

核心判断很干脆:这台机器更适合跑稀疏MoE,而不是大Dense。Ling总参数124B,每次只激活约5.1B,刚好能把统一内存吃透。推理引擎也直接上了vLLM,而不是更轻便的Ollama——在这个级别的硬件上,并发和吞吐差距太明显。

最有味道的是最后那段感受:本地部署不是终点,而是一种可控的中间态。外部API负责快速调用,内部机器负责敏感数据和持续推理。AI能辅助的尽量让它辅助,但流程原理最好自己搞清楚,否则出问题很难定位。

对正在纠结要不要给团队上本地模型的人,这篇比单纯的跑分有用得多。

相似文章

Ling-3.0-flash MXFP4 发布,并在单个 DGX Spark 上本地运行。

Reddit r/LocalLLaMA

Ling-3.0-flash MXFP4 是一款量化模型,已发布并可在单个 DGX Spark 上本地运行,实现约 80 tok/s 的解码速度和 2,500–3,500 tok/s 的长输入预填充速度,从而为编码、智能体和离线批处理任务提供私有的设备端推理。

@zhixianio: 这两天新机器到了之后,我开始了「苦行僧」式的强迫自己使用本地模型来完成常见任务的修行 本以为会非常痛苦,没想到无论是速度还是质量都大大超出我的预期: 模型: Qwen3.6-35B-A3B-oQ6-fp16-mtp 运行:oMLX,开 N…

X AI KOLs Timeline

作者在本地新机器上使用Qwen3.6-35B-A3B模型和oMLX工具进行日常任务,发现速度和效果远超预期,甚至在PA和Coding场景下优于远程LLM,体现了端侧AI能力的显著提升。