本地测试 Nemotron 3.5 Lightning 的编码、Hermes Agent 与智能体工作
摘要
用户使用 llama.cpp 和量化(quants)在本地测试了 Nemotron 3.5 Lightning,发现速度和智能体工具调用表现良好,但就模型大小而言,编码输出低于预期。
使用 bartowski 提供的量化(Q5)和 MTP 版本,通过 llama.cpp 服务器运行该模型。在配备 48GB 内存的 M5 Pro 上占用约 24GB 内存,速度约为 65 tokens/s。在某些任务上,它相当过度思考。总体而言,代码输出质量远低于该尺寸模型的预期水平(不过作者也对此有所披露,而且这并非该模型的优化重点)。在 Hermes Agent 中,它在速度和工具调用能力方面都表现非常好。观看更多:https://www.youtube.com/watch?v=I8Ypa3yK91s
相似文章
实测 OpenCode 与自托管 LLM 的协作:Qwen 3.5、3.6、Gemma 4、Nemotron 3、GLM-4.7 Flash - v2
一位开发者在 RTX 4080 上用 OpenCode 对多款自托管 LLM(Qwen 3.5/3.6、Gemma 4、Nemotron 3、GLM-4.7)进行两项编码任务基准测试,揭示了速度与质量的权衡。
在本地使用 OpenCode 测试 Muse Glimmer 的编码与智能体工作
一位用户分享了在 llama.cpp 上使用 OpenCode 对 Muse Glimmer(通过 Unsloth 的 Q4 量化)进行本地测试,指出其性能低于 Qwen3.6 27B,但工具调用可靠。
@heyshrutimishra:NVIDIA 刚刚发布了 Nemotron 3.5 Lightning,300 亿参数,只有 30 亿激活,专为执行层打造…
NVIDIA 发布了 Nemotron 3.5 Lightning,这是一个拥有 300 亿参数的 MoE 模型,只有 30 亿激活参数,针对智能体执行任务进行了优化。它声称在保持 OpenMDW-1.1 完全开源的同时,实现更快、更便宜的工具调用和智能体执行。
我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测
一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。
首次实现本地真实编程工作
开发者借助 Qwen3.6-35B 4-bit MLX 模型与 pi.dev 工具,在当前硬件上实现了高效的本地智能体编程,顺利完成了实际项目工单。