本地测试 Nemotron 3.5 Lightning 的编码、Hermes Agent 与智能体工作

Reddit r/LocalLLaMA 新闻

摘要

用户使用 llama.cpp 和量化(quants)在本地测试了 Nemotron 3.5 Lightning,发现速度和智能体工具调用表现良好,但就模型大小而言,编码输出低于预期。

使用 bartowski 提供的量化(Q5)和 MTP 版本,通过 llama.cpp 服务器运行该模型。在配备 48GB 内存的 M5 Pro 上占用约 24GB 内存,速度约为 65 tokens/s。在某些任务上,它相当过度思考。总体而言,代码输出质量远低于该尺寸模型的预期水平(不过作者也对此有所披露,而且这并非该模型的优化重点)。在 Hermes Agent 中,它在速度和工具调用能力方面都表现非常好。观看更多:https://www.youtube.com/watch?v=I8Ypa3yK91s
查看原文

相似文章

我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测

Reddit r/LocalLLaMA

一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。

首次实现本地真实编程工作

Reddit r/LocalLLaMA

开发者借助 Qwen3.6-35B 4-bit MLX 模型与 pi.dev 工具,在当前硬件上实现了高效的本地智能体编程,顺利完成了实际项目工单。