在本地使用 OpenCode 测试 Muse Glimmer 的编码与智能体工作

Reddit r/LocalLLaMA 模型

摘要

一位用户分享了在 llama.cpp 上使用 OpenCode 对 Muse Glimmer(通过 Unsloth 的 Q4 量化)进行本地测试,指出其性能低于 Qwen3.6 27B,但工具调用可靠。

使用 Unsloth 的量化(Q4)版本,配合最新的(从主分支构建的)llama.cpp 服务器运行该模型。在配备 48GB 内存的 M5 Pro 上,占用约 20GB 内存,速度约为 17t/s。没有进行任何推理循环/过度思考。总体而言,它低于 Qwen3.6 27B,无法获得良好的代码(前端和后端)结果。积极的一面是,它没有出现任何工具调用失败。你们的看法/发现?观看更多:https://www.youtube.com/watch?v=_5wKhkUT438
查看原文

相似文章

推出 Muse Glimmer

Simon Willison's Blog

Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。

编码实测:BF16 Muse Glimmer 对比 BF16 Qwen3.6 27B

Reddit r/LocalLLaMA

对 BF16 Muse Glimmer 与 BF16 Qwen3.6 27B 进行实战编码对比,评估其在复杂企业级 Web 应用上的诊断质量、实现可靠性和自我修正能力。Qwen 在顽固 bug 上表现出更好的持久性,而 Muse Glimmer 在迭代修复方面较为吃力。

被低估的 Muse Glimmer

Reddit r/LocalLLaMA

基准测试结果显示,Muse Glimmer 在隐式知识测试中出人意料地超越了 qwen3.8,这表明较小的模型通过 RAG 增强可以实现有竞争力的性能。