在本地使用 OpenCode 测试 Muse Glimmer 的编码与智能体工作
摘要
一位用户分享了在 llama.cpp 上使用 OpenCode 对 Muse Glimmer(通过 Unsloth 的 Q4 量化)进行本地测试,指出其性能低于 Qwen3.6 27B,但工具调用可靠。
使用 Unsloth 的量化(Q4)版本,配合最新的(从主分支构建的)llama.cpp 服务器运行该模型。在配备 48GB 内存的 M5 Pro 上,占用约 20GB 内存,速度约为 17t/s。没有进行任何推理循环/过度思考。总体而言,它低于 Qwen3.6 27B,无法获得良好的代码(前端和后端)结果。积极的一面是,它没有出现任何工具调用失败。你们的看法/发现?观看更多:https://www.youtube.com/watch?v=_5wKhkUT438
相似文章
推出 Muse Glimmer
Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。
编码实测:BF16 Muse Glimmer 对比 BF16 Qwen3.6 27B
对 BF16 Muse Glimmer 与 BF16 Qwen3.6 27B 进行实战编码对比,评估其在复杂企业级 Web 应用上的诊断质量、实现可靠性和自我修正能力。Qwen 在顽固 bug 上表现出更好的持久性,而 Muse Glimmer 在迭代修复方面较为吃力。
被低估的 Muse Glimmer
基准测试结果显示,Muse Glimmer 在隐式知识测试中出人意料地超越了 qwen3.8,这表明较小的模型通过 RAG 增强可以实现有竞争力的性能。
我在 1M 上下文下运行了 Muse Glimmer - 所有测试均通过。
用户在 2× DGX Spark 集群上测试了 Meta 的 Muse Glimmer 30B,使用 YaRN 将上下文从 131K 扩展到 1M tokens,并确认在 832K tokens 下通过检索。报告称 DFlash 投机解码带来了约 3 倍加速,并分享了完整配置。
推出 Muse Glimmer:专为常驻本地智能体工作流优化的开放权重模型
Meta 发布 Muse Glimmer,这是一款 30B 开放权重多模态模型,专为本地智能体工作流优化,采用宽松的 Apache 2.0 许可证,支持 4 位量化、推测解码,并提供广泛的生态系统集成。