被低估的 Muse Glimmer
摘要
基准测试结果显示,Muse Glimmer 在隐式知识测试中出人意料地超越了 qwen3.8,这表明较小的模型通过 RAG 增强可以实现有竞争力的性能。
对 qwen3.8 的 xhigh、medium 和 muse glimmer 进行了基准测试。qwen3.8 的 xhigh 努力模式花费了近 30 小时。(并且由于 32K 输出 token 限制,仍然在 16 个案例上失败)medium 努力模式和 muse glimmer 各花了 3-4 小时。但我实际上对 muse glimmer 的结果感到惊讶,它们比 qwen 更好。这些基准测试是针对模型的隐式知识,这对较小的模型有点不公平,但加入 RAG,我确信它们能与前沿模型相媲美。我直接从 ecro 的 embedeval 仓库获取了 claude 模型的结果。
相似文章
推出 Muse Glimmer
Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。
使用一天后,我觉得可以这么说:Muse-Glimmer-30B 在部分使用场景下终于以同等规模击败了 3.6-27B
一位用户报告称,Muse-Glimmer-30B 在推理效率和常识知识方面优于 Qwen3.6-27B,但在编码方面稍弱,使其成为 24GB GPU 上的可行选择。
在本地使用 OpenCode 测试 Muse Glimmer 的编码与智能体工作
一位用户分享了在 llama.cpp 上使用 OpenCode 对 Muse Glimmer(通过 Unsloth 的 Q4 量化)进行本地测试,指出其性能低于 Qwen3.6 27B,但工具调用可靠。
Muse-glimmer-30b 在创意写作中远超预期
作者测试了Muse-glimmer-30b模型在创意写作方面的表现,发现它令人印象深刻,在模仿作家风格方面优于其他本地模型如qwen3.8-27b。
推出 Muse Glimmer:专为常驻本地智能体工作流优化的开放权重模型
Meta 发布 Muse Glimmer,这是一款 30B 开放权重多模态模型,专为本地智能体工作流优化,采用宽松的 Apache 2.0 许可证,支持 4 位量化、推测解码,并提供广泛的生态系统集成。