被低估的 Muse Glimmer

Reddit r/LocalLLaMA 新闻

摘要

基准测试结果显示,Muse Glimmer 在隐式知识测试中出人意料地超越了 qwen3.8,这表明较小的模型通过 RAG 增强可以实现有竞争力的性能。

对 qwen3.8 的 xhigh、medium 和 muse glimmer 进行了基准测试。qwen3.8 的 xhigh 努力模式花费了近 30 小时。(并且由于 32K 输出 token 限制,仍然在 16 个案例上失败)medium 努力模式和 muse glimmer 各花了 3-4 小时。但我实际上对 muse glimmer 的结果感到惊讶,它们比 qwen 更好。这些基准测试是针对模型的隐式知识,这对较小的模型有点不公平,但加入 RAG,我确信它们能与前沿模型相媲美。我直接从 ecro 的 embedeval 仓库获取了 claude 模型的结果。
查看原文

相似文章

推出 Muse Glimmer

Simon Willison's Blog

Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。

Muse-glimmer-30b 在创意写作中远超预期

Reddit r/LocalLLaMA

作者测试了Muse-glimmer-30b模型在创意写作方面的表现,发现它令人印象深刻,在模仿作家风格方面优于其他本地模型如qwen3.8-27b。