推出 Muse Glimmer:专为常驻本地智能体工作流优化的开放权重模型
摘要
Meta 发布 Muse Glimmer,这是一款 30B 开放权重多模态模型,专为本地智能体工作流优化,采用宽松的 Apache 2.0 许可证,支持 4 位量化、推测解码,并提供广泛的生态系统集成。
嗨,r/LocalLLaMA 👋 今天,我们激动地发布 Muse Glimmer,这是一个 30B 开放权重模型,专为本地智能体工作流而构建。我们将以宽松的 Apache 2.0 许可证向社区开放权重。
一些规格
- 30B 参数,密集(dense)架构
- 多模态:通过专用感知编码器交错处理文本与图像
- 在 100 多种语言上训练
- 可控的推理投入(质量/速度权衡)
内存占用
在全精度下,30B 模型需要 55 GB 以上内存,远超消费级硬件的承受能力。我们将权重量化为约 4 位,使语言模型(LM)内存占用低于 20 GB。这样在 24 GB 或 32 GB 的内存空间中,还能为 KV 缓存、感知编码器和推测解码草稿模型的并行运行留出余量。我们验证了在压缩状态下,智能体任务几乎没有性能损失。
推测解码
附带一个基于 DFlash 的轻量级草稿模型,它会提出一批 token 块,由主模型并行验证。相比逐 token 生成,速度大幅提升,且输出质量完全相同。我们还发布了量化版草稿模型,以保持较小的内存开销。
部分能力
我们针对智能体循环任务训练了 Muse Glimmer,包括:
- 端到端任务完成(在 DeepSearch QA、MCP-Atlas、𝛕3-Bench、SWE-Bench 等任务上表现优异)
- 在长工作流中按照精确 schema 进行函数调用
- 长时段的多步推理
- 故障恢复——当工具调用失败或返回意外结果时,模型会被训练去诊断并重试,而不是中止。这是一个刻意的训练目标。
- 支持 OpenClaw 及其他智能体脚手架
- 多模态理解与推理
运行方式
权重已上线 Hugging Face。即将支持:Ollama、LM Studio、Unsloth 和 torchtitan,以及针对 llama.cpp、MLX 和 ExecuTorch 的优化集成。vLLM 和 SGLang 用于服务部署。可通过 Together AI、Fireworks AI 和 OpenRouter 快速上手。我们还与 AMD、Arm、Dell、Intel 和 NVIDIA 合作进行逐设备优化。
我们期待您的反馈,并期待看到社区用 Muse Glimmer 构建的应用。
🔗 权重:https://huggingface.co/meta-models
🔗 研究博客:https://go.meta.me/museglimmer
🔗 资源:https://developer.meta.com/ai/models/muse-glimmer/
相似文章
Meta Muse Glimmer – 开放权重的30B本地编码模型
Meta推出Muse Glimmer,一个采用宽松许可的30B参数模型,专为本地智能体工作流、编码和工具使用而优化,权重已在Hugging Face上发布。
Meta将开源其Muse Spark 1.2和Muse Glimmer 30B
Meta宣布将开源其Muse Spark 1.2和Muse Glimmer 30B模型,称其为自Llama 4和3以来最大的开放权重。
@TheAhmadOsman:Meta 的新开源模型 Muse Glimmer 30B,Apache-2.0
Meta 宣布推出新的开源模型 Muse Glimmer 30B,采用 Apache-2.0 许可证。
Muse Spark 1.1 发布
Meta 发布了 Muse Spark 1.1,这是首个提供 API 的 Spark 模型,在代理工具调用和计算机使用方面进行了改进。
@cline: Muse Spark 1.1 刚刚发布,是他们迄今为止最强大的编码代理模型。在 Terminal-Bench 2.1 上得分 80.0%,……
Meta 发布了 Muse Spark 1.1,这是一款升级的编码代理模型,在 Terminal-Bench 2.1 上得分 80.0%,同时还公开预览了 Meta Model API。