推出 Muse Glimmer:专为常驻本地智能体工作流优化的开放权重模型

Reddit r/LocalLLaMA 模型

摘要

Meta 发布 Muse Glimmer,这是一款 30B 开放权重多模态模型,专为本地智能体工作流优化,采用宽松的 Apache 2.0 许可证,支持 4 位量化、推测解码,并提供广泛的生态系统集成。

嗨,r/LocalLLaMA 👋 今天,我们激动地发布 Muse Glimmer,这是一个 30B 开放权重模型,专为本地智能体工作流而构建。我们将以宽松的 Apache 2.0 许可证向社区开放权重。 一些规格 - 30B 参数,密集(dense)架构 - 多模态:通过专用感知编码器交错处理文本与图像 - 在 100 多种语言上训练 - 可控的推理投入(质量/速度权衡) 内存占用 在全精度下,30B 模型需要 55 GB 以上内存,远超消费级硬件的承受能力。我们将权重量化为约 4 位,使语言模型(LM)内存占用低于 20 GB。这样在 24 GB 或 32 GB 的内存空间中,还能为 KV 缓存、感知编码器和推测解码草稿模型的并行运行留出余量。我们验证了在压缩状态下,智能体任务几乎没有性能损失。 推测解码 附带一个基于 DFlash 的轻量级草稿模型,它会提出一批 token 块,由主模型并行验证。相比逐 token 生成,速度大幅提升,且输出质量完全相同。我们还发布了量化版草稿模型,以保持较小的内存开销。 部分能力 我们针对智能体循环任务训练了 Muse Glimmer,包括: - 端到端任务完成(在 DeepSearch QA、MCP-Atlas、𝛕3-Bench、SWE-Bench 等任务上表现优异) - 在长工作流中按照精确 schema 进行函数调用 - 长时段的多步推理 - 故障恢复——当工具调用失败或返回意外结果时,模型会被训练去诊断并重试,而不是中止。这是一个刻意的训练目标。 - 支持 OpenClaw 及其他智能体脚手架 - 多模态理解与推理 运行方式 权重已上线 Hugging Face。即将支持:Ollama、LM Studio、Unsloth 和 torchtitan,以及针对 llama.cpp、MLX 和 ExecuTorch 的优化集成。vLLM 和 SGLang 用于服务部署。可通过 Together AI、Fireworks AI 和 OpenRouter 快速上手。我们还与 AMD、Arm、Dell、Intel 和 NVIDIA 合作进行逐设备优化。 我们期待您的反馈,并期待看到社区用 Muse Glimmer 构建的应用。 🔗 权重:https://huggingface.co/meta-models 🔗 研究博客:https://go.meta.me/museglimmer 🔗 资源:https://developer.meta.com/ai/models/muse-glimmer/
查看原文

相似文章

Muse Spark 1.1 发布

Simon Willison's Blog

Meta 发布了 Muse Spark 1.1,这是首个提供 API 的 Spark 模型,在代理工具调用和计算机使用方面进行了改进。