Meta Muse Glimmer – 开放权重的30B本地编码模型
摘要
Meta推出Muse Glimmer,一个采用宽松许可的30B参数模型,专为本地智能体工作流、编码和工具使用而优化,权重已在Hugging Face上发布。
暂无内容
查看缓存全文
缓存时间: 2026/08/10 11:33
# 推出 Muse Glimmer:一款可在你设备上运行的开源代理模型
今天,我们推出 Muse Glimmer——Meta Superintelligence Labs 的下一代模型,并以宽松的 Apache 2.0 许可证开放模型权重。
Muse Glimmer 是一个 300 亿参数模型,专为常驻本地的代理工作流优化。它足够小巧,可以在配备单张消费级 GPU 的 Mac 或 PC 上运行,支持从本地代理和函数调用,到本地编码,再到 LLM 作为评审(LLM-as-a-judge)评估等用例。在其尺寸类别中,Muse Glimmer 与领先模型相比,在关键代理用例和基准测试上均展现出强劲性能。
基础模型在推理、代码生成和工具使用方面已取得卓越能力——但大多数部署仍依赖云端基础设施和网络连接。本地运行模型让你可以随时随地使用 AI,无论有无互联网连接。这正变得越来越可行:开源社区已经证明,只要训练得当,较小的模型也能在针对性任务上接近前沿水平。Muse Glimmer 正是针对这些本地用例进行了优化。
秉承我们长期开放共享基础 AI 研究的传统,我们今天在 Hugging Face(https://huggingface.co/meta-models/Muse-Glimmer-30B)上发布 Muse Glimmer 开放权重,并提供开发者文档(https://dev.meta.ai/docs),帮助你立即开始构建和运行自己的代理。Muse Glimmer 的设计与开发者已在使用的工具兼容。针对 llama.cpp、MLX 和 ExecuTorch 的优化集成将在未来数天内上线,让你只需几分钟即可从下载到运行可用的代理。
## 我们如何训练 Muse Glimmer
一个能管理你的日程、起草消息、整理文件并学习你工作方式的代理,需要深度访问个人上下文。它还需要多种能力协同工作:长周期执行、精准工具调用、多模态理解、长上下文记忆以及指令遵循。
我们设计 Muse Glimmer 时,在能力与本地硬件的内存和计算约束之间寻求平衡。这需要紧凑的架构、一种新颖的蒸馏方案(将更大的教师模型的代理推理能力迁移过来),以及包括量化在内的推理优化,以满足延迟预期。我们通过以下阶段实现这一目标:
- **预训练。** 我们使用 logit 蒸馏,在 Muse Spark 的输出上训练 Muse Glimmer,并采用与教师模型相似的数据混合。
- **中期训练。** 我们使用更长上下文、更多代理密集型数据(包含更丰富的推理轨迹),结合自然数据进行训练。
- **后训练。** 我们将监督微调与策略内蒸馏以及强化学习相结合,覆盖通用、推理、编码和代理领域。
Muse Glimmer 按照 Meta 的先进 AI 扩展框架(https://ai.meta.com/blog/scaling-how-we-build-test-advanced-ai/)中设定的标准进行评估,并针对所有相关类别进行了开放权重发布评估。
## 为代理而生:Muse Glimmer 能做什么
构建有效的代理需要关键能力协同工作,以实现用户目标。Muse Glimmer 在以下每个方面都经过了训练和评估:
- **端到端代理任务完成。** Muse Glimmer 在完整任务基准测试上取得了较高的成功率,包括 DeepSearch QA、MCP-Atlas、τ-Bench 和 SWE-Bench,这些基准衡量其在脚手架内工作、编写和调试代码,以及从头到尾解决多轮请求的能力。
- **可靠的工具使用。** 该模型可处理多种函数调用,在扩展工作流中通过精确的 schema 调用工具。
- **多步推理。** Muse Glimmer 能在长周期内串联推理,在复杂、扩展的工作流中保持连贯的计划。
- **失败恢复。** 当工具调用失败或返回意外结果时,模型会接受诊断错误并重试的训练,而不是中止。
- **多模态输入与推理。** 通过专门的感知编码器,模型可接受交错文本和图像输入。这让代理能够在对话的同时理解截图、图表和文档。
- **脚手架兼容性。** Muse Glimmer 可运行于 OpenClaw 及其他代理编排模式。
- **可控努力。** Muse Glimmer 支持不同的推理强度,以便在质量与速度之间选择合适的平衡。
- **多语言。** Muse Glimmer 使用超过 100 种语言的数据进行训练。
## 性能
我们在一系列广泛的基准测试上评估了 Muse Glimmer,以评估实现高效自主代理行为所需的多方面能力。与 Gemma4-31B 和 Qwen3.6-27B 相比,Muse Glimmer 在多个广泛使用的 LLM 基准测试中,在其尺寸类别中表现出色。
表格:Muse Glimmer 30B 与 Gemma4 31B、Qwen3.6 27B 在代理、编码、多模态、安全性和推理基准上的对比。
有关评估的更多详细信息,请参阅我们的报告(https://research.meta.ai/static/muse-glimmer-methodology)。
## 为本地部署进行优化
本地代理真正有用,前提是它足够快,能够带来响应即时的体验。一个需要几分钟才能回复或规划下一步的代理,会打断真实工作的流程。我们应用了两项优化,让 Muse Glimmer 在不牺牲质量的情况下,以实用速度运行在消费级硬件上。
### 将模型装入你的设备
在全精度下,一个 300 亿参数模型需要超过 55 GB 的内存——远超任何消费级 GPU 的容量。我们使用量化技术将模型权重压缩到约 4 位精度,将语言模型缩小到 20 GB 以下。这为模型的工作内存(其“KV 缓存”)、用于图像理解的感知编码器,以及投机解码草稿模型留出了足够的空间,使其能在 24 GB 或 32 GB 的封装内同时运行。我们已验证,这种压缩对代理任务的性能几乎没有影响。
表格:比较全精度、K-Quant-Dynamic 和 K-Quant-17GB 的精度下降和目标硬件内存。
### 通过投机解码实现更快的生成
语言模型通常逐个 token 地生成文本,这在长推理链或多步工具调用过程中可能感觉较慢。Muse Glimmer 附带一个基于 DFlash(https://arxiv.org/abs/2602.06036)的轻量级“草稿”模型——一个小型辅助网络,可一次性提出整个 token 块。主模型随后并行验证这些提议,接受正确 token 并纠正错误 token。这项技术让 Muse Glimmer 的文本生成速度显著快于标准的逐 token 生成,同时产生完全相同的输出质量。我们在发布中提供了量化版本的草稿模型,以减少内存开销。
### 结果:
我们在 MacBook M4-Max、M5-Max 以及 RTX-5090 上测量了 K-Quant-17GB 模型搭配量化 DFlash 草稿模型的速度。该模型足够流畅地进行对话和实时代理交互,而且完全在你的设备上运行。
条形图:DFlash 投机解码使 Muse Glimmer 的解码速度在 RTX 5090 上提升 3.1 倍,在 M5 Max 上提升 1.8 倍,在 M4 Max 上提升 1.5 倍。
## 立即开始使用 Muse Glimmer
Muse Glimmer 现已可用,你可以在 Hugging Face(https://huggingface.co/meta-models/Muse-Glimmer-30B)上下载权重。未来数天内,你可以通过 Ollama、LM Studio 和 Unsloth 等合作伙伴在本地运行它,使用 llama.cpp、ExecuTorch 和 MLX 等边缘框架进行部署,通过 vLLM 和 SGLang 进行大规模服务,或通过 Together AI、Fireworks AI 和 OpenRouter 等合作伙伴快速上手。你甚至可以利用 PyTorch 的 TorchTitan 训练功能,针对自己的用例进一步定制模型。
我们还在与 AMD、Arm、Dell、Intel 和 NVIDIA 等合作伙伴合作,优化不同设备上的性能。此外,我们将发布文档,让开发者拥有使用 Muse Glimmer 入门并以负责任的方式构建所需的资源。这包括有关设置自定义脚手架的指南,让你从第一天起就更容易构建和部署个人代理。你可以在 Meta 的 AI 开发者中心(https://developer.meta.com/ai/models/muse-glimmer/)了解更多信息并找到构建资源。
这项工作建立在 Meta 长期开放 AI 研究的基础上,并将其延伸到代理 AI 领域,为开发者提供本地代理能力。我们一如既往地欢迎社区反馈,并期待看到开发者使用这个开放权重模型构建出精彩的应用。
在 Hugging Face 下载模型(https://huggingface.co/meta-models/Muse-Glimmer-30B)
开发者文档(https://dev.meta.ai/docs)
相似文章
推出 Muse Glimmer:专为常驻本地智能体工作流优化的开放权重模型
Meta 发布 Muse Glimmer,这是一款 30B 开放权重多模态模型,专为本地智能体工作流优化,采用宽松的 Apache 2.0 许可证,支持 4 位量化、推测解码,并提供广泛的生态系统集成。
Meta将开源其Muse Spark 1.2和Muse Glimmer 30B
Meta宣布将开源其Muse Spark 1.2和Muse Glimmer 30B模型,称其为自Llama 4和3以来最大的开放权重。
Meta 即将发布其最新基础模型 Muse Spark 1.2 的权重。
Meta 正准备发布其最新基础模型 Muse Spark 1.2 的权重,该模型将可供广泛使用。
@TheAhmadOsman:Meta 的新开源模型 Muse Glimmer 30B,Apache-2.0
Meta 宣布推出新的开源模型 Muse Glimmer 30B,采用 Apache-2.0 许可证。
Meta称其新AI模型在编程领域已具备竞争力
Meta发布Muse Spark 1.1,这是一款面向高级编码任务的新AI模型,包括错误检测和智能体工作流,可通过Meta模型API获取。