Meta Muse Glimmer – 开放权重的30B本地编码模型
摘要
Meta推出Muse Glimmer,一个采用宽松许可的30B参数模型,专为本地智能体工作流、编码和工具使用而优化,权重已在Hugging Face上发布。
暂无内容
查看缓存全文
缓存时间: 2026/08/10 11:33
# 推出 Muse Glimmer:一款可在你设备上运行的开源代理模型
今天,我们推出 Muse Glimmer——Meta Superintelligence Labs 的下一代模型,并以宽松的 Apache 2.0 许可证开放模型权重。
Muse Glimmer 是一个 300 亿参数模型,专为常驻本地的代理工作流优化。它足够小巧,可以在配备单张消费级 GPU 的 Mac 或 PC 上运行,支持从本地代理和函数调用,到本地编码,再到 LLM 作为评审(LLM-as-a-judge)评估等用例。在其尺寸类别中,Muse Glimmer 与领先模型相比,在关键代理用例和基准测试上均展现出强劲性能。
基础模型在推理、代码生成和工具使用方面已取得卓越能力——但大多数部署仍依赖云端基础设施和网络连接。本地运行模型让你可以随时随地使用 AI,无论有无互联网连接。这正变得越来越可行:开源社区已经证明,只要训练得当,较小的模型也能在针对性任务上接近前沿水平。Muse Glimmer 正是针对这些本地用例进行了优化。
秉承我们长期开放共享基础 AI 研究的传统,我们今天在 Hugging Face(https://huggingface.co/meta-models/Muse-Glimmer-30B)上发布 Muse Glimmer 开放权重,并提供开发者文档(https://dev.meta.ai/docs),帮助你立即开始构建和运行自己的代理。Muse Glimmer 的设计与开发者已在使用的工具兼容。针对 llama.cpp、MLX 和 ExecuTorch 的优化集成将在未来数天内上线,让你只需几分钟即可从下载到运行可用的代理。
## 我们如何训练 Muse Glimmer
一个能管理你的日程、起草消息、整理文件并学习你工作方式的代理,需要深度访问个人上下文。它还需要多种能力协同工作:长周期执行、精准工具调用、多模态理解、长上下文记忆以及指令遵循。
我们设计 Muse Glimmer 时,在能力与本地硬件的内存和计算约束之间寻求平衡。这需要紧凑的架构、一种新颖的蒸馏方案(将更大的教师模型的代理推理能力迁移过来),以及包括量化在内的推理优化,以满足延迟预期。我们通过以下阶段实现这一目标:
- **预训练。** 我们使用 logit 蒸馏,在 Muse Spark 的输出上训练 Muse Glimmer,并采用与教师模型相似的数据混合。
- **中期训练。** 我们使用更长上下文、更多代理密集型数据(包含更丰富的推理轨迹),结合自然数据进行训练。
- **后训练。** 我们将监督微调与策略内蒸馏以及强化学习相结合,覆盖通用、推理、编码和代理领域。
Muse Glimmer 按照 Meta 的先进 AI 扩展框架(https://ai.meta.com/blog/scaling-how-we-build-test-advanced-ai/)中设定的标准进行评估,并针对所有相关类别进行了开放权重发布评估。
## 为代理而生:Muse Glimmer 能做什么
构建有效的代理需要关键能力协同工作,以实现用户目标。Muse Glimmer 在以下每个方面都经过了训练和评估:
- **端到端代理任务完成。** Muse Glimmer 在完整任务基准测试上取得了较高的成功率,包括 DeepSearch QA、MCP-Atlas、τ-Bench 和 SWE-Bench,这些基准衡量其在脚手架内工作、编写和调试代码,以及从头到尾解决多轮请求的能力。
- **可靠的工具使用。** 该模型可处理多种函数调用,在扩展工作流中通过精确的 schema 调用工具。
- **多步推理。** Muse Glimmer 能在长周期内串联推理,在复杂、扩展的工作流中保持连贯的计划。
- **失败恢复。** 当工具调用失败或返回意外结果时,模型会接受诊断错误并重试的训练,而不是中止。
- **多模态输入与推理。** 通过专门的感知编码器,模型可接受交错文本和图像输入。这让代理能够在对话的同时理解截图、图表和文档。
- **脚手架兼容性。** Muse Glimmer 可运行于 OpenClaw 及其他代理编排模式。
- **可控努力。** Muse Glimmer 支持不同的推理强度,以便在质量与速度之间选择合适的平衡。
- **多语言。** Muse Glimmer 使用超过 100 种语言的数据进行训练。
## 性能
我们在一系列广泛的基准测试上评估了 Muse Glimmer,以评估实现高效自主代理行为所需的多方面能力。与 Gemma4-31B 和 Qwen3.6-27B 相比,Muse Glimmer 在多个广泛使用的 LLM 基准测试中,在其尺寸类别中表现出色。
表格:Muse Glimmer 30B 与 Gemma4 31B、Qwen3.6 27B 在代理、编码、多模态、安全性和推理基准上的对比。
有关评估的更多详细信息,请参阅我们的报告(https://research.meta.ai/static/muse-glimmer-methodology)。
## 为本地部署进行优化
本地代理真正有用,前提是它足够快,能够带来响应即时的体验。一个需要几分钟才能回复或规划下一步的代理,会打断真实工作的流程。我们应用了两项优化,让 Muse Glimmer 在不牺牲质量的情况下,以实用速度运行在消费级硬件上。
### 将模型装入你的设备
在全精度下,一个 300 亿参数模型需要超过 55 GB 的内存——远超任何消费级 GPU 的容量。我们使用量化技术将模型权重压缩到约 4 位精度,将语言模型缩小到 20 GB 以下。这为模型的工作内存(其“KV 缓存”)、用于图像理解的感知编码器,以及投机解码草稿模型留出了足够的空间,使其能在 24 GB 或 32 GB 的封装内同时运行。我们已验证,这种压缩对代理任务的性能几乎没有影响。
表格:比较全精度、K-Quant-Dynamic 和 K-Quant-17GB 的精度下降和目标硬件内存。
### 通过投机解码实现更快的生成
语言模型通常逐个 token 地生成文本,这在长推理链或多步工具调用过程中可能感觉较慢。Muse Glimmer 附带一个基于 DFlash(https://arxiv.org/abs/2602.06036)的轻量级“草稿”模型——一个小型辅助网络,可一次性提出整个 token 块。主模型随后并行验证这些提议,接受正确 token 并纠正错误 token。这项技术让 Muse Glimmer 的文本生成速度显著快于标准的逐 token 生成,同时产生完全相同的输出质量。我们在发布中提供了量化版本的草稿模型,以减少内存开销。
### 结果:
我们在 MacBook M4-Max、M5-Max 以及 RTX-5090 上测量了 K-Quant-17GB 模型搭配量化 DFlash 草稿模型的速度。该模型足够流畅地进行对话和实时代理交互,而且完全在你的设备上运行。
条形图:DFlash 投机解码使 Muse Glimmer 的解码速度在 RTX 5090 上提升 3.1 倍,在 M5 Max 上提升 1.8 倍,在 M4 Max 上提升 1.5 倍。
## 立即开始使用 Muse Glimmer
Muse Glimmer 现已可用,你可以在 Hugging Face(https://huggingface.co/meta-models/Muse-Glimmer-30B)上下载权重。未来数天内,你可以通过 Ollama、LM Studio 和 Unsloth 等合作伙伴在本地运行它,使用 llama.cpp、ExecuTorch 和 MLX 等边缘框架进行部署,通过 vLLM 和 SGLang 进行大规模服务,或通过 Together AI、Fireworks AI 和 OpenRouter 等合作伙伴快速上手。你甚至可以利用 PyTorch 的 TorchTitan 训练功能,针对自己的用例进一步定制模型。
我们还在与 AMD、Arm、Dell、Intel 和 NVIDIA 等合作伙伴合作,优化不同设备上的性能。此外,我们将发布文档,让开发者拥有使用 Muse Glimmer 入门并以负责任的方式构建所需的资源。这包括有关设置自定义脚手架的指南,让你从第一天起就更容易构建和部署个人代理。你可以在 Meta 的 AI 开发者中心(https://developer.meta.com/ai/models/muse-glimmer/)了解更多信息并找到构建资源。
这项工作建立在 Meta 长期开放 AI 研究的基础上,并将其延伸到代理 AI 领域,为开发者提供本地代理能力。我们一如既往地欢迎社区反馈,并期待看到开发者使用这个开放权重模型构建出精彩的应用。
在 Hugging Face 下载模型(https://huggingface.co/meta-models/Muse-Glimmer-30B)
开发者文档(https://dev.meta.ai/docs)
相似文章
推出 Muse Glimmer:专为常驻本地智能体工作流优化的开放权重模型
Meta 发布 Muse Glimmer,这是一款 30B 开放权重多模态模型,专为本地智能体工作流优化,采用宽松的 Apache 2.0 许可证,支持 4 位量化、推测解码,并提供广泛的生态系统集成。
Meta携Muse Glimmer回归:本地、智能体、多模态且开源
Meta发布了Muse Glimmer,这是一个基于Apache 2.0的30B多模态智能体模型,专为本地部署设计,并在Hugging Face库中提供首发支持。
Meta将开源其Muse Spark 1.2和Muse Glimmer 30B
Meta宣布将开源其Muse Spark 1.2和Muse Glimmer 30B模型,称其为自Llama 4和3以来最大的开放权重。
Meta 开源 Muse Glimmer 30B Agent 模型,扎克伯格推动个人超级智能愿景
Meta 开源了 Muse Glimmer,这是一个采用 Apache 2.0 协议的 30B 参数多模态 Agent 模型,针对本地工具使用和编码进行了优化,通过 4-bit 量化压缩至 20GB 以下,可在消费级 GPU 上运行。扎克伯格还承诺开源 Muse Spark 1.2 的权重,并设立 10 亿美元社区基金用于数据中心所在地区。
Meta 即将发布其最新基础模型 Muse Spark 1.2 的权重。
Meta 正准备发布其最新基础模型 Muse Spark 1.2 的权重,该模型将可供广泛使用。