Meta Muse Glimmer – 开放权重的30B本地编码模型

Hacker News Top 模型

摘要

Meta推出Muse Glimmer,一个采用宽松许可的30B参数模型,专为本地智能体工作流、编码和工具使用而优化,权重已在Hugging Face上发布。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/10 11:33

# 推出 Muse Glimmer:一款可在你设备上运行的开源代理模型 今天,我们推出 Muse Glimmer——Meta Superintelligence Labs 的下一代模型,并以宽松的 Apache 2.0 许可证开放模型权重。 Muse Glimmer 是一个 300 亿参数模型,专为常驻本地的代理工作流优化。它足够小巧,可以在配备单张消费级 GPU 的 Mac 或 PC 上运行,支持从本地代理和函数调用,到本地编码,再到 LLM 作为评审(LLM-as-a-judge)评估等用例。在其尺寸类别中,Muse Glimmer 与领先模型相比,在关键代理用例和基准测试上均展现出强劲性能。 基础模型在推理、代码生成和工具使用方面已取得卓越能力——但大多数部署仍依赖云端基础设施和网络连接。本地运行模型让你可以随时随地使用 AI,无论有无互联网连接。这正变得越来越可行:开源社区已经证明,只要训练得当,较小的模型也能在针对性任务上接近前沿水平。Muse Glimmer 正是针对这些本地用例进行了优化。 秉承我们长期开放共享基础 AI 研究的传统,我们今天在 Hugging Face(https://huggingface.co/meta-models/Muse-Glimmer-30B)上发布 Muse Glimmer 开放权重,并提供开发者文档(https://dev.meta.ai/docs),帮助你立即开始构建和运行自己的代理。Muse Glimmer 的设计与开发者已在使用的工具兼容。针对 llama.cpp、MLX 和 ExecuTorch 的优化集成将在未来数天内上线,让你只需几分钟即可从下载到运行可用的代理。 ## 我们如何训练 Muse Glimmer 一个能管理你的日程、起草消息、整理文件并学习你工作方式的代理,需要深度访问个人上下文。它还需要多种能力协同工作:长周期执行、精准工具调用、多模态理解、长上下文记忆以及指令遵循。 我们设计 Muse Glimmer 时,在能力与本地硬件的内存和计算约束之间寻求平衡。这需要紧凑的架构、一种新颖的蒸馏方案(将更大的教师模型的代理推理能力迁移过来),以及包括量化在内的推理优化,以满足延迟预期。我们通过以下阶段实现这一目标: - **预训练。** 我们使用 logit 蒸馏,在 Muse Spark 的输出上训练 Muse Glimmer,并采用与教师模型相似的数据混合。 - **中期训练。** 我们使用更长上下文、更多代理密集型数据(包含更丰富的推理轨迹),结合自然数据进行训练。 - **后训练。** 我们将监督微调与策略内蒸馏以及强化学习相结合,覆盖通用、推理、编码和代理领域。 Muse Glimmer 按照 Meta 的先进 AI 扩展框架(https://ai.meta.com/blog/scaling-how-we-build-test-advanced-ai/)中设定的标准进行评估,并针对所有相关类别进行了开放权重发布评估。 ## 为代理而生:Muse Glimmer 能做什么 构建有效的代理需要关键能力协同工作,以实现用户目标。Muse Glimmer 在以下每个方面都经过了训练和评估: - **端到端代理任务完成。** Muse Glimmer 在完整任务基准测试上取得了较高的成功率,包括 DeepSearch QA、MCP-Atlas、τ-Bench 和 SWE-Bench,这些基准衡量其在脚手架内工作、编写和调试代码,以及从头到尾解决多轮请求的能力。 - **可靠的工具使用。** 该模型可处理多种函数调用,在扩展工作流中通过精确的 schema 调用工具。 - **多步推理。** Muse Glimmer 能在长周期内串联推理,在复杂、扩展的工作流中保持连贯的计划。 - **失败恢复。** 当工具调用失败或返回意外结果时,模型会接受诊断错误并重试的训练,而不是中止。 - **多模态输入与推理。** 通过专门的感知编码器,模型可接受交错文本和图像输入。这让代理能够在对话的同时理解截图、图表和文档。 - **脚手架兼容性。** Muse Glimmer 可运行于 OpenClaw 及其他代理编排模式。 - **可控努力。** Muse Glimmer 支持不同的推理强度,以便在质量与速度之间选择合适的平衡。 - **多语言。** Muse Glimmer 使用超过 100 种语言的数据进行训练。 ## 性能 我们在一系列广泛的基准测试上评估了 Muse Glimmer,以评估实现高效自主代理行为所需的多方面能力。与 Gemma4-31B 和 Qwen3.6-27B 相比,Muse Glimmer 在多个广泛使用的 LLM 基准测试中,在其尺寸类别中表现出色。 表格:Muse Glimmer 30B 与 Gemma4 31B、Qwen3.6 27B 在代理、编码、多模态、安全性和推理基准上的对比。 有关评估的更多详细信息,请参阅我们的报告(https://research.meta.ai/static/muse-glimmer-methodology)。 ## 为本地部署进行优化 本地代理真正有用,前提是它足够快,能够带来响应即时的体验。一个需要几分钟才能回复或规划下一步的代理,会打断真实工作的流程。我们应用了两项优化,让 Muse Glimmer 在不牺牲质量的情况下,以实用速度运行在消费级硬件上。 ### 将模型装入你的设备 在全精度下,一个 300 亿参数模型需要超过 55 GB 的内存——远超任何消费级 GPU 的容量。我们使用量化技术将模型权重压缩到约 4 位精度,将语言模型缩小到 20 GB 以下。这为模型的工作内存(其“KV 缓存”)、用于图像理解的感知编码器,以及投机解码草稿模型留出了足够的空间,使其能在 24 GB 或 32 GB 的封装内同时运行。我们已验证,这种压缩对代理任务的性能几乎没有影响。 表格:比较全精度、K-Quant-Dynamic 和 K-Quant-17GB 的精度下降和目标硬件内存。 ### 通过投机解码实现更快的生成 语言模型通常逐个 token 地生成文本,这在长推理链或多步工具调用过程中可能感觉较慢。Muse Glimmer 附带一个基于 DFlash(https://arxiv.org/abs/2602.06036)的轻量级“草稿”模型——一个小型辅助网络,可一次性提出整个 token 块。主模型随后并行验证这些提议,接受正确 token 并纠正错误 token。这项技术让 Muse Glimmer 的文本生成速度显著快于标准的逐 token 生成,同时产生完全相同的输出质量。我们在发布中提供了量化版本的草稿模型,以减少内存开销。 ### 结果: 我们在 MacBook M4-Max、M5-Max 以及 RTX-5090 上测量了 K-Quant-17GB 模型搭配量化 DFlash 草稿模型的速度。该模型足够流畅地进行对话和实时代理交互,而且完全在你的设备上运行。 条形图:DFlash 投机解码使 Muse Glimmer 的解码速度在 RTX 5090 上提升 3.1 倍,在 M5 Max 上提升 1.8 倍,在 M4 Max 上提升 1.5 倍。 ## 立即开始使用 Muse Glimmer Muse Glimmer 现已可用,你可以在 Hugging Face(https://huggingface.co/meta-models/Muse-Glimmer-30B)上下载权重。未来数天内,你可以通过 Ollama、LM Studio 和 Unsloth 等合作伙伴在本地运行它,使用 llama.cpp、ExecuTorch 和 MLX 等边缘框架进行部署,通过 vLLM 和 SGLang 进行大规模服务,或通过 Together AI、Fireworks AI 和 OpenRouter 等合作伙伴快速上手。你甚至可以利用 PyTorch 的 TorchTitan 训练功能,针对自己的用例进一步定制模型。 我们还在与 AMD、Arm、Dell、Intel 和 NVIDIA 等合作伙伴合作,优化不同设备上的性能。此外,我们将发布文档,让开发者拥有使用 Muse Glimmer 入门并以负责任的方式构建所需的资源。这包括有关设置自定义脚手架的指南,让你从第一天起就更容易构建和部署个人代理。你可以在 Meta 的 AI 开发者中心(https://developer.meta.com/ai/models/muse-glimmer/)了解更多信息并找到构建资源。 这项工作建立在 Meta 长期开放 AI 研究的基础上,并将其延伸到代理 AI 领域,为开发者提供本地代理能力。我们一如既往地欢迎社区反馈,并期待看到开发者使用这个开放权重模型构建出精彩的应用。 在 Hugging Face 下载模型(https://huggingface.co/meta-models/Muse-Glimmer-30B) 开发者文档(https://dev.meta.ai/docs)

相似文章

Meta 开源 Muse Glimmer 30B Agent 模型,扎克伯格推动个人超级智能愿景

Reddit r/ArtificialInteligence

Meta 开源了 Muse Glimmer,这是一个采用 Apache 2.0 协议的 30B 参数多模态 Agent 模型,针对本地工具使用和编码进行了优化,通过 4-bit 量化压缩至 20GB 以下,可在消费级 GPU 上运行。扎克伯格还承诺开源 Muse Spark 1.2 的权重,并设立 10 亿美元社区基金用于数据中心所在地区。