meta-models/Muse-Glimmer-30B
摘要
Meta超级智能实验室发布了Muse-Glimmer-30B,这是一个具有感知编码器的30B参数因果语言模型,针对消费级硬件上的自主智能体任务进行了优化,支持可靠的工具使用、多步推理和多模态输入。
查看缓存全文
缓存时间: 2026/08/10 13:58
meta-models/Muse-Glimmer-30B · Hugging Face 来源:https://huggingface.co/meta-models/Muse-Glimmer-30B
https://huggingface.co/meta-models/Muse-Glimmer-30B#muse-glimmer-model-card
Muse Glimmer 模型卡片
**作者:**Meta 超级智能实验室
**模型发布日期:**2026 年 8 月
**许可证:**Apache 2.0(https://www.apache.org/licenses/LICENSE-2.0)
Muse Glimmer 是一个拥有 300 亿参数的因果语言模型,配备了专用的感知编码器,从 Muse Spark 蒸馏而来,专为在消费级硬件上运行自主智能体任务而设计。该模型将多步推理、可靠的工具使用、多模态理解和故障恢复集成到单个模型中,无需云基础设施或网络访问即可在本地运行。
构建有效的智能体需要关键能力协同工作以实现用户目标。Muse Glimmer 针对以下能力进行了训练和评估:
- **端到端智能体任务完成。**Muse Glimmer 在完整任务基准测试中取得了较高的成功率,包括 DeepSearch QA、MCP-Atlas、τ3-Bench 和 SWE-Bench,这些基准测试衡量了其在脚手架(scaffold)内工作、编写和调试代码以及从头到尾解决多轮请求的能力。
- **可靠的工具使用。**该模型可处理各种函数调用,在扩展工作流中通过精确的模式(schema)调用工具。
- **多步推理。**Muse Glimmer 在长时间跨度内进行链式推理,在复杂、扩展的工作流中维持连贯的计划。
- **故障恢复。**当工具调用失败或返回意外结果时,模型会诊断错误并重试,而不是停止。
- **多模态输入与推理。**通过专用的感知编码器,模型可接受交错的文本和图像。这使得智能体能够结合对话来解释屏幕截图、图表和文档。
- **脚手架兼容性。**Muse Glimmer 可跨 OpenClaw、Hermes Agent 及其他智能体编排模式工作。
- **可控努力程度。**该模型支持不同的推理强度,以便在质量和速度之间选择适当的平衡。
- **多语言。**Muse Glimmer 使用超过 100 种语言的数据进行训练。
https://huggingface.co/meta-models/Muse-Glimmer-30B#muse-glimmer-30b-model-overview
Muse Glimmer-30B 模型概览
模型架构 密集因果 Transformer,带感知编码器
总参数量 约 296 亿
语言模型 架构:密集因果 Transformer 参数量:296 亿(包括视觉编码器) 隐藏维度:6656 层数:52 注意力模式:[局部、局部、局部、全局] 循环 滑动窗口大小:2048 门控注意力:是 注意力头(Q / KV):32 / 2(GQA 比率 16:1) 头维度:128 FFN 类型:SwiGLU FFN 中间维度:19,968 位置编码:RoPE(θ = 500,000),仅用于局部层
感知编码器(https://arxiv.org/abs/2504.13181) 约 18 亿参数 ViT-G/14,50 层,宽度 1536,patch 大小 14
词汇表大小:202,048 分词器:200,000 个 BPE 词元 + 2,048 个特殊词元 每张图片最大视觉词元数:4,096 上下文长度:131,072+ 支持的模态:输入:文本 + 图像,输出:文本
训练数据 来自公开可用数据、第三方提供的数据以及 Meta 产品和服务信息的多模态内容,由外部供应商网络和 Meta 人员进行策展和丰富。
知识截止日期:2026 年 1 月 4 日
https://huggingface.co/meta-models/Muse-Glimmer-30B#optimized-for-local-deployments
针对本地部署优化
Muse Glimmer 针对本地部署进行了优化,旨在以实用速度在消费级硬件上运行,同时不牺牲质量。
**将模型适配到您的设备。**我们使用量化技术将模型权重压缩到约 4 位精度,将语言模型缩小到 20 GB 以下。这为模型的 KV 缓存、用于图像理解的感知编码器以及推测解码(speculative decoding)草稿模型保留了足够的余量,使其能够在 24 GB 或 32 GB 内存范围内同时运行。至关重要的是,我们验证了这种压缩在智能体任务上引入的退化极小甚至没有。
| 全精度 | K-Quant-Dynamic | K-Quant-17GB | |
|---|---|---|---|
| % 退化* | - | -0.2% | 1.0% |
| 目标硬件 | 64GB VRAM | 32GB VRAM | 24GB VRAM |
* 退化使用 15 个常见基准测试的准确性指标平均值来衡量
通过推测解码实现更快的生成
Muse Glimmer 附带一个基于 DFlash(https://arxiv.org/abs/2602.06036)的轻量级“草稿”模型,这是一个小型伴生网络,可一次提出整个词元块。DFlash 块扩散模型在单次前向传播中预测 16 个词元的整个块。主模型随后并行验证这些提议,接受正确的词元并纠正错误的词元。这项技术使 Muse Glimmer 的文本生成速度显著快于标准的逐词元生成,同时产生相同质量的输出。我们在发布版本中提供量化草稿模型版本,以减少内存开销。
| 组件 | 设置 |
|---|---|
| 草稿层 | 5 |
| 块大小 | 16 |
| 注意力 | 滑动窗口,2048,所有层 |
| 注意力头 | 32 查询 / 8 KV(GQA) |
| 序列长度 | 131,072 |
| 隐藏特征层 | 5,均匀分布于目标层:{1, 13, 25, 37, 49},共 52 层 |
我们在 MacBook M4-Max、M5-Max 以及 Nvidia RTX-5090 上测量了 K-Quant-17GB 模型以及量化 DFlash 草稿模型的速度。该模型足够快,可实现流畅对话和实时智能体交互,且完全在您的设备上运行。
| GPU | 基线无推测(tok/s) | DFlash 推测平均*(tok/s) | 加速比 |
|---|---|---|---|
| Nvidia RTX 5090 | 74.9 | 233.4 | 3.1x |
| Apple M4 Max | 23.7 | 37.8 | 1.5x |
| Apple M5 Max | 26.6 | 50.2 | 1.8x |
* 跨多组多样化提示集的平均值。测量使用批量大小 1 和贪婪解码。M4/M5 测量使用 ExecuTorch 完成,RTX 使用 llama.cpp 完成。
https://huggingface.co/meta-models/Muse-Glimmer-30B#benchmarks
基准测试
我们评估了 Muse Glimmer 在广泛基准测试上的表现,以评估有效自主智能体行为所需的各种能力。与 Gemma4-31B 和 Qwen3.6-27B 相比,Muse Glimmer 在多个广泛使用的 LLM 基准测试中,在其尺寸级别内表现强劲。
| 类别 | 基准测试 | Muse Glimmer-30B 高推理 | Gemma4-31B 思考模式 | Qwen3.6-27B 思考模式 |
|---|---|---|---|---|
| 通用智能体 | MCP Atlas(公开) | 75.5 | 54.2 | 62.5 |
| DeepSearch QA | 74.6 | 61.7 | 71.1 | |
| τ3-Banking | 23.5 | 15.1 | 16.7 | |
| WildClawBench | 47.6 | 37.6 | 43.2 | |
| GDPVal-AA v2 | 95 | 38 | 11 | |
| 1141 | ||||
| Gaia2 | 43.3 | 36.4 | 40.0 | |
| SkillsBench(带技能) | 44.3 | 32.4 | 46.6 | |
| OSWorld-Verified | 65.9 | 58.5 | 75.6 | |
| 智能体编码 | SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| SWE-Bench Verified | 76.0 | 66.6 | 77.2 | |
| TerminalBench 2.1(带 terminus2) | 51.7 | 43.4 | 60.7 | |
| SciCode | 43.6 | 43.4 | 39.8 | |
| 多模态 | Charxiv Reasoning | 78.8 | 77.7 | 78.4 |
| ScreenSpot Pro | 75.4 | 75.9 | 76.1 | |
| OmniDocBench v1.5 | 75.8 | 72.5 | 77.8 | |
| MMMU Pro | 74 | 73 | 75 | |
| 安全性 | CI Memories | Violation(↓):26.4 Coverage:64.8 | Violation(↓):12.1 Coverage:53.0 | Violation(↓):53.4 Coverage:66.9 |
| Siren AgentDojo | 攻击成功率(↓):28.4 Utility:94.2 | 攻击成功率(↓):25.6 Utility:90.8 | 攻击成功率(↓):40.3 Utility:92.7 | |
| 通用能力与推理 | IFBench | 77.0 | 76.0 | 70.8 |
| AIME 2026 | 94.7 | 89.2 | 94.1 | |
| GPQA Diamond(AA) | 83.5 | 85.7 | 84.2 | |
| HLE Text(AA) | 22.0 | 23.6 | 23.1 | |
| AA-LCR | 80.0 | 68.3 | 73.3 | |
| Beam128K | 65.1 | 58.2 | 63.0 |
有关我们评估的更多详情,请参阅我们的报告(https://research.meta.ai/static/muse-glimmer-methodology)。
https://huggingface.co/meta-models/Muse-Glimmer-30B#best-practices
最佳实践
为获得最佳性能,我们建议使用以下设置:
**采样参数:**使用以下配置:
- temperature = 1.0
- top_p = 0.95
- top_k = 64
**推理强度:**推理强度控制模型在响应提示词之前的思考程度。推理强度可以在系统提示词中定义为 Reasoning strength: 。Muse Glimmer 支持以下级别:low / medium / high / xhigh。对于复杂问题求解、编码和智能体任务,请使用 high 或 xhigh。
https://huggingface.co/meta-models/Muse-Glimmer-30B#trust-and-safety
信任与安全
与其他大型语言模型一样,我们强烈建议不要将 Muse Glimmer 作为独立端点部署,而应将其作为整体 AI 系统的一部分,并根据部署的用例和上下文添加所需的或适当的额外防护措施。系统保护对于实现正确的有用性-安全性对齐、缓解系统固有的安全与安保风险,以及将模型或系统与外部工具集成至关重要。
评估
我们针对常见用例以及特定能力对 Muse Glimmer 进行了评估。常见用例评估衡量系统在大多数常见构建应用(包括聊天机器人和视觉问答)中的安全风险。我们构建了专门的对抗性评估数据集,并评估了由 Muse Glimmer 模型和这些防护措施组成的系统,以过滤输入提示和输出响应。在上下文中评估应用非常重要,我们建议为您的用例构建专门的评估数据集。
能力评估衡量模型固有于特定能力的漏洞,为此我们设计了专门的基准测试。我们还酌情使用了行业标准的安全性和能力基准测试。
Muse Glimmer 主要围绕四个风险轴进行评估:
- 内容安全——针对拒绝有害请求和校准对边缘提示词响应的标准对齐。
- 智能体风险——针对不可逆操作确认、数据最小化、脚手架边界尊重以及间接提示注入抵抗的策略。
- 隐私(适当信息流)——受 CI 理论启发,在代表个人与第三方交互时尊重信息的上下文完整性。
- 准备程度——化学与生物、网络安全和失控风险。
https://huggingface.co/meta-models/Muse-Glimmer-30B#preparedness
准备程度
Muse Glimmer 不属于 Meta 高级 AI 扩展框架(AAISF)中“前沿 AI”的定义,因为其能力通常弱于 Muse Spark。然而,出于审慎考虑,我们的准备团队评估了 Muse Glimmer 的风险状况,并确定其将获得以下指定:
- 化学/生物:中低风险或更低;
- 网络安全:中低风险或更低(推断);
- 失控:中低风险或更低(推断)。
网络安全和失控风险级别被推断为中低或更低,因为 Muse Glimmer 整体上弱于 Muse Spark 1.0,而后者在这些领域获得了相同的风险指定。在化学/生物领域,我们在一系列科学知识和湿实验室调试基准上评估了 Muse Glimmer(在其尺寸类别中表现最佳的以粗体显示;表现第二佳的以下划线显示——同时包含 Kimi K3 以供参考):
| 基准测试 | Muse Glimmer-30B | Gemma4-31B | Qwen3.6-27B | Kimi K3 |
|---|---|---|---|---|
| MBCT | 41.5% | 50.6% | 45.9% | 58.9% |
| HPCT | 52.3% | 54.0% | 48.7% | 59.6% |
| VCT | 37.0% | 43.5% | 33.7% | 48.0% |
| WMDP(生物) | 86.5% | 85.9% | 84.8% | 89.1% |
| WMDP(化学) | 75.2% | 80.5% | 74.8% | 84.2% |
| Lab Bench(ProtocolQA) | 80.2% | 75.8% | 69.1% | 81.9% |
我们发现 Muse Glimmer 的能力大致与其尺寸级别中的其他模型一致,同时显示出严格低于更大开放权重模型的能力,这表明其在发布时不太可能实质性促成新的威胁。我们还使用专注于独特瓶颈组合的测试套件对其进行了评估,这些瓶颈原本会阻止或限制现实世界威胁行为者的成功;在此,我们的评估也将其风险评级评为中低或更低。
有关上述评估和方法的详细说明,请参阅 Muse Spark 安全与准备报告(https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/)。
https://huggingface.co/meta-models/Muse-Glimmer-30B#train-time-mitigations
训练时缓解措施
- **安全 SFT:**包含展示正确安全行为的精选示例,涵盖工具使用边界、提示注入抵抗和权限处理等智能体安全场景。
- **安全 RL:**使用安全特定奖励信号的强化学习,惩罚策略违规,同时奖励对合法请求的有用响应。
- **适当信息流:**通过专门的合成训练数据,将数据敏感性识别、最小化和本地优先执行原则直接嵌入模型权重中。
https://huggingface.co/meta-models/Muse-Glimmer-30B#intended-use
预期用途
**预期用例:**Muse Glimmer 适用于商业和研究用途。该模型针对自主智能体任务进行了优化,包括:
- **本地 AI 智能体:**多步规划、顺序工具调用、故障恢复和长时程任务执行,完全在消费级设备上运行。
- **编码智能体:**编写、调试和解决现实世界的软件工程任务(例如,SWE-Bench 风格的工作流)。
- **工具使用与函数调用:**在扩展的多轮工作流中,进行可靠的基于模式的工具调用。
- **多模态推理:**在对话中解释截图、图表、文档和图像,适用于智能体和信息密集型环境。
- **合成数据生成:**为下游模型开发生成高质量训练数据。
- **LLM 作为评判者评估:**作为其他模型输出的评估器。
**超出范围:**以任何违反适用法律或法规(包括贸易合规法律)的方式使用。以 Apache 2.0 许可证条款禁止的任何其他方式使用。不支持音频输入/输出。
https://huggingface.co/meta-models/Muse-Glimmer-30B#considerations-and-limitations
注意事项与限制
Muse Glimmer 是一项带有已知和未知风险的技术。迄今为止进行的测试尚未且无法覆盖所有场景。
限制:
- 模型可能对用户提示产生不准确、有偏见或令人反感的内容。
- 尽管针对智能体任务进行了优化,模型在多步推理中仍可能出错,特别是在训练数据中未充分体现的新颖场景中。
- 该模型未针对视频进行明确优化;视频输入按单独帧处理。
- 该模型尚未对所有预训练数据中包含的语言进行评估。在强支持语言集合之外的语言上,性能可能会下降。
- 量化推理在边缘情况下可能与全精度相比存在轻微质量差异。
- 该模型不打算供 18 岁以下个人下载或使用。在可能被 18 岁以下个人使用的系统中部署时,部署者有责任确保已对 18 岁以下个人此类使用相关的任何风险进行全面评估并适当缓解,并遵守所有适用法律。
**负责任使用:**开发人员应根据其特定应用和拟议语言,执行自己的安全测试和调整。我们的使用政策可在此处找到 链接。我们建议在智能体上下文中部署模型时,实施额外的防护措施(例如对不可逆操作进行人工确认),因为模型在此类上下文中可能采取真实世界行动。
https://huggingface.co/meta-models/Muse-Glimmer-30B#released-artifacts
发布产物
所有产物均根据 Apache 2.0 发布:
| 产物 | 描述 |
|---|---|
| 全精度权重(BF16) | 用于微调与研究的完整模型权重 |
| 4 位量化 |
相似文章
Meta 开源 Muse Glimmer 30B Agent 模型,扎克伯格推动个人超级智能愿景
Meta 开源了 Muse Glimmer,这是一个采用 Apache 2.0 协议的 30B 参数多模态 Agent 模型,针对本地工具使用和编码进行了优化,通过 4-bit 量化压缩至 20GB 以下,可在消费级 GPU 上运行。扎克伯格还承诺开源 Muse Spark 1.2 的权重,并设立 10 亿美元社区基金用于数据中心所在地区。
Muse Spark 1.1 来自 Meta AI
Meta AI 发布了 Muse Spark 1.1,这是一款专为智能体任务设计的多模态推理模型。
推出 Muse Glimmer:专为常驻本地智能体工作流优化的开放权重模型
Meta 发布 Muse Glimmer,这是一款 30B 开放权重多模态模型,专为本地智能体工作流优化,采用宽松的 Apache 2.0 许可证,支持 4 位量化、推测解码,并提供广泛的生态系统集成。
Meta Muse Glimmer – 开放权重的30B本地编码模型
Meta推出Muse Glimmer,一个采用宽松许可的30B参数模型,专为本地智能体工作流、编码和工具使用而优化,权重已在Hugging Face上发布。
@PyTorch: Today @AIatMeta introduced Muse Glimmer, an open-weight, 30-billion-parameter model distilled from Meta’s Muse Spark fo…
Meta introduced Muse Glimmer, an open-weight 30B-parameter model distilled from Muse Spark for on-device agentic workflows, with ExecuTorch now supporting running it on NVIDIA GPUs and Apple silicon.