meta-models/Muse-Glimmer-30B-GGUF
摘要
Meta 超级智能实验室发布了 Muse Glimmer 30B 的 GGUF 量化格式,用于本地推理。该模型是一个蒸馏因果语言模型,配备感知编码器,可处理自主智能体任务、工具使用、多模态输入,并能在消费级硬件上实现故障恢复。
查看缓存全文
缓存时间: 2026/08/10 19:59
meta-models/Muse-Glimmer-30B-GGUF · Hugging Face 来源:https://huggingface.co/meta-models/Muse-Glimmer-30B-GGUF
https://huggingface.co/meta-models/Muse-Glimmer-30B-GGUF#muse-glimmer-model-card
Muse Glimmer 模型卡
**作者:**Meta Superintelligence Lab
**模型发布日期:**2026年8月
**许可证:**Apache 2.0 (https://www.apache.org/licenses/LICENSE-2.0)
本仓库包含 Muse Glimmer 30B 的 GGUF 格式量化版本,用于通过 llama.cpp 进行本地推理。提供主模型的两个 K-quant 构建版本:muse-glimmer-30B-kquant-dynamic.gguf 面向高显存平台,muse-glimmer-30B-kquant-17gb.gguf 则是更小的构建版本,可轻松适配 24 GB 显存。两者单独使用均仅支持文本。另有配套文件对其扩展:mmproj-kquant.gguf 是量化后的感知编码器,用于图像输入;dflash-kquant.gguf 是量化后的 DFlash 草稿模型,用作投机解码的草稿模型,在保持输出质量不变的前提下提升生成速度。
Muse Glimmer 是一个 300 亿参数的因果语言模型,配备专用感知编码器,从 Muse Spark 蒸馏而来,专为在消费级硬件上运行的自主智能体任务而构建。该模型将多步推理、可靠工具调用、多模态理解和故障恢复集成于单一模型中,完全在本地运行,无需云基础设施或网络访问。
构建有效的智能体需要关键能力协同工作以实现用户目标。Muse Glimmer 在以下能力方面接受了训练和评估:
- **端到端智能体任务完成。**Muse Glimmer 在完整任务基准上取得了较高的成功率,包括 DeepSearch QA、MCP-Atlas、τ3-Bench 和 SWE-Bench,这些基准衡量其在脚手架环境中工作、编写和调试代码以及从头到尾解决多轮请求的能力。
- **可靠工具调用。**该模型能够处理广泛的函数调用,在扩展工作流程中以精确的模式调用工具。
- **多步推理。**Muse Glimmer 能够在长时间跨度上进行链式推理,在复杂、扩展的工作流程中维持连贯的计划。
- **故障恢复。**当工具调用失败或返回意外结果时,模型能够诊断错误并重试,而不是停止。
- **多模态输入与推理。**通过专用感知编码器,模型可接受交错排列的文本和图像。这使得智能体能够在对话中同时解读截图、图表和文档。
- **脚手架兼容性。**Muse Glimmer 可与 OpenClaw、Hermes Agent 及其他智能体编排模式配合使用。
- **可控推理强度。**模型支持不同的推理强度,以便在质量与速度之间选择合适的平衡。
- **多语言。**Muse Glimmer 使用超过 100 种语言的数据进行训练。
https://huggingface.co/meta-models/Muse-Glimmer-30B-GGUF#muse-glimmer-30b-model-overview
Muse Glimmer-30B 模型概览
| 属性 | 详情 |
|---|---|
| 模型架构 | 带感知编码器的稠密因果 Transformer |
| 总参数量 | 约 29.6B |
| 语言模型 | |
| 架构 | 稠密因果 Transformer |
| 参数量 | 29.6B(含视觉编码器) |
| 隐藏维度 | 6656 |
| 层数 | 52 |
| 注意力模式 | [局部, 局部, 局部, 全局] 循环 |
| 滑动窗口大小 | 2048 |
| 门控注意力 | 是 |
| 注意力头(Q / KV) | 32 / 2(GQA 比率 16:1) |
| 头维度 | 128 |
| FFN 类型 | SwiGLU |
| FFN 中间维度 | 19,968 |
| 位置编码 | RoPE(θ = 500,000),仅局部层 |
| 感知编码器 (https://arxiv.org/abs/2504.13181) | 约 1.8B 参数 ViT-G/14,50 层,宽度 1536,patch 大小 14 |
| 词表大小 | 202,048 |
| 分词器 | 200,000 个 BPE token + 2,048 个特殊 token |
| 每张图像最大视觉 token 数 | 4,096 |
| 上下文长度 | 131,072+ |
| 支持的模态 | 输入:文本 + 图像,输出:文本 |
| 训练数据 | 来自公开可用数据、第三方提供的数据以及 Meta 产品和服务信息的的多模态内容,经外部供应商网络和 Meta 人员策划和增强 |
| 知识截止日期 | 2026年1月4日 |
https://huggingface.co/meta-models/Muse-Glimmer-30B-GGUF#optimized-for-local-deployments
针对本地部署优化
Muse Glimmer 为本地部署进行了优化,旨在不牺牲质量的前提下在消费级硬件上以实用的速度运行。
**将模型适配到您的设备。**我们使用量化技术将模型权重压缩至约 4 位精度,使语言模型缩小到 20 GB 以下。这为模型的 KV 缓存、用于图像理解的感知编码器以及投机解码草稿模型留出了足够空间,可在 24 GB 或 32 GB 显存范围内同时运行。至关重要的是,我们验证了这种压缩在智能体任务上仅带来极轻微甚至无性能下降。
| 全精度 | K-Quant-Dynamic | K-Quant-17GB | |
|---|---|---|---|
| 性能下降* | - | 0.2% | 1.0% |
| 目标硬件 | 64GB 显存 | 32GB 显存 | 24GB 显存 |
* 性能下降基于 15 个常见基准的准确率指标平均值衡量。
**通过投机解码加速生成。**Muse Glimmer 附带一个基于 DFlash (https://arxiv.org/abs/2602.06036) 的轻量级“草稿”模型,这是一个小型配套网络,可一次提出整块 token。DFlash 块扩散模型在单次前向传播中预测 16 个 token 的整块内容。随后,主模型并行验证这些提议,接受正确的 token 并纠正错误的 token。该技术使 Muse Glimmer 的文本生成速度显著快于标准的逐 token 生成,同时输出质量完全相同。我们在发布中提供了量化版草稿模型,以减少内存开销。
| 组件 | 设置 |
|---|---|
| 草稿层数 | 5 |
| 块大小 | 16 |
| 注意力 | 滑动窗口,2048,所有层 |
| 注意力头 | 32 查询 / 8 KV(GQA) |
| 序列长度 | 131,072 |
| 隐藏特征层 | 5 层,均匀分布在目标层上:52 层中的 {1, 13, 25, 37, 49} |
我们测量了 K-Quant-17GB 模型与量化版 DFlash 草稿模型在 MacBook M4-Max、M5-Max 以及 Nvidia RTX-5090 上的速度。该模型足以实现流畅对话和实时智能体交互,并且完全在您的设备上运行。
| GPU | 基线(无投机,tok/s) | 使用 DFlash 投机*(tok/s) | 加速比 |
|---|---|---|---|
| Nvidia RTX 5090 | 74.9 | 233.4 | 3.1x |
| Apple M4 Max | 23.7 | 37.8 | 1.5x |
| Apple M5 Max | 26.6 | 50.2 | 1.8x |
* 在多样化提示集上的平均值。测量条件为 batch size 1 和贪心解码。M4/M5 测量使用 ExecuTorch 完成,RTX 测量使用 llama.cpp 完成。
https://huggingface.co/meta-models/Muse-Glimmer-30B-GGUF#benchmarks
基准测试
我们在一系列广泛的基准上评估了 Muse Glimmer,以评估有效的自主智能体行为所需的多种能力。与 Gemma4-31B 和 Qwen3.6-27B 相比,Muse Glimmer 在多个广泛使用的 LLM 基准上在其规模级别中表现强劲。
| 类别 | 基准 | Muse Glimmer-30B 高推理 | Gemma4-31B 思考模式 | Qwen3.6-27B 思考模式 |
|---|---|---|---|---|
| 通用智能体 | MCP Atlas (Public) | 75.5 | 54.2 | 62.5 |
| DeepSearch QA | 74.6 | 61.7 | 71.1 | |
| τ3-Banking | 23.5 | 15.1 | 16.7 | |
| WildClawBench | 47.6 | 37.6 | 43.2 | |
| GDPVal-AA v2 | 95 | 38 | 11 | |
| 41 | 41 | 41 | 41 | |
| Gaia2 | 43.3 | 36.4 | 40.0 | |
| SkillsBench(带技能) | 44.3 | 32.4 | 46.6 | |
| OSWorld-Verified | 65.9 | 58.5 | 75.6 | |
| 智能体编码 | SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| SWE-Bench Verified | 76.0 | 66.6 | 77.2 | |
| TerminalBench 2.1(带 terminus2) | 51.7 | 43.4 | 60.7 | |
| SciCode | 43.6 | 43.4 | 39.8 | |
| 多模态 | Charxiv Reasoning | 78.8 | 77.7 | 78.4 |
| ScreenSpot Pro | 75.4 | 75.9 | 76.1 | |
| OmniDocBench v1.5 | 75.8 | 72.5 | 77.8 | |
| MMMU Pro | 74 | 73 | 75 | |
| 安全 | CI Memories | 违规率(↓):26.4 覆盖率:64.8 | 违规率(↓):12.1 覆盖率:53.0 | 违规率(↓):53.4 覆盖率:66.9 |
| Siren AgentDojo | 攻击成功率(↓):28.4 效用:94.2 | 攻击成功率(↓):25.6 效用:90.8 | 攻击成功率(↓):40.3 效用:92.7 | |
| 通用能力与推理 | IFBench | 77.0 | 76.0 | 70.8 |
| AIME 2026 | 94.7 | 89.2 | 94.1 | |
| GPQA Diamond (AA) | 83.5 | 85.7 | 84.2 | |
| HLE Text (AA) | 22.0 | 23.6 | 23.1 | |
| AA-LCR | 80.0 | 68.3 | 73.3 | |
| Beam128K | 65.1 | 58.2 | 63.0 |
有关评估的更多详细信息,请参阅我们的报告 (https://research.meta.ai/static/muse-glimmer-methodology)。
https://huggingface.co/meta-models/Muse-Glimmer-30B-GGUF#best-practices
最佳实践
为获得最佳性能,我们建议使用以下设置:
**采样参数:**请使用以下配置:
- temperature = 1.0
- top_p = 0.95
- top_k = 64
**推理强度:**推理强度控制模型在响应用户提示之前的思考深度。推理强度可作为系统提示的一部分进行设置,格式为 Reasoning strength: 。Muse Glimmer 支持以下级别:low / medium / high / xhigh。对于复杂问题求解、编码和智能体任务,请使用 high 或 xhigh。
https://huggingface.co/meta-models/Muse-Glimmer-30B-GGUF#trust-and-safety
信任与安全
与其他大型语言模型一样,我们强烈建议 Muse Glimmer 不要作为独立端点部署,而应作为整体 AI 系统的一部分,并根据其部署用例和场景添加所需的适当护栏。系统保护措施是实现正确的有益性-安全性对齐、缓解系统固有的安全和安保风险以及将模型或系统与外部工具集成时的关键。
评估
我们针对常见用例以及特定能力评估了 Muse Glimmer。常见用例评估衡量大多数常见应用(包括聊天机器人、视觉问答)的系统安全风险。我们构建了专门的对抗性评估数据集,并对由 Muse Glimmer 模型及这些防护措施组成的系统进行了评估,以过滤输入提示和输出响应。在上下文中评估应用非常重要,我们建议为您的用例构建专门的评估数据集。
能力评估衡量模型固有特定能力的漏洞,为此我们专门设计了基准。我们还酌情使用了行业标准的安全和能力基准。Muse Glimmer 主要围绕四个风险维度进行评估:
- 内容安全——对有害请求的拒绝以及针对边界性提示的校准响应采用的标准对齐方式。
- 智能体风险——针对不可逆操作确认、数据最小化、脚手架边界尊重以及间接提示注入抵抗的策略。
- 隐私(适当信息流)——受 CI 理论启发,在代表个人与第三方互动时尊重信息的情境完整性。
- 准备度——化学与生物、网络以及失控风险。
https://huggingface.co/meta-models/Muse-Glimmer-30B-GGUF#preparedness
准备度
Muse Glimmer 不属于 Meta 高级 AI 扩展框架(AAISF)中“前沿 AI”的定义,因为其能力总体上低于 Muse Spark。然而,出于审慎考虑,我们的准备度团队评估了 Muse Glimmer 的风险概况,并确定其将获得以下评级:
- 化学/生物:中低风险或更低;
- 网络:中低风险或更低(推断);
- 失控:中低风险或更低(推断)。
网络和失控风险水平被推断为中低或更低,因为 Muse Glimmer 整体上弱于 Muse Spark 1.0,而后者在这些领域获得了相同的风险评级。在化学/生物领域,我们在一系列科学知识和湿实验室调试基准上评估了 Muse Glimmer(Muse Glimmer 所在规模级别中表现最佳者以粗体显示;表现第二者以下划线标出——Kimi K3 也一并列出以供参考):
| 基准 | Muse Glimmer-30B | Gemma4-31B | Qwen3.6-27B | Kimi K3 |
|---|---|---|---|---|
| MBCT | 41.5% | 50.6% | 45.9% | 58.9% |
| HPCT | 52.3% | 54.0% | 48.7% | 59.6% |
| VCT | 37.0% | 43.5% | 33.7% | 48.0% |
| WMDP (Bio) | 86.5% | 85.9% | 84.8% | 89.1% |
| WMDP (Chem) | 75.2% | 80.5% | 74.8% | 84.2% |
| Lab Bench (ProtocolQA) | 80.2% | 75.8% | 69.1% | 81.9% |
我们发现 Muse Glimmer 的能力大致与其规模级别的其他模型相当,同时明显低于更大的开源权重模型,这表明其发布后不太可能实质性促成新的威胁。我们还针对其可能阻碍或限制现实世界威胁行为者成功的独特瓶颈组合进行了评估;在此评估中,其风险评级同样为中低或更低。有关上述评估及其方法的详细描述,请参阅 Muse Spark 安全与准备度报告 (https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/)。
https://huggingface.co/meta-models/Muse-Glimmer-30B-GGUF#train-time-mitigations
训练时缓解措施
- **安全 SFT:**精心整理的示例,展示正确的安全行为,包括涵盖工具使用边界、提示注入抵抗和权限处理的智能体安全场景。
- **安全 RL:**使用特定于安全的奖励信号进行强化学习,对违反策略的行为进行惩罚,同时对合法请求的有帮助响应进行奖励。
- **适当信息流:**通过专门的合成训练数据,将数据敏感性识别、数据最小化和本地优先执行的原则直接嵌入模型权重中。
https://huggingface.co/meta-models/Muse-Glimmer-30B-GGUF#intended-use
预期用途
**预期用例:**Muse Glimmer 适用于商业和研究用途。该模型针对自主智能体任务进行了优化,包括:
- **本地 AI 智能体:**多步规划、顺序工具调用、故障恢复和长时程任务执行,完全在消费级设备上运行。
- **编码智能体:**编写、调试和解决现实世界的软件工程任务(例如 SWE-Bench 风格的工作流程)。
- **工具使用和函数调用:**在扩展的多轮工作流程中,基于模式可靠地调用工具。
- **多模态推理:**在对话中理解截图、图表、文档和图像,适用于智能体和信息密集型场景。
- **合成数据生成:**为下游模型开发生成高质量训练数据。
- **LLM 作为评判者(LLM-as-a-judge)评估:**作为其他模型输出的评估器。
**超出范围:**任何违反适用法律或法规(包括贸易合规法律)的使用方式。Apache 2.0 许可证条款禁止的任何其他使用方式。不支持音频输入/输出。
https://huggingface.co/meta-models/Muse-Glimmer-30B-GGUF#considerations-and-limitations
考虑事项与局限性
Muse Glimmer 是一项带有已知和未知风险的技术。迄今为止进行的测试无法也没有覆盖所有场景。
局限性:
- 模型可能对用户提示产生不准确、有偏见或令人反感的内容。
- 尽管针对智能体任务进行了优化,模型在多步推理中仍可能出错,尤其是在训练数据中未充分体现的新颖场景中。
- 该模型未针对视频进行显式优化;视频输入将作为单独帧进行处理。
- 模型尚未针对预训练数据中包含的所有语言进行评估。在强支持语言集合之外的语言上,性能可能会下降。
- 与全精度相比,量化推理在边缘情况下可能表现出轻微的质量差异。
- 该模型不适用于 18 岁以下个人下载或使用。在可能被 18 岁以下个人使用的系统中部署时,部署者有责任确保已对 18 岁以下个人相关使用的任何风险进行充分评估和适当缓解,并遵守所有适用法律法规。
相似文章
meta-models/Muse-Glimmer-30B
Meta超级智能实验室发布了Muse-Glimmer-30B,这是一个具有感知编码器的30B参数因果语言模型,针对消费级硬件上的自主智能体任务进行了优化,支持可靠的工具使用、多步推理和多模态输入。
推出 Muse Glimmer
Meta 推出 Muse Glimmer,一款基于 Apache 2.0 协议的全新 30B 开放权重模型,针对智能体任务完成、可靠工具使用和多步推理进行了优化。Simon Willison 使用 LM Studio 和 llm-coding-agent 在本地对其进行了测试。
unsloth/Muse-Glimmer-30B-GGUF · Hugging Face
Unsloth 发布了 Meta 的 Muse Glimmer 30B 模型的 GGUF 量化版本,专为本地智能体任务设计,支持多模态输入、工具使用和多步推理。
Muse Glimmer 是一个伪装成 30B Transformer 的内存层次结构
Meta 的 Muse Glimmer 是一款为消费级硬件上的自主代理任务设计的 30B 多模态 Transformer 模型,它使用内存层次结构和量化技术来适配 24-32 GB 的内存限制。
Meta 开源 Muse Glimmer 30B Agent 模型,扎克伯格推动个人超级智能愿景
Meta 开源了 Muse Glimmer,这是一个采用 Apache 2.0 协议的 30B 参数多模态 Agent 模型,针对本地工具使用和编码进行了优化,通过 4-bit 量化压缩至 20GB 以下,可在消费级 GPU 上运行。扎克伯格还承诺开源 Muse Spark 1.2 的权重,并设立 10 亿美元社区基金用于数据中心所在地区。