unsloth/Muse-Glimmer-30B-GGUF · Hugging Face
摘要
Unsloth 发布了 Meta 的 Muse Glimmer 30B 模型的 GGUF 量化版本,专为本地智能体任务设计,支持多模态输入、工具使用和多步推理。
查看缓存全文
缓存时间: 2026/08/10 11:24
unsloth/Muse-Glimmer-30B-GGUF · Hugging Face 来源:https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF Unsloth Dynamic 2.0(https://unsloth.ai/docs/basics/unsloth-dynamic-v2.0-gguf)可获得更高的准确率,并优于其他主流量化方案。 查看我们的 Muse Glimmer 指南(https://unsloth.ai/docs/models/muse-glimmer)以获取量化分析和使用说明。您现在可以在 Unsloth(https://github.com/unslothai/unsloth/)中运行 Muse Glimmer,并支持思考模式切换。 — **作者:**Meta Superintelligence Lab **模型发布日期:**2026年8月 **许可证:**Apache 2.0(https://www.apache.org/licenses/LICENSE-2.0)
Muse Glimmer 是一个拥有 300 亿参数的因果语言模型,配备专用感知编码器,从 Muse Spark 蒸馏而来,专为在消费级硬件上运行自主智能体任务而设计。该模型将多步推理、可靠的工具调用、多模态理解和故障恢复集成到单一模型中,无需云基础设施或网络访问即可在本地运行。
构建高效的智能体需要关键能力协同工作,以实现用户目标。Muse Glimmer 针对以下能力进行了训练和评估:
- **端到端智能体任务完成。**Muse Glimmer 在完整任务基准上取得了较高的成功率,包括 DeepSearch QA、MCP-Atlas、τ3-Bench 和 SWE-Bench,这些基准衡量了其在脚手架中工作、编写和调试代码,以及从头到尾解决多轮请求的能力。
- **可靠的工具调用。**该模型可处理广泛的函数调用,在扩展工作流中以精确的 schema 调用工具。
- **多步推理。**Muse Glimmer 可在长时程上进行链式推理,在复杂、扩展的工作流中维持连贯的计划。
- **故障恢复。**当工具调用失败或返回意外结果时,模型会诊断错误并重试,而不是停止。
- **多模态输入与推理。**通过专用感知编码器,模型可接受交错的文本和图像输入,使智能体能够结合对话理解截图、图表和文档。
- **脚手架兼容性。**Muse Glimmer 可跨 OpenClaw、Hermes Agent 及其他智能体编排模式运行。
- **可控推理强度。**模型支持不同的推理强度,可在质量与速度之间选择合适的平衡点。
- **多语言。**Muse Glimmer 使用超过 100 种语言的数据进行训练。
https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF#muse-glimmer-30b-model-overview
Muse Glimmer-30B 模型概览
模型架构
密集因果 Transformer,带感知编码器
总参数量约 296 亿
语言模型
- 架构:密集因果 Transformer
- 参数量:296 亿(含视觉编码器)
- 隐藏维度:6656
- 层数:52
- 注意力模式:[局部,局部,局部,全局] 循环
- 滑动窗口大小:2048
- 门控注意力:是
- 注意力头(Q / KV):32 / 2(GQA 比率 16:1)
- 头维度:128
- FFN 类型:SwiGLU
- FFN 中间维度:19,968
- 位置编码:RoPE(θ = 500,000),仅局部层
- 感知编码器(https://arxiv.org/abs/2504.13181):约 18 亿参数 ViT-G/14,50 层,宽度 1536,patch 大小 14
- 词表大小:202,048
- 分词器:200,000 BPE 词元 + 2,048 特殊词元
- 每张图像最大视觉词元数:4,096
- 上下文长度:131,072+
- 支持的模态:输入:文本 + 图像,输出:文本
- 训练数据:来自公开可用数据、第三方提供的数据以及 Meta 产品和服务信息的多模态内容,由外部供应商网络和 Meta 人员策划和丰富。
- 知识截止日期:2026 年 1 月 4 日
https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF#optimized-for-local-deployments
针对本地部署优化
Muse Glimmer 针对本地部署进行了优化,旨在不牺牲质量的前提下,在消费级硬件上以实用速度运行。
**将模型适配到您的设备上。**我们使用量化技术将模型权重压缩到约 4 位精度,将语言模型缩小至 20 GB 以下。这为模型的 KV 缓存、用于图像理解的感知编码器以及投机解码草稿模型留出了足够的空间,使其能够在 24 GB 或 32 GB 的内存范围内同时运行。至关重要的是,我们验证了这种压缩在智能体任务上几乎没有引入性能下降。
| 全精度 | K-Quant-Dynamic | K-Quant-17GB | |
|---|---|---|---|
| 性能下降* | - | -0.2% | 1.0% |
| 目标硬件 | 64GB VRAM | 32GB VRAM | 24GB VRAM |
* 性能下降基于 15 个常见基准的准确率指标平均值衡量
通过投机解码实现更快的生成速度
Muse Glimmer 附带一个基于 DFlash(https://arxiv.org/abs/2602.06036)的轻量级“草稿模型”,这是一个小型配套网络,可一次性提出整个词元块。DFlash 块扩散模型可在单次前向传播中预测 16 个词元的整个块。主模型随后并行验证这些提议,接受正确的词元并纠正错误的词元。这项技术使 Muse Glimmer 能够以显著快于标准逐词元生成的速度生成文本,同时保持相同的输出质量。我们在发布中提供了量化草稿模型版本,以减少额外的内存开销。
| 组件 | 设置 |
|---|---|
| 草稿层数 | 5 |
| 块大小 | 16 |
| 注意力 | 滑动窗口,2048,所有层 |
| 注意力头 | 32 query / 8 KV(GQA) |
| 序列长度 | 131,072 |
| 隐藏特征层 | 5 层,在目标的 52 层中均匀分布:{1, 13, 25, 37, 49} |
我们在 MacBook M4-Max、M5-Max 和 Nvidia RTX-5090 上测量了 K-Quant-17GB 模型以及量化 DFlash 草稿模型的运行速度。该模型足以实现流畅的对话和实时智能体交互,且完全在您的设备上运行。
| GPU | 基线(无投机)tok/s | 使用 DFlash 投机平均* tok/s | 加速比 |
|---|---|---|---|
| Nvidia RTX 5090 | 74.9 | 233.4 | 3.1x |
| Apple M4 Max | 23.7 | 37.8 | 1.5x |
| Apple M5 Max | 26.6 | 50.2 | 1.8x |
* 跨多种提示集的平均值。测量条件:batch size 为 1,贪婪解码。M4/M5 测量使用 ExecuTorch,RTX 使用 llama.cpp。
https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF#benchmarks
基准测试
我们评估了 Muse Glimmer 在广泛基准上的表现,以衡量有效自主智能体行为所需的多方面能力。与 Gemma4-31B 和 Qwen3.6-27B 相比,Muse Glimmer 在多个广泛使用的 LLM 基准上表现出色,处于其尺寸级别的领先位置。
| 类别 | 基准 | Muse Glimmer-30B 高推理 | Gemma4-31B 思考模式 | Qwen3.6-27B 思考模式 |
|---|---|---|---|---|
| 通用智能体 | MCP Atlas(公开) | 75.5 | 54.2 | 62.5 |
| DeepSearch QA | 74.6 | 61.7 | 71.1 | |
| τ3-Banking | 23.5 | 15.1 | 16.7 | |
| WildClawBench | 47.6 | 37.6 | 43.2 | |
| GDPVal-AA v2 | 95 | 38 | 11 | |
| 41 | 41 | 41 | ||
| Gaia2 | 43.3 | 36.4 | 40.0 | |
| SkillsBench(带技能) | 44.3 | 32.4 | 46.6 | |
| OSWorld-Verified | 65.9 | 58.5 | 75.6 | |
| 智能体编程 | SWE-Bench Pro | 51.2 | 36.9 | 50.2 |
| SWE-Bench Verified | 76.0 | 66.6 | 77.2 | |
| TerminalBench 2.1(带 terminus2) | 51.7 | 43.4 | 60.7 | |
| SciCode | 43.6 | 43.4 | 39.8 | |
| 多模态 | Charxiv Reasoning | 78.8 | 77.7 | 78.4 |
| ScreenSpot Pro | 75.4 | 75.9 | 76.1 | |
| OmniDocBench v1.5 | 75.8 | 72.5 | 77.8 | |
| MMMU Pro | 74 | 73 | 75 | |
| 安全性 | CI Memories | Violation(↓):26.4 Coverage:64.8 | Violation(↓):12.1 Coverage:53.0 | Violation(↓):53.4 Coverage:66.9 |
| Siren AgentDojo | 攻击成功率(↓):28.4 实用性:94.2 | 攻击成功率(↓):25.6 实用性:90.8 | 攻击成功率(↓):40.3 实用性:92.7 | |
| 通用能力与推理 | IFBench | 77.0 | 76.0 | 70.8 |
| AIME 2026 | 94.7 | 89.2 | 94.1 | |
| GPQA Diamond(AA) | 83.5 | 85.7 | 84.2 | |
| HLE Text(AA) | 22.0 | 23.6 | 23.1 | |
| AA-LCR | 80.0 | 68.3 | 73.3 | |
| Beam128K | 65.1 | 58.2 | 63.0 |
有关评估的更多详情,请参阅我们的报告(https://research.meta.ai/static/muse-glimmer-methodology)。
https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF#best-practices
最佳实践
为获得最佳性能,我们建议使用以下设置:
**采样参数:**使用以下配置:
- temperature = 1.0
- top_p = 0.95
- top_k = 64
**推理强度:**推理强度控制模型在响应提示前进行思考的程度。推理强度可以作为系统提示词的一部分定义为 Reasoning strength: 。Muse Glimmer 支持以下级别:low / medium / high / xhigh。对于复杂问题解决、编程和智能体任务,请使用 high 或 xhigh。
https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF#trust-and-safety
信任与安全
与我们对待其他大型语言模型一样,我们强烈建议 Muse Glimmer 不要作为独立端点部署,而应作为整体 AI 系统的一部分进行部署,并根据其部署用例和场景添加所需的额外护栏。系统保护对于实现正确的有用性-安全性对齐、缓解系统固有的安全与安保风险,以及将模型或系统与外部工具集成至关重要。
评估
我们针对常见用例以及特定能力对 Muse Glimmer 进行了评估。常见用例评估衡量的是大多数常见应用(包括聊天机器人和视觉 QA)中系统的安全风险。我们构建了专门的对抗性评估数据集,并评估了由 Muse Glimmer 模型和这些安全过滤器组成的系统,以过滤输入提示和输出响应。在上下文中评估应用非常重要,我们建议为您的用例构建专门的评估数据集。
能力评估衡量的是模型特定能力固有的漏洞,我们为此设计了专门的基准。我们还酌情使用了行业标准的安全与能力基准。Muse Glimmer 主要围绕四个风险维度进行评估:
- 内容安全——对有害请求的标准拒绝对齐,以及对边缘提示的校准响应。
- 智能体风险——关于不可逆操作确认、数据最小化、脚手架边界尊重以及间接提示注入抵抗的策略。
- 隐私(适当的信息流)——在代表个人与第三方交互时尊重信息的情境完整性,受 CI 理论启发。
- 准备程度——化学与生物、网络以及失控风险。
https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF#preparedness
准备程度
Muse Glimmer 不属于 Meta 高级 AI 扩展框架(AAISF)中“前沿 AI”的定义,因为其总体能力低于 Muse Spark。然而,出于审慎考虑,我们的准备团队评估了 Muse Glimmer 的风险概况,并确定其将获得以下认定:
- 化学/生物:中等或更低风险;
- 网络:中等或更低风险(推断);
- 失控:中等或更低风险(推断)。
网络和失控风险级别被推断为中等或更低,因为 Muse Glimmer 整体上弱于 Muse Spark 1.0,而后者在这些领域获得了相同的风险认定。在化学/生物领域,我们在多个科学知识和湿实验室调试基准上对 Muse Glimmer 进行了评估(Muse Glimmer 尺寸级别中表现最佳的加粗;表现第二的加下划线 — 同时列出 Kimi K3 作为参照):
| 基准 | Muse Glimmer-30B | Gemma4-31B | Qwen3.6-27B | Kimi K3 |
|---|---|---|---|---|
| MBCT | 41.5% | 50.6% | 45.9% | 58.9% |
| HPCT | 52.3% | 54.0% | 48.7% | 59.6% |
| VCT | 37.0% | 43.5% | 33.7% | 48.0% |
| WMDP(生物) | 86.5% | 85.9% | 84.8% | 89.1% |
| WMDP(化学) | 75.2% | 80.5% | 74.8% | 84.2% |
| Lab Bench(ProtocolQA) | 80.2% | 75.8% | 69.1% | 81.9% |
我们发现 Muse Glimmer 的能力与其尺寸级别的其他模型大致相当,同时严格低于更大的开放权重模型,这表明它不太可能在发布后实质性促成新的威胁。我们还在专注于现实世界威胁行为者可能面临的独特瓶颈组合的测试套件上对其进行了评估;在此评估中,其风险评级同样为中等或更低。
有关上述评估和方法的详细说明,请参阅 Muse Spark 安全与准备报告(https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/)。
https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF#train-time-mitigations
训练时缓解措施
- **安全 SFT:**策划展示正确安全行为的示例,包括涵盖工具使用边界、提示注入抵抗和权限处理的智能体安全场景。
- **安全 RL:**使用安全特定奖励信号的强化学习,惩罚策略违规,同时奖励对合法请求的有帮助的响应。
- **适当的信息流:**通过专门的合成训练数据,将数据敏感性识别、最小化和本地优先执行原则直接嵌入模型权重中。
https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF#intended-use
预期用途
**预期用例:**Muse Glimmer 面向商业和研究用途。该模型针对自主智能体任务进行了优化,包括:
- **本地 AI 智能体:**多步规划、顺序工具调用、故障恢复和长时程任务执行,完全运行在消费级设备上。
- **编程智能体:**编写、调试和解决现实世界的软件工程任务(例如,SWE-Bench 风格的工作流)。
- **工具使用与函数调用:**在扩展的多轮工作流中,基于 schema 的可靠工具调用。
- **多模态推理:**结合对话解读截图、图表、文档和图像,适用于智能体和信息丰富的环境。
- **合成数据生成:**为下游模型开发生成高质量的训练数据。
- **LLM 作为评判者的评估:**充当其他模型输出的评估者。
**范围外:**以任何违反适用法律或法规(包括贸易合规法律)的方式使用。以 Apache 2.0 许可证条款禁止的任何其他方式使用。不支持音频输入/输出。
https://huggingface.co/unsloth/Muse-Glimmer-30B-GGUF#considerations-and-limitations
注意事项与局限性
Muse Glimmer 是一项带有已知和未知风险的技术。迄今为止进行的测试尚未且无法覆盖所有场景。
局限性:
- 模型可能对用户提示产生不准确、有偏见或令人反感的内容。
- 虽然针对智能体任务进行了优化,但模型在多步推理中仍可能出错,特别是在训练数据中未充分体现的新场景中。
- 该模型未针对视频进行显式优化;视频输入将作为单独的帧处理。
- 该模型尚未针对预训练数据中包含的所有语言进行评估。在强支持语言集之外的语言上,性能可能会下降。
- 量化推理在边缘情况下可能表现出与全精度相比的微小质量差异。
- 该模型不打算供 18 岁以下个人下载或使用。如果部署在可能由 18 岁以下个人使用的系统中,部署者有责任确保已充分评估并适当缓解与此类使用相关的所有风险,并遵守所有适用法律。
**负责任的使用:**开发人员应针对其特定应用和拟议语言执行自己的安全测试和调优。我们的使用政策可在此处找到 [链接(https://huggingface.co/meta-models/Muse-Glimmer-30B/blob/main/USAGE_POLICY.md)]。我们建议在智能体场景中部署模型(模型可能采取不可逆操作)时,实施额外的护栏(例如对不可逆操作进行人工确认)。
相似文章
Unsloth MiniMax M3 GGUF
Unsloth 正在将 MiniMax M3 模型的 GGUF 量化版本上传到 Hugging Face。
unsloth/gemma-4-26B-A4B-it-GGUF
# unsloth/gemma-4-26B-A4B-it-GGUF · Hugging Face 来源:[https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF](https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF) ## [https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF#read-our-how-to-run-gemma-4-guide](https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF#read-our-how-to-run-gemma-4-guide)阅读我们的[如何运行 Gemma 4 指南](https://docs.unsloth.ai/models/gemma-4)! *请参阅[Unsloth Dynamic 2.0 GGUFs](https://unsloth.ai/docs/basics/unslot
unsloth/MiniMax-M3-GGUF
Unsloth 发布了 MiniMax-M3 多模态模型的 GGUF 量化版本,支持图像-文本到文本任务,兼容 Transformers、llama.cpp、vLLM 等推理引擎。
unsloth/inkling-GGUF
unsloth/inkling-GGUF 页面提供了 Inkling 的量化 GGUF 版本。Inkling 是 Thinking Machines 开发的一个 975B 参数的多模态 MoE 模型(41B 活跃),设计用于文本、图像和音频输入,拥有开放权重,并支持通过 Unsloth、SGLang 和 vLLM 等库进行本地部署。
unsloth/DeepSeek-V4-Flash-0731-GGUF
Unsloth 预告了即将在 Hugging Face 上发布的 DeepSeek V4 Flash GGUF 量化模型。