meta-models/Muse-Glimmer-30B

Hugging Face Models Trending 模型

摘要

Meta超级智能实验室发布了Muse-Glimmer-30B,这是一个具有感知编码器的30B参数因果语言模型,针对消费级硬件上的自主智能体任务进行了优化,支持可靠的工具使用、多步推理和多模态输入。

任务:图像-文本到文本 标签:transformers, safetensors, muse_glimmer, image-text-to-text, conversational, arxiv:2504.13181, arxiv:2602.06036, license:apache-2.0, eval-results, endpoints_compatible, region:us
查看原文
查看缓存全文

缓存时间: 2026/08/10 13:58

meta-models/Muse-Glimmer-30B · Hugging Face 来源:https://huggingface.co/meta-models/Muse-Glimmer-30B

https://huggingface.co/meta-models/Muse-Glimmer-30B#muse-glimmer-model-card

Muse Glimmer 模型卡片

**作者:**Meta 超级智能实验室
**模型发布日期:**2026 年 8 月
**许可证:**Apache 2.0(https://www.apache.org/licenses/LICENSE-2.0)

Muse Glimmer 是一个拥有 300 亿参数的因果语言模型,配备了专用的感知编码器,从 Muse Spark 蒸馏而来,专为在消费级硬件上运行自主智能体任务而设计。该模型将多步推理、可靠的工具使用、多模态理解和故障恢复集成到单个模型中,无需云基础设施或网络访问即可在本地运行。

构建有效的智能体需要关键能力协同工作以实现用户目标。Muse Glimmer 针对以下能力进行了训练和评估:

  • **端到端智能体任务完成。**Muse Glimmer 在完整任务基准测试中取得了较高的成功率,包括 DeepSearch QA、MCP-Atlas、τ3-Bench 和 SWE-Bench,这些基准测试衡量了其在脚手架(scaffold)内工作、编写和调试代码以及从头到尾解决多轮请求的能力。
  • **可靠的工具使用。**该模型可处理各种函数调用,在扩展工作流中通过精确的模式(schema)调用工具。
  • **多步推理。**Muse Glimmer 在长时间跨度内进行链式推理,在复杂、扩展的工作流中维持连贯的计划。
  • **故障恢复。**当工具调用失败或返回意外结果时,模型会诊断错误并重试,而不是停止。
  • **多模态输入与推理。**通过专用的感知编码器,模型可接受交错的文本和图像。这使得智能体能够结合对话来解释屏幕截图、图表和文档。
  • **脚手架兼容性。**Muse Glimmer 可跨 OpenClaw、Hermes Agent 及其他智能体编排模式工作。
  • **可控努力程度。**该模型支持不同的推理强度,以便在质量和速度之间选择适当的平衡。
  • **多语言。**Muse Glimmer 使用超过 100 种语言的数据进行训练。

https://huggingface.co/meta-models/Muse-Glimmer-30B#muse-glimmer-30b-model-overview

Muse Glimmer-30B 模型概览

模型架构 密集因果 Transformer,带感知编码器

总参数量 约 296 亿

语言模型 架构:密集因果 Transformer 参数量:296 亿(包括视觉编码器) 隐藏维度:6656 层数:52 注意力模式:[局部、局部、局部、全局] 循环 滑动窗口大小:2048 门控注意力:是 注意力头(Q / KV):32 / 2(GQA 比率 16:1) 头维度:128 FFN 类型:SwiGLU FFN 中间维度:19,968 位置编码:RoPE(θ = 500,000),仅用于局部层

感知编码器(https://arxiv.org/abs/2504.13181) 约 18 亿参数 ViT-G/14,50 层,宽度 1536,patch 大小 14

词汇表大小:202,048 分词器:200,000 个 BPE 词元 + 2,048 个特殊词元 每张图片最大视觉词元数:4,096 上下文长度:131,072+ 支持的模态:输入:文本 + 图像,输出:文本

训练数据 来自公开可用数据、第三方提供的数据以及 Meta 产品和服务信息的多模态内容,由外部供应商网络和 Meta 人员进行策展和丰富。

知识截止日期:2026 年 1 月 4 日

https://huggingface.co/meta-models/Muse-Glimmer-30B#optimized-for-local-deployments

针对本地部署优化

Muse Glimmer 针对本地部署进行了优化,旨在以实用速度在消费级硬件上运行,同时不牺牲质量。

**将模型适配到您的设备。**我们使用量化技术将模型权重压缩到约 4 位精度,将语言模型缩小到 20 GB 以下。这为模型的 KV 缓存、用于图像理解的感知编码器以及推测解码(speculative decoding)草稿模型保留了足够的余量,使其能够在 24 GB 或 32 GB 内存范围内同时运行。至关重要的是,我们验证了这种压缩在智能体任务上引入的退化极小甚至没有。

全精度K-Quant-DynamicK-Quant-17GB
% 退化*--0.2%1.0%
目标硬件64GB VRAM32GB VRAM24GB VRAM

* 退化使用 15 个常见基准测试的准确性指标平均值来衡量

通过推测解码实现更快的生成

Muse Glimmer 附带一个基于 DFlash(https://arxiv.org/abs/2602.06036)的轻量级“草稿”模型,这是一个小型伴生网络,可一次提出整个词元块。DFlash 块扩散模型在单次前向传播中预测 16 个词元的整个块。主模型随后并行验证这些提议,接受正确的词元并纠正错误的词元。这项技术使 Muse Glimmer 的文本生成速度显著快于标准的逐词元生成,同时产生相同质量的输出。我们在发布版本中提供量化草稿模型版本,以减少内存开销。

组件设置
草稿层5
块大小16
注意力滑动窗口,2048,所有层
注意力头32 查询 / 8 KV(GQA)
序列长度131,072
隐藏特征层5,均匀分布于目标层:{1, 13, 25, 37, 49},共 52 层

我们在 MacBook M4-Max、M5-Max 以及 Nvidia RTX-5090 上测量了 K-Quant-17GB 模型以及量化 DFlash 草稿模型的速度。该模型足够快,可实现流畅对话和实时智能体交互,且完全在您的设备上运行。

GPU基线无推测(tok/s)DFlash 推测平均*(tok/s)加速比
Nvidia RTX 509074.9233.43.1x
Apple M4 Max23.737.81.5x
Apple M5 Max26.650.21.8x

* 跨多组多样化提示集的平均值。测量使用批量大小 1 和贪婪解码。M4/M5 测量使用 ExecuTorch 完成,RTX 使用 llama.cpp 完成。

https://huggingface.co/meta-models/Muse-Glimmer-30B#benchmarks

基准测试

我们评估了 Muse Glimmer 在广泛基准测试上的表现,以评估有效自主智能体行为所需的各种能力。与 Gemma4-31B 和 Qwen3.6-27B 相比,Muse Glimmer 在多个广泛使用的 LLM 基准测试中,在其尺寸级别内表现强劲。

类别基准测试Muse Glimmer-30B 高推理Gemma4-31B 思考模式Qwen3.6-27B 思考模式
通用智能体MCP Atlas(公开)75.554.262.5
DeepSearch QA74.661.771.1
τ3-Banking23.515.116.7
WildClawBench47.637.643.2
GDPVal-AA v2953811
1141
Gaia243.336.440.0
SkillsBench(带技能)44.332.446.6
OSWorld-Verified65.958.575.6
智能体编码SWE-Bench Pro51.236.950.2
SWE-Bench Verified76.066.677.2
TerminalBench 2.1(带 terminus2)51.743.460.7
SciCode43.643.439.8
多模态Charxiv Reasoning78.877.778.4
ScreenSpot Pro75.475.976.1
OmniDocBench v1.575.872.577.8
MMMU Pro747375
安全性CI MemoriesViolation(↓):26.4 Coverage:64.8Violation(↓):12.1 Coverage:53.0Violation(↓):53.4 Coverage:66.9
Siren AgentDojo攻击成功率(↓):28.4 Utility:94.2攻击成功率(↓):25.6 Utility:90.8攻击成功率(↓):40.3 Utility:92.7
通用能力与推理IFBench77.076.070.8
AIME 202694.789.294.1
GPQA Diamond(AA)83.585.784.2
HLE Text(AA)22.023.623.1
AA-LCR80.068.373.3
Beam128K65.158.263.0

有关我们评估的更多详情,请参阅我们的报告(https://research.meta.ai/static/muse-glimmer-methodology)。

https://huggingface.co/meta-models/Muse-Glimmer-30B#best-practices

最佳实践

为获得最佳性能,我们建议使用以下设置:

**采样参数:**使用以下配置:

  • temperature = 1.0
  • top_p = 0.95
  • top_k = 64

**推理强度:**推理强度控制模型在响应提示词之前的思考程度。推理强度可以在系统提示词中定义为 Reasoning strength: 。Muse Glimmer 支持以下级别:low / medium / high / xhigh。对于复杂问题求解、编码和智能体任务,请使用 high 或 xhigh。

https://huggingface.co/meta-models/Muse-Glimmer-30B#trust-and-safety

信任与安全

与其他大型语言模型一样,我们强烈建议不要将 Muse Glimmer 作为独立端点部署,而应将其作为整体 AI 系统的一部分,并根据部署的用例和上下文添加所需的或适当的额外防护措施。系统保护对于实现正确的有用性-安全性对齐、缓解系统固有的安全与安保风险,以及将模型或系统与外部工具集成至关重要。

评估

我们针对常见用例以及特定能力对 Muse Glimmer 进行了评估。常见用例评估衡量系统在大多数常见构建应用(包括聊天机器人和视觉问答)中的安全风险。我们构建了专门的对抗性评估数据集,并评估了由 Muse Glimmer 模型和这些防护措施组成的系统,以过滤输入提示和输出响应。在上下文中评估应用非常重要,我们建议为您的用例构建专门的评估数据集。

能力评估衡量模型固有于特定能力的漏洞,为此我们设计了专门的基准测试。我们还酌情使用了行业标准的安全性和能力基准测试。

Muse Glimmer 主要围绕四个风险轴进行评估:

  1. 内容安全——针对拒绝有害请求和校准对边缘提示词响应的标准对齐。
  2. 智能体风险——针对不可逆操作确认、数据最小化、脚手架边界尊重以及间接提示注入抵抗的策略。
  3. 隐私(适当信息流)——受 CI 理论启发,在代表个人与第三方交互时尊重信息的上下文完整性。
  4. 准备程度——化学与生物、网络安全和失控风险。

https://huggingface.co/meta-models/Muse-Glimmer-30B#preparedness

准备程度

Muse Glimmer 不属于 Meta 高级 AI 扩展框架(AAISF)中“前沿 AI”的定义,因为其能力通常弱于 Muse Spark。然而,出于审慎考虑,我们的准备团队评估了 Muse Glimmer 的风险状况,并确定其将获得以下指定:

  • 化学/生物:中低风险或更低;
  • 网络安全:中低风险或更低(推断);
  • 失控:中低风险或更低(推断)。

网络安全和失控风险级别被推断为中低或更低,因为 Muse Glimmer 整体上弱于 Muse Spark 1.0,而后者在这些领域获得了相同的风险指定。在化学/生物领域,我们在一系列科学知识和湿实验室调试基准上评估了 Muse Glimmer(在其尺寸类别中表现最佳的以粗体显示;表现第二佳的以下划线显示——同时包含 Kimi K3 以供参考):

基准测试Muse Glimmer-30BGemma4-31BQwen3.6-27BKimi K3
MBCT41.5%50.6%45.9%58.9%
HPCT52.3%54.0%48.7%59.6%
VCT37.0%43.5%33.7%48.0%
WMDP(生物)86.5%85.9%84.8%89.1%
WMDP(化学)75.2%80.5%74.8%84.2%
Lab Bench(ProtocolQA)80.2%75.8%69.1%81.9%

我们发现 Muse Glimmer 的能力大致与其尺寸级别中的其他模型一致,同时显示出严格低于更大开放权重模型的能力,这表明其在发布时不太可能实质性促成新的威胁。我们还使用专注于独特瓶颈组合的测试套件对其进行了评估,这些瓶颈原本会阻止或限制现实世界威胁行为者的成功;在此,我们的评估也将其风险评级评为中低或更低。

有关上述评估和方法的详细说明,请参阅 Muse Spark 安全与准备报告(https://ai.meta.com/static-resource/muse-spark-safety-and-preparedness-report/)。

https://huggingface.co/meta-models/Muse-Glimmer-30B#train-time-mitigations

训练时缓解措施

  1. **安全 SFT:**包含展示正确安全行为的精选示例,涵盖工具使用边界、提示注入抵抗和权限处理等智能体安全场景。
  2. **安全 RL:**使用安全特定奖励信号的强化学习,惩罚策略违规,同时奖励对合法请求的有用响应。
  3. **适当信息流:**通过专门的合成训练数据,将数据敏感性识别、最小化和本地优先执行原则直接嵌入模型权重中。

https://huggingface.co/meta-models/Muse-Glimmer-30B#intended-use

预期用途

**预期用例:**Muse Glimmer 适用于商业和研究用途。该模型针对自主智能体任务进行了优化,包括:

  • **本地 AI 智能体:**多步规划、顺序工具调用、故障恢复和长时程任务执行,完全在消费级设备上运行。
  • **编码智能体:**编写、调试和解决现实世界的软件工程任务(例如,SWE-Bench 风格的工作流)。
  • **工具使用与函数调用:**在扩展的多轮工作流中,进行可靠的基于模式的工具调用。
  • **多模态推理:**在对话中解释截图、图表、文档和图像,适用于智能体和信息密集型环境。
  • **合成数据生成:**为下游模型开发生成高质量训练数据。
  • **LLM 作为评判者评估:**作为其他模型输出的评估器。

**超出范围:**以任何违反适用法律或法规(包括贸易合规法律)的方式使用。以 Apache 2.0 许可证条款禁止的任何其他方式使用。不支持音频输入/输出。

https://huggingface.co/meta-models/Muse-Glimmer-30B#considerations-and-limitations

注意事项与限制

Muse Glimmer 是一项带有已知和未知风险的技术。迄今为止进行的测试尚未且无法覆盖所有场景。

限制:

  • 模型可能对用户提示产生不准确、有偏见或令人反感的内容。
  • 尽管针对智能体任务进行了优化,模型在多步推理中仍可能出错,特别是在训练数据中未充分体现的新颖场景中。
  • 该模型未针对视频进行明确优化;视频输入按单独帧处理。
  • 该模型尚未对所有预训练数据中包含的语言进行评估。在强支持语言集合之外的语言上,性能可能会下降。
  • 量化推理在边缘情况下可能与全精度相比存在轻微质量差异。
  • 该模型不打算供 18 岁以下个人下载或使用。在可能被 18 岁以下个人使用的系统中部署时,部署者有责任确保已对 18 岁以下个人此类使用相关的任何风险进行全面评估并适当缓解,并遵守所有适用法律。

**负责任使用:**开发人员应根据其特定应用和拟议语言,执行自己的安全测试和调整。我们的使用政策可在此处找到 链接。我们建议在智能体上下文中部署模型时,实施额外的防护措施(例如对不可逆操作进行人工确认),因为模型在此类上下文中可能采取真实世界行动。

https://huggingface.co/meta-models/Muse-Glimmer-30B#released-artifacts

发布产物

所有产物均根据 Apache 2.0 发布:

产物描述
全精度权重(BF16)用于微调与研究的完整模型权重
4 位量化

相似文章

Meta 开源 Muse Glimmer 30B Agent 模型,扎克伯格推动个人超级智能愿景

Reddit r/ArtificialInteligence

Meta 开源了 Muse Glimmer,这是一个采用 Apache 2.0 协议的 30B 参数多模态 Agent 模型,针对本地工具使用和编码进行了优化,通过 4-bit 量化压缩至 20GB 以下,可在消费级 GPU 上运行。扎克伯格还承诺开源 Muse Spark 1.2 的权重,并设立 10 亿美元社区基金用于数据中心所在地区。

Muse Spark 1.1 来自 Meta AI

Product Hunt

Meta AI 发布了 Muse Spark 1.1,这是一款专为智能体任务设计的多模态推理模型。