GitHub - meta-models/meta-oss-cookbook: Meta Inc. 所有开源模型的实战指南

Reddit r/LocalLLaMA 模型

摘要

一个GitHub仓库提供实用的指南,用于部署和使用Meta的Muse Glimmer,这是一款专为单GPU上的本地代理任务设计的开源30B AI模型。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/15 07:48

meta-models/meta-oss-cookbook 来源:https://github.com/meta-models/meta-oss-cookbook

Muse Glimmer 实战指南

克隆此仓库,在你现有的GPU上运行它,只需一次就能交付一个可工作的代理——一个能规划、调用工具并自我纠正的代理——全程完全离线。

Muse Glimmer 是一个开源权重模型,专为单GPU本地智能代理工作而设计。这份指南将告诉你如何从权重文件到运行一个实际的代理。

你将在此构建什么

我们构建 Muse Glimmer 时遵循两个原则:

  • 本地优先:推理在你自己的硬件上运行,因此没有任何数据离开你的机器。无需API密钥、无需门控访问、无托管依赖——一切完全离线工作。
  • 代理优先:专为完整的工具使用循环而设计——模型规划、调用工具、反馈结果并自我纠正,自主执行多个步骤直至达成目标。

最终成果

你将获得一个在自己机器上运行的本地代理,它能从全新安装开始,在单次会话中离线完成真实的多步任务。

选择你的路径

你的需求前往
用一条命令运行模型快速入门/
了解工具使用循环(聊天模板、函数调用、代理循环)代理基础/
构建旗舰代理(结构化输出、推理控制、分流流水线)实战方案/
提供 Muse Glimmer 服务(vLLM、Ollama、LM Studio、SGLang、llama.cpp、Unsloth、ExecuTorch)推理服务器/
在特定合作硬件上部署,查看其支持的精度平台/
调用托管API而非自行运行模型(需要提供方API密钥)托管服务/

每个方案的构建方式

所有方案遵循相同的约定,让你始终清楚会得到什么:

  • 端到端离线运行:任何网络使用均为可选并会标明。
  • 顶部方案横幅:在你运行任何内容之前,显示精度、模型服务器及我们观察到的最大显存占用。我们不会发布未经测试硬件的数据——如果方案未测量,其横幅会说明而非估算。
  • 精度和服务器因方案而异:多数是 vLLM 上的 bf16;recipes/computer-use-web/ 是 llama.cpp 上的量化 GGUF。其他组合通常也适用;我们只是未对每个方案在所有组合上重新验证。
  • 复制粘贴优先:一条命令即可运行。解释随后提供。
  • 以“打造你自己的版本”结尾:扩展钩子,外加故障排除。

关于模型

| | | |—|—|—| | 系列 | 源自 Llama 的稠密解码器(带有 Muse Glimmer 增量的 Gemma2 风格文本栈)。 | | 规模 | 30B 稠密解码器。 | | 推荐 GPU | 量化后(Q4/INT4,约 16-17 GB)可装入单张 24-32 GB 显卡;bf16 需要约 60 GB(80 GB 显卡,或多卡分片)。 | | 上下文 | 131072 tokens (128K)。 | | 模态 | 文本和图像输入,文本输出,外加工具调用——目前全部支持,通过专用的约 1.8B 感知编码器。图像输入的服务器支持情况各异;每个 inference-server/ 页面会说明当前状态。视频不支持作为输入:模型卡片将其作为单独帧处理,并未为此特别优化。 | | 工具格式 | 类 XML 的 <function> 块。详见 代理基础/。 | | 聊天框架 | 带有 to=self 推理通道的通道限定格式 <|start|>角色<|message|>...<|eot|>。 | | 许可证 | 参见 HuggingFace 上的模型卡片 (https://huggingface.co/meta-models/Muse-Glimmer-30B)。 |

状态

本指南正在积极构建中。各部分内容逐步发布,每个文件夹的 README 会说明其当前状态。欢迎贡献。所有方案均遵循 assets/RECIPE_TEMPLATE.md 中的共享模板。

许可证

请参阅 许可证

相似文章

Meta 开源 Muse Glimmer 30B Agent 模型,扎克伯格推动个人超级智能愿景

Reddit r/ArtificialInteligence

Meta 开源了 Muse Glimmer,这是一个采用 Apache 2.0 协议的 30B 参数多模态 Agent 模型,针对本地工具使用和编码进行了优化,通过 4-bit 量化压缩至 20GB 以下,可在消费级 GPU 上运行。扎克伯格还承诺开源 Muse Spark 1.2 的权重,并设立 10 亿美元社区基金用于数据中心所在地区。