moondream3.1-9B-A2B
摘要
Moondream 3.1 是一款采用混合专家架构的视觉语言模型(总参数量9B,激活参数量2B),提供最先进的视觉推理、检测、指点和描述功能,可通过 Photon 推理引擎本地部署,或通过 Moondream Cloud API 使用。
查看缓存全文
缓存时间: 2026/07/12 19:02
moondream/moondream3.1-9B-A2B · Hugging Face
来源: https://huggingface.co/moondream/moondream3.1-9B-A2B
Moondream 3.1 是一款采用混合专家架构的视觉语言模型(总计 9B 参数,活跃 2B)。它在视觉推理和检测方面达到了最先进水平,同时保持快速且部署成本低廉。原生支持 query、detect、point 和 caption 能力,并全部返回结构化输出。
有关新功能的完整说明——包括我们如何训练它以及它在您自己的任务上的表现——请参阅发布说明。
✨ Playground (https://moondream.ai/playground)·☁️ Cloud API (https://moondream.ai/p/cloud)·📝 Release notes (https://moondream.ai/blog/moondream-3-1-beyond-benchmarks)·📄 License (https://moondream.ai/licenses/model/1.0)
使用 Photon 本地运行
Photon (https://moondream.ai/p/photon) 是 Moondream 的高性能推理引擎。它可以在本地 NVIDIA GPU(Ampere 或更新架构)和 Apple Silicon Mac 上运行模型,且 API 与 Moondream Cloud (https://moondream.ai/p/cloud) 相同。
pip install moondream
`` import moondream as md from PIL import Image
Runs locally via Photon. Weights download from Hugging Face on first use.
model = md.vl(local=True, model=“moondream3.1-9B-A2B”)
image = Image.open(“photo.jpg”)
Caption
print(model.caption(image)[“caption”])
Visual question answering
print(model.query(image, “What’s in this image?”)[“answer”])
Open-vocabulary detection
for obj in model.detect(image, “person”)[“objects”]: print(obj)
Pointing
for point in model.point(image, “person”)[“points”]: print(point) ``
本地运行基础模型无需 API 密钥。(仅在运行微调或调用 Moondream Cloud (https://moondream.ai/p/cloud) 时才需要。)有关支持的硬件、流式传输、微调以及使用 Triton 进行生产级服务,请参阅本地推理指南 (https://docs.moondream.ai/running-locally)。
Cloud API
更倾向于托管的端点?同样的能力可通过 Moondream Cloud (https://moondream.ai/p/cloud) 获得,并提供慷慨的免费套餐。请参阅快速入门 (https://docs.moondream.ai/quickstart) 来发起第一次调用。
许可
Moondream 3.1 根据 Moondream Model License (https://moondream.ai/licenses/model/1.0) 发布。
相似文章
lucataco/moondream2
moondream2是一个紧凑的视觉语言模型,专为高效的边缘设备推理而设计,提供了基准测试结果和使用说明。
@modal: Modal上Step 3.7 Flash的Day 0支持 - 198B参数的MoE,11B激活参数 - 256K上下文 - 3个推理层级 - N…
Modal宣布为Step 3.7 Flash AI模型提供Day 0支持,该模型拥有198B参数的MoE(11B激活参数)、256K上下文、三个推理层级,以及原生图像和视频理解能力。
stepfun-ai/Step-3.7-Flash
Step 3.7 Flash 是一个198B参数的稀疏MoE视觉语言模型,每个token有11B活跃参数,支持256k上下文和三种推理级别,专为高吞吐量的代理工作流设计。
Kwai-Keye/Keye-VL-2.0-30B-A3B
Kwai-Keye 发布了 Keye-VL-2.0-30B-A3B,这是一款 30B 级别的视觉语言模型,具备先进的视频理解、稀疏注意力机制和智能体能力,在多项基准测试中达到顶尖水平。
JetBrains/Mellum2-12B-A2.5B-Thinking
JetBrains releases Mellum2-12B-A2.5B-Thinking, an open-source Mixture-of-Experts reasoning model with 131k context length, trained with RLVR for explicit chain-of-thought reasoning.