unsloth/MiMo-V2.5-GGUF · Hugging Face
摘要
MiMo-V2.5 是一款原生全模态 AI 模型,具备强大的智能体(agentic)能力,在统一稀疏混合专家(MoE)架构下支持文本、图像、视频和音频的理解。
查看缓存全文
缓存时间: 2026/05/11 06:26
unsloth/MiMo-V2.5-GGUF · Hugging Face
来源: https://huggingface.co/unsloth/MiMo-V2.5-GGUF
包含 Unsloth 聊天模板修复!对于
llama.cpp,请使用--jinja
Xiaomi-MiMo
⚠️ 重要:配置更新通知
自初始发布以来,本仓库中的 config.json 和 tokenizer_config.json 文件已进行更新。如果您在此之前下载了 MiMo-V2.5(提交哈希为 4da2748 之前)(https://huggingface.co/XiaomiMiMo/MiMo-V2.5/commit/4da2748fc0a0123d817280b1b0cd3682a487a161),请重新拉取或手动更新这两个文件,以确保模型行为正确。使用过时的配置可能导致模型性能下降。对于由此造成的不便,我们深表歉意。
快速修复:
hf download XiaomiMiMo/MiMo-V2.5 config.json tokenizer_config.json --local-dir ./MiMo-V2.5
1. 简介
MiMo-V2.5 是一个原生的全模态模型,具备强大的智能体(Agentic)能力,在统一架构下支持文本、图像、视频和音频理解。它基于 MiMo-V2-Flash 主干网络构建,并扩展了专用的视觉和音频编码器,在多模态感知、长上下文推理和智能体工作流方面表现出稳健的性能。主要特性包括:
- 混合注意力架构:继承了 MiMo-V2-Flash 的混合设计,以 5:1 的比例交错滑动窗口注意力(SWA)和全局注意力(GA),并使用 128 大小的滑动窗口。这通过可学习的注意力 sink bias 在保持长上下文性能的同时,将近似减少了 6 倍的 KV-cache 存储需求。
- 原生全模态编码器:配备了一个拥有 729M 参数的视觉 Transformer(ViT),具备混合窗口注意力,以及一个从 MiMo-Audio 权重初始化的专用音频编码器,从而实现高质量的图像、视频和音频理解。
- 多 Token 预测(MTP):三个轻量级的 MTP 模块带有密集的 FFN,通过投机解码加速推理并提高 RL 训练效率。
- 高效预训练:使用 FP8 混合精度在总计约 48T tokens 的数据上进行训练。上下文窗口支持多达 1M tokens。
- 智能体能力:后训练阶段结合了 SFT、大规模智能体 RL 和多教师在线策略蒸馏(MOPD),在智能体任务和全模态理解基准测试中取得了强劲表现。
MiMo-V2.5 架构图
模型摘要
- 架构:稀疏 MoE(混合专家),总参数量 310B / 激活参数量 15B
- 上下文长度:最高达 1M tokens
- 模态:文本、图像、视频、音频
- 视觉编码器:729M 参数 ViT(28 层:24 层 SWA + 4 层全局)
- 音频编码器:261M 参数 Audio Transformer(24 层:12 层 SWA + 12 层全局)
- 多 Token 预测(MTP):329M 参数,3 层
2. 下载
3. 评估结果
全模态基准测试
MiMo-V2.5 全模态基准测试结果
编程 & 智能体基准测试
MiMo-V2.5 编程与智能体基准测试结果
长上下文基准测试
MiMo-V2.5 Graphwalks
4. 模型架构
LLM 主干
MiMo-V2.5 的核心语言主干继承自 MiMo-V2-Flash (https://github.com/XiaomiMiMo/MiMo-V2-Flash) 架构,这是一个带有混合滑动窗口注意力的稀疏 MoE 模型。
| 组件 | MiMo-V2.5-Pro | MiMo-V2.5 |
|---|---|---|
| 总参数量 | 1.02T | 310B |
| 激活参数量 | 42B | 15B |
| 隐藏层大小 | 6144 | 4096 |
| 层数 | 70 (1 层密集 + 69 层 MoE) | 48 (1 层密集 + 47 层 MoE) |
| 全局注意力层 | 10 | 9 |
| SWA 层 | 60 | 39 |
| 注意力头数 | 128 | 64 |
| KV 头数 | 8 (GQA) | 8 (GA) / 4 (SWA) |
| 头维度 (QK / V) | 192 / 128 | 192 / 128 |
| 路由专家数 | 384 | 256 |
| 每 Token 专家数 | 8 | 8 |
| MoE 中间层大小 | 2048 | 2048 |
| 密集中间层大小 | 16384 (仅第 0 层) | 16384 (仅第 0 层) |
| SWA 窗口大小 | 128 | 128 |
| 最大上下文长度 | 1M | 1M |
| MTP 层数 | 3 | 3 |
视觉编码器
我们训练了一个专用的 MiMo ViT,采用滑动窗口注意力以实现高效的视觉编码。
| 配置 | 值 |
|---|---|
| 总层数 | 28 |
| SWA 层 | 24 |
| 全局注意力层 | 4 |
| 窗口注意力模式 | [-1] + [0,0,0,0,1,1,1,1,-1] × 3 |
| 注意力头数 (Q / KV) | 32 / 8 |
| 头维度 (QK / V) | 64 / 64 |
| 滑动窗口大小 (L / R) | 64 / 64 |
窗口模式符号说明:-1 = 全局注意力,0 = 1D 行窗口,1 = 1D 列窗口。
音频编码器
我们的音频编码器从 MiMo-Audio-Tokenizer (https://huggingface.co/XiaomiMiMo/MiMo-Audio-Tokenizer) 的权重初始化,并进一步微调以支持高质量的音频理解。
| 配置 | 值 |
|---|---|
| 总层数 | 24 |
| SWA 层 | 12 |
| 全局注意力层 | 12 |
| 滑动窗口大小 | 128 |
| 注意力头数 (Q / KV) | 16 / 16 |
| 头维度 (QK / V) | 64 / 64 |
5. 训练过程
MiMo-V2.5 在总计约 48T tokens 的数据上进行训练。
- 文本预训练:我们收集多样化的文本数据用于预训练 LLM 主干。
- 投影器预热:短时间的多模态投影器(音频和视觉 MLP 投影器)预热。
- 多模态预训练:收集高质量的多模态数据进行大规模预训练。
- SFT & 智能体后训练:使用多样化的智能体数据进行监督微调。在此阶段,上下文窗口逐步从 32K → 256K → 1M 扩展。
- RL & MOPD 训练:通过强化学习提升感知、推理和智能体能力。
6. 部署
由于推理引擎正在不断进行更新和优化,本指南仅提供部署示例供参考。为了获得最佳性能,我们强烈建议遵循我们引用的方法,以获取最新的最佳实践和最优性能。
SGLang 部署
为了获得最佳性能,我们强烈建议使用此方法进行部署,该方法得到 SGLang 社区的官方支持。请参考 SGLang MiMo-V2.5 食谱 (https://docs.sglang.io/cookbook/autoregressive/Xiaomi/MiMo-V2.5) 获取最新的部署指南。
以下是使用 SGLang 运行模型的示例,参考自 sgl-project/sglang#23811 (https://github.com/sgl-project/sglang/pull/23811):
python3 -m sglang.launch_server \
--model-path XiaomiMiMo/MiMo-V2.5 \
--served-model-name mimo-v2.5 \
--log-level-http warning \
--enable-cache-report \
--pp-size 1 \
--dp-size 2 \
--tp-size 8 \
--enable-dp-attention \
--moe-a2a-backend deepep \
--deepep-mode auto \
--decode-log-interval 1 \
--page-size 1 \
--host 0.0.0.0 \
--port 9001 \
--trust-remote-code \
--watchdog-timeout 1000000 \
--mem-fraction-static 0.65 \
--chunked-prefill-size 16384 \
--reasoning-parser qwen3 \
--tool-call-parser mimo \
--context-length 262144 \
--collect-tokens-histogram \
--enable-metrics \
--load-balance-method round_robin \
--allow-auto-truncate \
--enable-metrics-for-all-schedulers \
--quantization fp8 \
--skip-server-warmup \
--moe-dense-tp-size 1 \
--enable-dp-lm-head \
--disable-tokenizer-batch-decode \
--mm-enable-dp-encoder \
--attention-backend fa3 \
--mm-attention-backend fa3
vLLM 部署
为了获得最佳性能,我们强烈建议使用此方法进行部署,该方法得到 vLLM 社区的官方支持。请参考 vLLM MiMo-V2-Flash 食谱 (https://recipes.vllm.ai/XiaomiMiMo/MiMo-V2-Flash) 获取最新的部署指南。
对于本地部署,我们建议将采样参数设置为 temperature=1.0 和 top_p=0.95。
引用
@misc{mimov25,
title={MiMo-V2.5},
year={2026},
howpublished={\url{https://huggingface.co/collections/XiaomiMiMo/mimo-v25}},
}
联系方式
如有问题或反馈,请通过 [email protected] 联系我们,或加入我们的社区:
- 微信群 (https://work.weixin.qq.com/apph5/external_room/join/group_mng?plg_id=c417f99bd9014b5dd894daa8bfe19790&)
- Discord (https://discord.gg/WX2R2uNp)
- Telegram (https://t.me/+3T-I0pekOVIyNDBl)
- Reddit (https://www.reddit.com/r/XiaomiMiMo_Official/)
相似文章
unsloth/MiniMax-M3-GGUF
Unsloth 发布了 MiniMax-M3 多模态模型的 GGUF 量化版本,支持图像-文本到文本任务,兼容 Transformers、llama.cpp、vLLM 等推理引擎。
XiaomiMiMo/MiMo-V2.5-Pro
小米发布了 MiMo-V2.5-Pro,这是一个开源的 MoE 语言模型,拥有 1.02T 总参数和 1M token 上下文长度,专为复杂的智能体(Agent)和软件工程任务进行了优化。
IFM/K2-Horizon-MoVA-36B-A4B-GGUF · Hugging Face
这是K2-Horizon-MoVA-36B-A4B模型的GGUF版本,一个具有36B总参数和每令牌4B活动参数的混合专家AI模型,针对llama.cpp使用进行了优化。它在代理和推理基准测试中展示了前沿级别的性能,与更大和封闭的模型竞争。
unsloth/Muse-Glimmer-30B-GGUF · Hugging Face
Unsloth 发布了 Meta 的 Muse Glimmer 30B 模型的 GGUF 量化版本,专为本地智能体任务设计,支持多模态输入、工具使用和多步推理。
LiquidAI/LFM2.5-VL-3B · Hugging Face
LiquidAI releases LFM2.5-VL-3B, a 3B multimodal model for on-device deployment with improved OCR, grounding, and efficient inference, available in multiple formats including GGUF, ONNX, and MLX.