MiMo v2.6 Flash MOPD
摘要
MiMo-V2.6-Flash-MOPD 是对 MiMo-V2.6-Flash-RL 模型的升级,它采用来自领域专用教师的策略内蒸馏,以提升性能并缓解智能体任务中的工具调用重复问题。
查看缓存全文
缓存时间: 2026/09/27 17:47
XiaomiMiMo/MiMo-V2.6-Flash-MOPD · Hugging Face
来源:https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD 小米-MiMo
技术报告 (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-RL/blob/main/MiMo_V2_6_technical_report.pdf)
这是对MiMo-V2.6-Flash-RL (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-RL) 检查点的MOPD升级。 - MOPD2(👉技术报告 §5.6 (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf)) 将多个领域专精教师融合到一个模型中,扩展到难以获得可靠训练时验证的领域,例如长期游戏开发、科学研究和具身智能。 - 诊断与缓解MiMo-V2.6中的工具调用重复问题(👉技术博客 (https://mimo.xiaomi.com/blog/mimo-v2-6-tool-call-repetition)) 一种易被忽视的故障模式:模型持续发出相同或高度相似的工具调用,看起来很忙碌却没有进展。由于没有任何调用彻底失败,因此该问题容易被忽视。MOPD阶段高效处理了此问题,通过一次短暂的专精教师训练即可快速收敛。
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#1-introduction1. 引言
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#how-mopd2-worksMOPD2 的工作原理
MOPD2 将多个领域专精教师蒸馏到在策略学生模型中。教师分为两类:一类是在可验证任务上训练的 mixRL教师,另一类是在开放域任务上通过合成演示进行训练的 SFT教师,这些开放域任务难以设计可靠的奖励。三个流派贡献于单次更新:
- 标准MOPD:由mixRL教师监督完全自主的rollout。
- 教师前缀OPD:前缀来自教师rollout。一条包含k个助手回复的轨迹产生k个历史前缀,每轮一个。模型基于每个前缀生成一个新的回复轮次,教师针对相同的历史对其进行评分。
- SFT前缀OPD:前缀来自SFT演示。演示提供了历史上下文,模型自行编写续写内容。
方法详情请参见技术报告 §5.6 (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf)\。
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#tool-call-repetition工具调用重复
MiMo-V2.6发布后,工具调用重复成为智能体环境中最显著的问题之一:模型有时会重复发出相同或高度相似的工具调用,消耗时间和上下文却没有取得进展。此检查点缓解了该问题。
MiMo-V2.6-Flash 在 MOPD 前后的工具调用重复率 (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD/blob/main/assets/mimo-repetition-rate-flash-en.png)
图:MiMo-V2.6-Flash 在RL阶段与本检查点、不同上下文长度和智能体框架下的响应级重复率。
完整诊断请参见技术博客 (https://mimo.xiaomi.com/blog/mimo-v2-6-tool-call-repetition)。修复方法训练开销很轻:通过一次短暂的专精教师运行,融入正常的MOPD流程中即可解决。
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#model-summary模型摘要
- 架构:稀疏MoE(混合专家),总参数309B / 激活参数15B
- 上下文长度:1M tokens
- 模态:文本、图像、视频、音频
- 视觉编码器:681M参数的MiMo ViT(28层:24个SWA + 4个Full)
- 音频编码器:308M AudioTokenizer + 127M 音频patch编码器
- 多Token预测(MTP):5层投机解码器
图1:MiMo-V2.6 架构 — 全模态编码器、混合SWA主干和MTP模块 (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD/blob/main/assets/architecture.png)
图1. MiMo-V2.6 架构。
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#2-downloads2. 下载
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#3-model-architecture3. 模型架构
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#llm-backboneLLM 主干
组件MiMo-V2.6-Flash-MOPD层数(总计 / SWA / GA)48 / 39 / 9隐藏尺寸4096SWA 注意力头数(Q/KV)64 / 8GA 注意力头数(Q/KV)64 / 4头维度(QK / V)192 / 128滑动窗口大小128路由专家(总计 / 激活)256 / 8最大上下文长度1MMTP / 投机解码器5个SWA层,窗口大小1024 第一个Transformer块使用全局注意力和密集FFN。其余块交错使用局部SWA和GA;两者均使用稀疏MoE FFN,无共享专家。
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#vision-encoder-mimo-vit视觉编码器(MiMo ViT)
配置值层数(总计 / SWA / GA)28 / 24 / 4隐藏尺寸1280注意力头数(Q / KV)32 / 8头维度64Patch大小(T × H × W)2 × 16 × 16滑动窗口(左 / 右)64 / 64空间合并大小2 × 2参数量681M
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#audio-encoders音频编码器
AudioTokenizer 编码器:24层(12个SWA / 12个GA),隐藏维度1024,20个RVQ码本,308M参数。音频patch编码器:6层,127M参数;每个patch包含四帧(25 Hz → 6.25 Hz)。
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#speculative-decoder投机解码器
5层SWA MTP起草器(DFlash风格)。每次前向传播预测7个后续token以实现并行验证。
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#4-deployment4. 部署
为获得最佳性能,请参考SGLang MiMo烹饪手册 (https://docs.sglang.io/cookbook/autoregressive/Xiaomi/MiMo-V2.5)。Docker镜像:lmsysorg/sglang:latest。
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#sglangSGLang
sglang serve \ --trust-remote-code \ --model-path XiaomiMiMo/MiMo-V2.6-Flash-MOPD \ --tp 8 \ --dp 2 \ --enable-dp-attention \ --enable-dp-lm-head \ --mm-enable-dp-encoder \ --mem-fraction-static 0.65 \ --chunked-prefill-size 16384 \ --speculative-algorithm EAGLE \ --speculative-num-steps 3 \ --speculative-eagle-topk 1 \ --speculative-num-draft-tokens 4 \ --enable-multi-layer-eagle \ --reasoning-parser mimo \ --tool-call-parser mimo \ --host 0.0.0.0 \ --port 30000
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#vllmvLLM
参考vLLM MiMo-V2.5 配方 (https://recipes.vllm.ai/XiaomiMiMo/MiMo-V2.5)。稳定版vLLM可能滞后;预构建镜像:docker pull vllm/vllm\-openai:mimov25\-cu129。
vllm serve XiaomiMiMo/MiMo-V2.6-Flash-MOPD \ --tensor-parallel-size 4 \ --trust-remote-code \ --gpu-memory-utilization 0.95 \ --max-model-len auto \ --reasoning-parser mimo \ --tool-call-parser mimo \ --enable-auto-tool-choice \ --generation-config vllm
推荐采样参数:temperature=1\.0, top\_p=0\.95。
同样可在 AI Studio, MiMo Code, 小米MiMo桌面端, 小米MiMo开放平台 API 以及 OpenRouter 中使用。
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#citation引用
@misc{mimo2026v26flashmopd, title={MiMo-V2.6-Flash-MOPD}, author={{Xiaomi MiMo Team}}, year={2026}, howpublished={\url{https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD}}, }
https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#contact联系方式
如有任何问题或反馈,请通过 [email protected] 联系我们,或加入我们的社区:
- 微信群 (https://work.weixin.qq.com/apph5/external_room/join/group_mng?plg_id=c417f99bd9014b5dd894daa8bfe19790&)
- Discord (https://discord.gg/WX2R2uNp)
- Telegram (https://t.me/+3T-I0pekOVIyNDBl)
- Reddit (https://www.reddit.com/r/XiaomiMiMo_Official/)
相似文章
XiaomiMiMo/MiMo-V2.6-Flash-RL · Hugging Face
MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。
XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash
XiaomiMiMo 发布 MiMo-V2.5-Pro-FP4-DFlash,这是一款 FP4 量化的 MoE 模型,采用块扩散推测解码,以减少万亿参数推理的内存和带宽。
Xiaomi开源MiMo-V2.6 Pro和Flash模型(2分钟阅读)
Xiaomi已开源MiMo-V2.6系列,推出两款全模态AI模型Pro和Flash,性能可与顶级专有模型媲美,并适用于各种应用。
MiMo-V2.6-Flash 在 vLLM 上的更新:修复了思考与工具功能导致的“空回复”问题,并揭示了一个隐藏的 2,048 输出令牌上限。
本文针对使用vLLM部署MiMo-V2.6-Flash模型时遇到的三个错误提供识别方法与解决方案,包括流式模式下的空响应、工具循环中的推理损失,以及隐藏的token输出上限问题。
XiaomiMiMo/MiMo-V2.5-Pro
小米发布了 MiMo-V2.5-Pro,这是一个开源的 MoE 语言模型,拥有 1.02T 总参数和 1M token 上下文长度,专为复杂的智能体(Agent)和软件工程任务进行了优化。