MiMo v2.6 Flash MOPD

Reddit r/LocalLLaMA 模型

摘要

MiMo-V2.6-Flash-MOPD 是对 MiMo-V2.6-Flash-RL 模型的升级,它采用来自领域专用教师的策略内蒸馏,以提升性能并缓解智能体任务中的工具调用重复问题。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/27 17:47

XiaomiMiMo/MiMo-V2.6-Flash-MOPD · Hugging Face

来源:https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD 小米-MiMo

技术报告 (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-RL/blob/main/MiMo_V2_6_technical_report.pdf)

这是对MiMo-V2.6-Flash-RL (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-RL) 检查点的MOPD升级。 - MOPD2(👉技术报告 §5.6 (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf)) 将多个领域专精教师融合到一个模型中,扩展到难以获得可靠训练时验证的领域,例如长期游戏开发、科学研究和具身智能。 - 诊断与缓解MiMo-V2.6中的工具调用重复问题(👉技术博客 (https://mimo.xiaomi.com/blog/mimo-v2-6-tool-call-repetition)) 一种易被忽视的故障模式:模型持续发出相同或高度相似的工具调用,看起来很忙碌却没有进展。由于没有任何调用彻底失败,因此该问题容易被忽视。MOPD阶段高效处理了此问题,通过一次短暂的专精教师训练即可快速收敛。

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#1-introduction1. 引言

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#how-mopd2-worksMOPD2 的工作原理

MOPD2 将多个领域专精教师蒸馏到在策略学生模型中。教师分为两类:一类是在可验证任务上训练的 mixRL教师,另一类是在开放域任务上通过合成演示进行训练的 SFT教师,这些开放域任务难以设计可靠的奖励。三个流派贡献于单次更新:

  • 标准MOPD:由mixRL教师监督完全自主的rollout。
  • 教师前缀OPD:前缀来自教师rollout。一条包含k个助手回复的轨迹产生k个历史前缀,每轮一个。模型基于每个前缀生成一个新的回复轮次,教师针对相同的历史对其进行评分。
  • SFT前缀OPD:前缀来自SFT演示。演示提供了历史上下文,模型自行编写续写内容。

方法详情请参见技术报告 §5.6 (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf)\。

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#tool-call-repetition工具调用重复

MiMo-V2.6发布后,工具调用重复成为智能体环境中最显著的问题之一:模型有时会重复发出相同或高度相似的工具调用,消耗时间和上下文却没有取得进展。此检查点缓解了该问题。

MiMo-V2.6-Flash 在 MOPD 前后的工具调用重复率 (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD/blob/main/assets/mimo-repetition-rate-flash-en.png)

图:MiMo-V2.6-Flash 在RL阶段与本检查点、不同上下文长度和智能体框架下的响应级重复率。

完整诊断请参见技术博客 (https://mimo.xiaomi.com/blog/mimo-v2-6-tool-call-repetition)。修复方法训练开销很轻:通过一次短暂的专精教师运行,融入正常的MOPD流程中即可解决。

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#model-summary模型摘要

  • 架构:稀疏MoE(混合专家),总参数309B / 激活参数15B
  • 上下文长度:1M tokens
  • 模态:文本、图像、视频、音频
  • 视觉编码器:681M参数的MiMo ViT(28层:24个SWA + 4个Full)
  • 音频编码器:308M AudioTokenizer + 127M 音频patch编码器
  • 多Token预测(MTP):5层投机解码器

图1:MiMo-V2.6 架构 — 全模态编码器、混合SWA主干和MTP模块 (https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD/blob/main/assets/architecture.png)

图1. MiMo-V2.6 架构。

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#2-downloads2. 下载

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#3-model-architecture3. 模型架构

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#llm-backboneLLM 主干

组件MiMo-V2.6-Flash-MOPD层数(总计 / SWA / GA)48 / 39 / 9隐藏尺寸4096SWA 注意力头数(Q/KV)64 / 8GA 注意力头数(Q/KV)64 / 4头维度(QK / V)192 / 128滑动窗口大小128路由专家(总计 / 激活)256 / 8最大上下文长度1MMTP / 投机解码器5个SWA层,窗口大小1024 第一个Transformer块使用全局注意力和密集FFN。其余块交错使用局部SWA和GA;两者均使用稀疏MoE FFN,无共享专家。

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#vision-encoder-mimo-vit视觉编码器(MiMo ViT)

配置值层数(总计 / SWA / GA)28 / 24 / 4隐藏尺寸1280注意力头数(Q / KV)32 / 8头维度64Patch大小(T × H × W)2 × 16 × 16滑动窗口(左 / 右)64 / 64空间合并大小2 × 2参数量681M

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#audio-encoders音频编码器

AudioTokenizer 编码器:24层(12个SWA / 12个GA),隐藏维度1024,20个RVQ码本,308M参数。音频patch编码器:6层,127M参数;每个patch包含四帧(25 Hz → 6.25 Hz)。

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#speculative-decoder投机解码器

5层SWA MTP起草器(DFlash风格)。每次前向传播预测7个后续token以实现并行验证。

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#4-deployment4. 部署

为获得最佳性能,请参考SGLang MiMo烹饪手册 (https://docs.sglang.io/cookbook/autoregressive/Xiaomi/MiMo-V2.5)。Docker镜像:lmsysorg/sglang:latest。

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#sglangSGLang

sglang serve \ --trust-remote-code \ --model-path XiaomiMiMo/MiMo-V2.6-Flash-MOPD \ --tp 8 \ --dp 2 \ --enable-dp-attention \ --enable-dp-lm-head \ --mm-enable-dp-encoder \ --mem-fraction-static 0.65 \ --chunked-prefill-size 16384 \ --speculative-algorithm EAGLE \ --speculative-num-steps 3 \ --speculative-eagle-topk 1 \ --speculative-num-draft-tokens 4 \ --enable-multi-layer-eagle \ --reasoning-parser mimo \ --tool-call-parser mimo \ --host 0.0.0.0 \ --port 30000

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#vllmvLLM

参考vLLM MiMo-V2.5 配方 (https://recipes.vllm.ai/XiaomiMiMo/MiMo-V2.5)。稳定版vLLM可能滞后;预构建镜像:docker pull vllm/vllm\-openai:mimov25\-cu129。

vllm serve XiaomiMiMo/MiMo-V2.6-Flash-MOPD \ --tensor-parallel-size 4 \ --trust-remote-code \ --gpu-memory-utilization 0.95 \ --max-model-len auto \ --reasoning-parser mimo \ --tool-call-parser mimo \ --enable-auto-tool-choice \ --generation-config vllm

推荐采样参数:temperature=1\.0, top\_p=0\.95。

同样可在 AI Studio, MiMo Code, 小米MiMo桌面端, 小米MiMo开放平台 API 以及 OpenRouter 中使用。

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#citation引用

@misc{mimo2026v26flashmopd, title={MiMo-V2.6-Flash-MOPD}, author={{Xiaomi MiMo Team}}, year={2026}, howpublished={\url{https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD}}, }

https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Flash-MOPD#contact联系方式

如有任何问题或反馈,请通过 [email protected] 联系我们,或加入我们的社区:

  • 微信群 (https://work.weixin.qq.com/apph5/external_room/join/group_mng?plg_id=c417f99bd9014b5dd894daa8bfe19790&)
  • Discord (https://discord.gg/WX2R2uNp)
  • Telegram (https://t.me/+3T-I0pekOVIyNDBl)
  • Reddit (https://www.reddit.com/r/XiaomiMiMo_Official/)

相似文章

XiaomiMiMo/MiMo-V2.6-Flash-RL · Hugging Face

Reddit r/LocalLLaMA

MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。

XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash

Hugging Face Models Trending

XiaomiMiMo 发布 MiMo-V2.5-Pro-FP4-DFlash,这是一款 FP4 量化的 MoE 模型,采用块扩散推测解码,以减少万亿参数推理的内存和带宽。

XiaomiMiMo/MiMo-V2.5-Pro

Hugging Face Models Trending

小米发布了 MiMo-V2.5-Pro,这是一个开源的 MoE 语言模型,拥有 1.02T 总参数和 1M token 上下文长度,专为复杂的智能体(Agent)和软件工程任务进行了优化。