小米悄然发布MiMo-V2.5-DFlash — 官方DFlash权重现已上线Hugging Face
摘要
小米低调发布了MiMo-V2.5-DFlash,一个300B参数模型,已在Hugging Face上架,DFlash可能使推理速度翻倍。
https://huggingface.co/XiaomiMiMo/MiMo-V2.5-DFlash 小米似乎已悄然将MiMo-V2.5-DFlash上传至Hugging Face:有一个专门的dflash目录包含Dflash模型,有人愿意将其GGUF化并尝试吗?我本可以,但今天不行。这个模型我认为相当不错(300B+参数),在2x24GB显卡加显存卸载(96/128GB DDR5)上运行速度约为8-10 tk/s,dflash可能使速度翻倍,从而非常有趣。编辑:它之所以有趣,主要是因为MTP头部已经共享,但在llama.cpp中尚无法工作。我推测(双关语)Dflash反而可以工作。编辑2:非常酷!他们还分享了单独的MTP模型。Llama无法工作的原因是它难以识别MTP层。一个单独的MTP模型可能也行。
相似文章
XiaomiMiMo/MiMo-V2.5-Pro-FP4-DFlash
XiaomiMiMo 发布 MiMo-V2.5-Pro-FP4-DFlash,这是一款 FP4 量化的 MoE 模型,采用块扩散推测解码,以减少万亿参数推理的内存和带宽。
小米现在使用DFlash和Persistent内核以1000-3000 tps提供服务MiMo V2.5。DFlash模型已发布,并承诺即将开源发布。
小米发布了搭载DFlash和Persistent内核的MiMo V2.5,实现了1000-3000 tps。DFlash模型现已可用,并承诺即将开源发布。
Xiaomi开源MiMo-V2.6 Pro和Flash模型(2分钟阅读)
Xiaomi已开源MiMo-V2.6系列,推出两款全模态AI模型Pro和Flash,性能可与顶级专有模型媲美,并适用于各种应用。
XiaomiMiMo/MiMo-V2.6-Flash-RL · Hugging Face
MiMo-V2.6-Flash-RL 是一个多模态AI模型,通过扩展强化学习实现自我改进,采用稀疏混合专家架构,总参数3090亿,上下文长度为100万令牌。
Xiaomi MiMo v2.6
Xiaomi 发布了 MiMo 模型的 2.6 版本,这暗示了对其 AI 能力的增量更新。