Mage (GitHub 仓库)
摘要
微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。
Mage是一系列轻量级、对研究友好的多模态模型,旨在使先进的视觉理解和生成能够用于在现实计算预算下的受控实验、训练后研究以及垂直领域应用。这些模型足够紧凑,可以在常规硬件上进行训练、微调和部署。它们在各自领域与更大的开放系统相比仍具有竞争力。这些模型仅用于研究,不用于产品或服务部署。
查看缓存全文
缓存时间: 2026/07/22 21:30
微软 Mage 团队
相似文章
microsoft/Mage-Flow
Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。
Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑
Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。
microsoft/Mage-Flow-Edit-Turbo
微软发布了Mage-Flow-Edit-Turbo,一种紧凑的4B参数规模的生成模型,用于高效的文本到图像生成和基于指令的图像编辑,通过协同设计的标记器和骨干网络实现了具有竞争力的最先进质量。
@DanKornas:大多数 AI 智能体仍然将视觉、语言和行动分离到不同的系统中。Magma 是微软研究院的一个基础…
Magma 是微软研究院推出的一个开源仓库,用于构建整合视觉、语言和行动的多模态 AI 智能体,提供模型链接、推理示例、训练说明和演示。
微软推出全新 MAI-Image 和 MAI-Voice(2 分钟阅读)
微软宣布 MAI-Image-2.5-Pro 和 MAI-Voice-2-Flash 公开预览,这是其最新专为图像和语音场景构建的生成式 AI 模型,现已上线 Azure AI,并为必应图像创建器等微软产品提供支持。