Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑
摘要
Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。
查看缓存全文
缓存时间: 2026/07/22 06:41
论文页面 - Mage-Flow: 高效原生分辨率基础模型,用于图像生成与编辑
来源:https://huggingface.co/papers/2607.19064 发布于 7月21日
·
由 https://huggingface.co/Xinjie-Q 提交
Xinjie (https://huggingface.co/Xinjie-Q) 于 7月22日
#3 今日论文 (https://huggingface.co/papers/date/2026-07-22) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
大规模视觉生成器能力日益增强,但其训练、微调和部署成本高昂。我们提出 Mage-Flow,一个紧凑的 4B 规模生成栈,用于高效文生图和基于指令的图像编辑。该栈由两个协同设计的组件构成:Mage-VAE(一个轻量级高保真潜在分词器)和一个基于修正流匹配训练的原生分辨率多模态扩散 Transformer。Mage-VAE 采用单步扩散风格编码/解码,并辅以锚点潜在正则化,在保持强公共 VAE 重建质量的同时,将分词成本降低一个数量级以上。结合原生分辨率打包和栈级 CUDA 内核融合,该栈支持灵活分辨率训练,并将端到端训练吞吐量提升约 2.5 倍。在此基础上,我们开发了完整的模型系列,包括 Base、RL-aligned 和 Turbo 变体,分别用于生成和编辑。Diffusion-NFT 改善了提示遵循、文本渲染、美学质量和编辑保真度,而结合对抗性感知指导的少步蒸馏则产生了用于低延迟推理的 4 步 Turbo 模型。尽管规模紧凑,Mage-Flow 和 Mage-Flow-Edit 在标准生成和编辑基准上均取得了具有竞争力的性能。更重要的是,Turbo 变体使得高分辨率生成和编辑对于交互式使用变得切实可行:在单张 NVIDIA A100 GPU 上,Mage-Flow-Turbo 生成 1024^2 分辨率图像仅需 0.59 秒,Mage-Flow-Edit-Turbo 编辑图像仅需 1.02 秒,同时保持较小的内存占用。这些结果表明,通过精心设计的分词器-骨干-系统协同设计,可以在高效的 4B 模型系列中实现强大的高分辨率生成和编辑。
查看 arXiv 页面 (https://arxiv.org/abs/2607.19064) 查看 PDF (https://arxiv.org/pdf/2607.19064) 项目页面 (https://microsoft.github.io/Mage/) GitHub4 (https://github.com/microsoft/Mage) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19064)
在你的 agent 中获取这篇论文:
hf papers read 2607\.19064
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型18
microsoft/Mage-Flow 文生图• 4B• 更新于约5小时前 • 22 (https://huggingface.co/microsoft/Mage-Flow)
microsoft/Mage-Flow-Base 文生图• 4B• 更新于约5小时前 • 9 (https://huggingface.co/microsoft/Mage-Flow-Base)
microsoft/Mage-Flow-Edit-Turbo 图生图• 4B• 更新于约5小时前 • 8 (https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo)
microsoft/Mage-Flow-Turbo 文生图• 4B• 更新于约5小时前 • 6 (https://huggingface.co/microsoft/Mage-Flow-Turbo)
浏览引用该论文的18个模型 (https://huggingface.co/models?other=arxiv:2607.19064)## 引用该论文的数据集0
没有关联该论文的数据集
请在数据集 README.md 中引用 arxiv.org/abs/2607.19064 以在此页面建立链接。
引用该论文的 Spaces2
包含该论文的收藏0
没有包含该论文的收藏
请将该论文添加到一个收藏 (https://huggingface.co/new-collection) 中以在此页面建立链接。
相似文章
microsoft/Mage-Flow
Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。
microsoft/Mage-Flow-Edit-Turbo
微软发布了Mage-Flow-Edit-Turbo,一种紧凑的4B参数规模的生成模型,用于高效的文本到图像生成和基于指令的图像编辑,通过协同设计的标记器和骨干网络实现了具有竞争力的最先进质量。
Mage (GitHub 仓库)
微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。
@jiqizhixin:如果只需要一步就能生成高质量图像,而不是数百步?斯坦福和字节跳动推出 W-Flow……
斯坦福和字节跳动推出 W-Flow,一种单步生成模型,利用 Wasserstein 梯度流实现了最先进的单步 ImageNet 256x256 生成(FID 1.29),采样速度比多步扩散模型快 100 倍。
Mage(两分钟阅读)
微软推出Mage,一个紧凑型4B参数多模态模型系列,专为视觉理解与生成而设计,可在适中的硬件上轻松训练与部署,同时与更大的开源模型保持竞争力。