Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑

Hugging Face Daily Papers 论文

摘要

Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。

大规模视觉生成模型越来越强大,但训练、微调和部署成本高昂。我们推出 Mage-Flow,一个紧凑的 4B 规模生成栈,用于高效的文本到图像生成和基于指令的图像编辑。该栈由两个共同设计的组件构成:Mage-VAE,一个轻量级高保真潜在分词器;以及一个经过整流流匹配训练的原生分辨率多模态扩散变换器。Mage-VAE 使用一步扩散式编码和解码,并配合锚点潜在正则化,在保持强公共 VAE 重建质量的同时,将分词成本降低了一个数量级以上。结合原生分辨率打包和栈级 CUDA 内核融合,该栈支持灵活分辨率的训练,并将端到端训练吞吐量提升约 2.5 倍。在此基础上,我们开发了一个完整的模型家族,包括用于生成和编辑的 Base、RL-aligned 和 Turbo 变体。Diffusion-NFT 改进了提示遵循、文本渲染、美学质量和编辑保真度,而通过对抗性感知引导的少步蒸馏可产生用于低延迟推理的 4 步 Turbo 模型。尽管规模紧凑,Mage-Flow 和 Mage-Flow-Edit 在标准生成和编辑基准上均取得了具有竞争力的性能。更重要的是,Turbo 变体使高分辨率生成和编辑在交互式使用中变得实用:在单个 NVIDIA A100 GPU 上,1024^2 分辨率下,Mage-Flow-Turbo 生成图像只需 0.59 秒,Mage-Flow-Edit-Turbo 编辑图像只需 1.02 秒,同时保持较小的内存占用。这些结果表明,精心设计的分词器-骨干网络-系统协同设计可以在一个高效的 4B 模型家族中实现强大的高分辨率生成和编辑。
查看原文
查看缓存全文

缓存时间: 2026/07/22 06:41

论文页面 - Mage-Flow: 高效原生分辨率基础模型,用于图像生成与编辑

来源:https://huggingface.co/papers/2607.19064 发布于 7月21日

·

由 https://huggingface.co/Xinjie-Q 提交

Xinjie (https://huggingface.co/Xinjie-Q) 于 7月22日

#3 今日论文 (https://huggingface.co/papers/date/2026-07-22) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

大规模视觉生成器能力日益增强,但其训练、微调和部署成本高昂。我们提出 Mage-Flow,一个紧凑的 4B 规模生成栈,用于高效文生图和基于指令的图像编辑。该栈由两个协同设计的组件构成:Mage-VAE(一个轻量级高保真潜在分词器)和一个基于修正流匹配训练的原生分辨率多模态扩散 Transformer。Mage-VAE 采用单步扩散风格编码/解码,并辅以锚点潜在正则化,在保持强公共 VAE 重建质量的同时,将分词成本降低一个数量级以上。结合原生分辨率打包和栈级 CUDA 内核融合,该栈支持灵活分辨率训练,并将端到端训练吞吐量提升约 2.5 倍。在此基础上,我们开发了完整的模型系列,包括 Base、RL-aligned 和 Turbo 变体,分别用于生成和编辑。Diffusion-NFT 改善了提示遵循、文本渲染、美学质量和编辑保真度,而结合对抗性感知指导的少步蒸馏则产生了用于低延迟推理的 4 步 Turbo 模型。尽管规模紧凑,Mage-Flow 和 Mage-Flow-Edit 在标准生成和编辑基准上均取得了具有竞争力的性能。更重要的是,Turbo 变体使得高分辨率生成和编辑对于交互式使用变得切实可行:在单张 NVIDIA A100 GPU 上,Mage-Flow-Turbo 生成 1024^2 分辨率图像仅需 0.59 秒,Mage-Flow-Edit-Turbo 编辑图像仅需 1.02 秒,同时保持较小的内存占用。这些结果表明,通过精心设计的分词器-骨干-系统协同设计,可以在高效的 4B 模型系列中实现强大的高分辨率生成和编辑。

查看 arXiv 页面 (https://arxiv.org/abs/2607.19064) 查看 PDF (https://arxiv.org/pdf/2607.19064) 项目页面 (https://microsoft.github.io/Mage/) GitHub4 (https://github.com/microsoft/Mage) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.19064)

在你的 agent 中获取这篇论文:

hf papers read 2607\.19064

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型18

microsoft/Mage-Flow 文生图• 4B• 更新于约5小时前 • 22 (https://huggingface.co/microsoft/Mage-Flow)

microsoft/Mage-Flow-Base 文生图• 4B• 更新于约5小时前 • 9 (https://huggingface.co/microsoft/Mage-Flow-Base)

microsoft/Mage-Flow-Edit-Turbo 图生图• 4B• 更新于约5小时前 • 8 (https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo)

microsoft/Mage-Flow-Turbo 文生图• 4B• 更新于约5小时前 • 6 (https://huggingface.co/microsoft/Mage-Flow-Turbo)

浏览引用该论文的18个模型 (https://huggingface.co/models?other=arxiv:2607.19064)## 引用该论文的数据集0

没有关联该论文的数据集

请在数据集 README.md 中引用 arxiv.org/abs/2607.19064 以在此页面建立链接。

引用该论文的 Spaces2

包含该论文的收藏0

没有包含该论文的收藏

请将该论文添加到一个收藏 (https://huggingface.co/new-collection) 中以在此页面建立链接。

相似文章

microsoft/Mage-Flow

Hugging Face Models Trending

Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。

microsoft/Mage-Flow-Edit-Turbo

Hugging Face Models Trending

微软发布了Mage-Flow-Edit-Turbo,一种紧凑的4B参数规模的生成模型,用于高效的文本到图像生成和基于指令的图像编辑,通过协同设计的标记器和骨干网络实现了具有竞争力的最先进质量。

Mage (GitHub 仓库)

TLDR AI

微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。

Mage(两分钟阅读)

TLDR AI

微软推出Mage,一个紧凑型4B参数多模态模型系列,专为视觉理解与生成而设计,可在适中的硬件上轻松训练与部署,同时与更大的开源模型保持竞争力。