microsoft/Mage-Flow-Edit-Turbo

Hugging Face Models Trending 模型

摘要

微软发布了Mage-Flow-Edit-Turbo,一种紧凑的4B参数规模的生成模型,用于高效的文本到图像生成和基于指令的图像编辑,通过协同设计的标记器和骨干网络实现了具有竞争力的最先进质量。

任务:图像到图像 标签:diffusers, safetensors, image-to-image, image-editing, instruction-based-editing, diffusion, rectified-flow, mage-flow, arxiv:2607.19064, license:mit, diffusers:MageFlowPipeline, region:us
查看原文
查看缓存全文

缓存时间: 2026/07/27 01:46

microsoft/Mage-Flow-Edit-Turbo · Hugging Face

Source: https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo

Mage-Flow:一种高效的本地分辨率基础模型,用于图像生成与编辑

arXiv (https://arxiv.org/abs/2607.19064)项目页面 (https://microsoft.github.io/Mage)GitHub (https://github.com/microsoft/Mage)Hugging Face (https://huggingface.co/microsoft/Mage-Flow-Base)Hugging Face (https://huggingface.co/microsoft/Mage-Flow)Hugging Face (https://huggingface.co/microsoft/Mage-Flow-Turbo)Hugging Face (https://huggingface.co/microsoft/Mage-Flow-Edit-Base)Hugging Face (https://huggingface.co/microsoft/Mage-Flow-Edit)Hugging Face (https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo)许可证:MIT (https://opensource.org/licenses/MIT)

gallery


Mage-Flow 是一个紧凑的 4B 规模生成栈,用于高效的 文本到图像生成基于指令的图像编辑。它不追求数百亿参数规模,而是通过精心的 分词器–骨干–系统协同设计 达到领先的竞争性质量,因而在现实计算预算下保持快速、低内存和易于微调。

该生成栈由 两个共享、协同设计的组件 构成:

  • Mage-VAE —— 一种轻量级、高保真的潜在分词器(采用单步扩散编/解码,结合锚点潜在 KL 正则化)。
  • NR-MMDiT —— 一个共享的 4B 本地分辨率多模态扩散变换器,在 Mage-VAE 潜在空间中使用修正流匹配进行训练。

结合本地分辨率打包和融合内核训练基础设施,这个共享栈驱动 两个模型实例:用于文本到图像生成的 Mage-Flow 和用于基于指令图像编辑的 Mage-Flow-Edit。每个模型都有 Base(基础版)RL-aligned(强化学习对齐版)4-step Turbo(4步涡轮版) 变体。

https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo#%E2%9C%A8-highlights✨ 亮点

  • 紧凑且竞争力强。 单个 4B 系列同时支持生成 编辑,性能匹配或超越更大的开源系统(Qwen-Image 20B、Z-Image 6B、FLUX.2 32B、FireRed-Image-Edit 20B)。
  • 高效的分词器。 Mage-VAE 在重建保真度上媲美 FLUX.2-VAE,但每像素编/解码 MAC 数减少 ~12× / ~22×,消除了 VAE 作为高分辨率瓶颈的问题。
  • 本地分辨率。 单个检查点可生成从 512 到 2048 的任何宽高比,包括极端 4:1(例如 512×20482048×512)。
  • 系统级速度。 本地分辨率打包(FlashAttention 变长 + 每样本 2D RoPE)+ 融合 CUDA 内核,将每步训练时间从 ~1.93 秒 → ~0.78 秒训练速度提升约 2.5 倍);CFG 的条件/无条件分支在 一次 打包前向中完成。
  • 完整系列。 生成和编辑均有 Base(基础版)RL-aligned(强化学习对齐版)4-step Turbo(4步涡轮版) 变体。
  • 多才多艺的编辑。 Mage-Flow-Edit 在统一的图像和文本条件模型内支持语义内容编辑、外观变换、图像复原和结构感知输出。详见报告中的编辑示例。
  • 交互式延迟。 在单张 A100 上,1024² 分辨率下:Mage-Flow-Turbo 0.59 秒/张Mage-Flow-Edit-Turbo 1.02 秒/次编辑,峰值显存 约 18–20 GB(对比系统中最低)。

一对多编辑多样性 一对多编辑多样性 —— Mage-Flow-Edit 可从单张参考图像生成多样化的输出。

https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo#%F0%9F%93%A5-model-zoo📥 模型仓库

每个检查点都是一个独立的 diffusers 风格仓库(transformer/ + 共享的 vae/text_encoder/scheduler/)。

https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo#%F0%9F%96%BC%EF%B8%8F-showcase🖼️ 展示

文本到图像 —— 提示词跟随、精细细节、清晰的英文/中文文字渲染。(第一个面板已展开;点击标题可展开其他面板。)

展示 t2i 预告

通用场景 通用场景

人像 人像

美食与静物 美食

英文文字渲染 英文文字

中文文字渲染 中文文字

基于指令的编辑 —— 外观、内容、场景/主体、以人为中心与创意、底层操作及复原编辑(来源 → 结果)。(第一个面板已展开;点击标题可展开其他面板。)

各类编辑 I 编辑展示 1

各类编辑 II 编辑展示 2

局部内容与物体编辑 内容编辑

场景、主体与相机变换 场景与主体

外观与艺术渲染 外观

以人为中心的创意编辑 以人为中心与创意

底层视觉与条件重建 底层视觉

双向退化与复原 复原

https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo#%F0%9F%93%8A-performance📊 性能

完整基准测试表(文本到图像与图像编辑)—— 点击展开****文本到图像 —— 完整基准套件:GenEval、DPG-Bench、TIIF-Bench(短/长分割)、CVTG-2K、OneIG(英文/中文)、LongText(英文/中文)。数值越高越好;GenEval / CVTG-2K / OneIG / LongText 为 0–1 分制,DPG / TIIF 为 0–100 分制。类型列标记闭源 vs 开源;粗体/下划线 = 开源模型中的最佳/次佳(闭源模型仅作参考,不参与排名); = 未报告;★ = 我们的模型。

模型类型参数量步数GenEvalDPGTIIF-ShortTIIF-LongCVTG-2KOneIG-ENOneIG-CNLongText-ENLongText-CNSeedream 3.0闭源––0.8488.2786.0284.310.5920.5300.5280.8960.878Seedream 4.0闭源––0.8488.63––0.8920.5730.5540.9360.946GPT-Image-1闭源––0.8485.1589.1588.290.8570.5330.4740.9560.619Nano-Banana-Pro闭源––0.8387.16––0.7790.5800.5700.9810.949FLUX.1-dev开源12B500.6683.8471.0971.780.4960.4340.2450.6070.005FLUX.1-Krea-dev开源12B500.7286.5980.3681.670.4440.4430.2710.6930.002FLUX.2-dev开源32B500.8787.5788.8288.100.893****0.5510.5160.9630.757FLUX.2-Klein-Base-4B开源4B500.7883.0279.9480.010.6560.4850.3660.5540.071FLUX.2-Klein-Base-9B开源9B500.8385.2981.4784.520.6550.5440.4000.8720.227FLUX.2-Klein-4B开源4B40.8385.5378.9179.040.6280.5000.3640.6490.068FLUX.2-Klein-9B开源9B40.8686.2085.2284.130.4240.5380.4060.8720.226Qwen-Image开源20B500.8788.3286.1486.830.8290.5390.5480.9430.946JoyAI-Image开源16B50–88.05––0.8740.5420.5210.963****0.963HunyuanImage-3.0开源80B500.7286.10––0.765––––LongCat-Image开源6B500.8786.8080.9381.300.8660.5160.5180.8850.956Z-Image-Base开源6B500.8488.1480.2083.040.8670.5460.5350.9350.936Z-Image-Turbo开源6B80.8284.8677.7380.050.8590.5280.5070.9170.926Mage-Flow-Base★开源4B300.7986.2682.5083.190.8510.5420.5090.9040.792Mage-Flow★开源4B200.9086.4982.1984.700.8870.5360.5050.9440.823Mage-Flow-Turbo★开源4B40.8885.4883.5884.160.8730.5230.4910.9110.801 图像编辑 —— ImgEdit-Bench(0–5 分)、GEdit-Bench 英文/中文(0–10 分)、TextEdit-Bench 合成/真实(0–25 分)。数值越高越好;类型列标记闭源 vs 开源;粗体/下划线 = 开源模型中的最佳/次佳; = 未报告;★ = 我们的模型。

模型类型参数量步数ImgEditGEdit-ENGEdit-CNTextEdit-SynTextEdit-RealNano-Banana闭源––4.297.2917.39916.5418.22Seedream 4.0闭源––4.307.7017.69214.9018.54Seedream 4.5闭源––4.327.8207.800––Nano-Banana-Pro闭源––4.377.7387.799––Step1X-Edit-v1.2开源19B503.957.4807.4679.2612.02FLUX.1-Kontext-dev开源12B283.716.4621.85712.1414.31FLUX.2-dev开源32B504.357.4137.27811.8614.71FLUX.2-Klein-Base-4B开源4B503.807.0817.10211.0113.79FLUX.2-Klein-4B开源4B44.017.7177.75011.8414.46FLUX.2-Klein-Base-9B开源9B504.057.7407.74512.7615.65FLUX.2-Klein-9B开源9B44.188.0408.05512.7315.75Z-Image-Edit开源6B504.307.5707.540––Qwen-Image-Edit-2509开源20B504.317.4807.46713.4015.81Qwen-Image-Edit-2511开源20B504.517.8777.81913.5316.81LongCat-Image-Edit开源6B504.457.7487.73112.4614.89FireRed-Image-Edit-1.0开源20B504.567.9437.88715.19****17.23JoyAI-Image-Edit开源16B504.468.2768.12514.8017.23****Mage-Flow-Edit-Base★开源4B304.287.8607.97013.6315.57Mage-Flow-Edit★开源4B304.348.1278.12314.1416.26Mage-Flow-Edit-Turbo★开源4B44.388.2718.26412.7715.41

https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo#%F0%9F%8F%97%EF%B8%8F-architecture🏗️ 架构

Mage-VAE —— 一个潜在分词器,构建为 对称的 单步扩散编解码器:解码器是全卷积的单步像素扩散模型(无全局注意力块),编码器是其架构对偶(一种以像素为条件的单步潜在生成器)。用 锚点潜在 KL 替代标准高斯先验 KL,使后验规则化到 FLUX.2-VAE 潜在空间,从而获得一个可用于生成的 128 通道、16× 下采样的潜在空间。

Mage-VAE 架构与训练 Mage-VAE —— 锚点 VAE(FLUX.2-VAE)、对称的单步编码器/解码器架构以及三阶段训练流程。

Mage-Flow —— 一个 4B 多模态 DiT,使用 Qwen3-VL 编码提示词,使用 Mage-VAE 编码图像,然后处理 打包后的 变长图像+文本序列,并应用每样本 2D 旋转嵌入和联合自注意力。本地分辨率打包 消除了桶量化和填充,使单个检查点能泛化到任意输出尺寸,并将 CFG 的条件/无条件分支融合为单次前向传播。

Mage-Flow / 本地分辨率 MMDiT 架构 Mage-Flow —— 通过本地分辨率 MMDiT(左)处理变长图像+文本 token 的打包;双流 MMDiT 块(右)。

训练后阶段 —— 从 Base 开始,使用 Diffusion-NFT(提示词跟随、美学、文字渲染、偏好)对齐生成模型,得到 RL 模型;再通过 解耦 DMD + 对抗感知引导 蒸馏为 4 步 Turbo。编辑模型复用此方法,在生成和编辑数据的混合集上训练,以保留生成先验。

https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo#%F0%9F%9A%80-quick-start🚀 快速开始

https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo#installation安装

先安装所有依赖( flash\-attn 之外),然后单独安装 flash\-attn,并关闭构建隔离 —— 它会针对已安装的 torch 编译 CUDA 扩展,因此必须预先安装 torch 和匹配的 CUDA 工具包。

`` cd Mage/mage_flow uv venv && source .venv/bin/activate

1) 固定且经过测试的依赖集(torch 2.13, transformers 5.5, diffusers 0.38, pillow 12.3, …)。

推荐用于重现。uv pip install -e . 也可行,但其松散的版本范围可能会解析为比代码测试版本更新的 torch/transformers。

uv pip install -r requirements.txt uv pip install -e . –no-deps # mage-flow 包本身

2) flash-attn —— 需要存在构建工具以及 CUDA 工具包,其 MAJOR 版本

必须与您的 torch 构建版本匹配(例如 torch cu12x ↔ nvcc 12.x)。cu13/nvcc-12 组合会失败。

uv pip install setuptools wheel ninja uv pip install –no-build-isolation flash-attn==2.8.3 ``

使用普通 pip 等效(pip install \-r requirements\.txtpip install \-e \. \-\-no\-deps,然后执行两条 flash-attn 命令)。这注册了三个命令:mage\-flowmage\-flow\-editmage\-flow\-app

torch / CUDA: PyPI 默认的 torch wheel 针对最新的 CUDA(目前为 cu13x)。如果您的机器 CUDA 工具包是 12.x,请先从匹配的索引安装 torch,例如 uv pip install torch==2\.13\.0 torchvision==0\.28\.0 \-\-index\-url https://download\.pytorch\.org/whl/cu126,否则 flash-attn 构建会因 CUDA 版本不匹配而失败。(torch 2.13.0 提供了 cu126/cu129/cu130 的 wheel —— 请选择与您的 nvcc 匹配的版本。)

https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo#python-apiPython API

pipe.generate(prompts, **kw)pipe.edit(prompts, ref_images, **kw) 返回一个与 prompts 对应的 list[PIL.Image]prompts 列表 会在每个去噪步骤中被打包为一次前向传播(每个样本可以拥有自己的分辨率和种子)。

文本到图像:

`` from mage_flow import MageFlowPipeline

pipe = MageFlowPipeline.from_pretrained(“microsoft/Mage-Flow”, device=“cuda”)

1) 单张图像

img = pipe.generate([“A close-up portrait of an elderly African man with deep wrinkles, wearing a traditional hat, soft natural lighting, ultra realistic.”], steps=20, cfg=5.0, heights=[1024], widths=[1024])[0] img.save(“t2i.png”)

2) 批量:每步一次打包前向,支持多个提示词/分辨率/种子

imgs = pipe.generate( [“the Salar de Uyuni mirror surface captured at high noon, with intimate stillness permeating the air. dew beads on every blade of grass. National Geographic editorial, cinematic depth, fine-grained natural texture.”, “A close-up portrait of an elderly African man with deep wrinkles, wearing a traditional hat, soft natural lighting, ultra realistic.”, “An immersive close-up of a steaming bowl of Sichuan mapo tofu over jasmine rice served on a hand-thrown ceramic plate, finished with a wedge of citrus. Surface oils catch a tiny specular highlight. Shot with a Hasselblad H6D-100c, ambient window light, the kind of image that makes the viewer hungry.”], heights=[512, 1024, 1792], widths=[2048, 1024, 1024], # 每样本;4:1 比例没问题 seeds=[1, 2, 3], steps=20, cfg=5.0, ) ``

图像编辑:

`` from mage_flow import MageFlowPipeline

pipe = MageFlowPipeline.from_pretrained(“microsoft/Mage-Flow-Edit-Turbo”, device=“cuda”)

单张参考图像(路径或 PIL 图像)

img = pipe.edit([“Replace the background with a field of sunflowers”], [“assets/dog.jpg”], steps=4, cfg=1.0, max_size=1024)[0] img.save(“single_edit.png”)

多图像编辑 — ref_images[i] 是一个包含多张源图像的列表

img = pipe.edit([“blend the object from image 2 into image 1”], [[“scene.png”, “object.png”]], steps=4, cfg=1.0)[0] img.save(“multi_edit.png”)

显式指定输出尺寸(覆盖 max_size);Turbo 编辑 = 4 步 / cfg 1

img = pipe.edit([“Replace the background with a field of sunflowers”], [“assets/dog.jpg”], heights=[1024], widths=[1024], steps=4, cfg=1.0)[0] img.save(“single_edit_1024x1024.png”) ``

参数generate / edit 共用):

参数默认值描述
prompts字符串或字符串列表;列表会在每步中被打包为一次前向传播
ref_images编辑每张提示词对应的:一张图像/路径,或用于多图像编辑的 列表
steps30去噪步数 — Base 30,RL 20,Turbo 4
cfg5.0无分类器指导尺度(Turbo:1.0
heights, widths[1024]每样本输出尺寸,需为 16 的倍数;本地分辨率 5122048
max_size编辑来源尺寸输出侧最长边;短边遵循参考图像的宽高比
vl_cond_long_edge编辑384限制输入给 VL 文本编码器 的参考图像最长边(与训练预处理一致;VAE/生成路径保持完整输出分辨率)。0/None 禁用
neg_prompts" "每样本负提示词(当 cfg > 1 时应用)
seeds42每样本种子;-1 = 随机
batch_cfgTrue将 CFG 条件 + 无条件传递融合为一次打包前向传播
renormalizationFalse对每个 token 重新缩放导向速度(在高 cfg 下减少过饱和)
static_shift6.0覆盖流量匹配的 sigma 移位
prompt_templatemage-flow / mage-flow-edit文本编码器提示词模板

https://huggingface.co/microsoft/Mage-Flow-Edit-Turbo#cliCLI

``

text-to-image (two prompts in one batch)

mage-flow –prompt “A

相似文章

microsoft/Mage-Flow

Hugging Face Models Trending

Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。

Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑

Hugging Face Daily Papers

Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。

Mage (GitHub 仓库)

TLDR AI

微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。

microsoft/Lens-Turbo

Hugging Face Models Trending

微软发布了Lens,一个拥有38亿参数的基础文本到图像模型,具备高效的训练和快速的高分辨率生成能力,采用密集字幕预训练和混合分辨率学习。

baidu/ERNIE-Image-Turbo

Hugging Face Models Trending

百度发布了ERNIE-Image-Turbo,一个蒸馏文本到图像生成模型,可在8步推理中实现快速生成,同时保持强大的文本渲染、指令遵循和结构化图像生成能力。