LLaDA-Image: 构建强大图像生成器的完全开放训练方案

Hugging Face Daily Papers 论文

摘要

LLaDA-Image 提出了一个统一框架,结合了一个 60 亿参数的扩散变换器和一个冻结的视觉语言模块,用于生成具有精确编辑功能的逼真图像,通过高效的训练和快速推理,在开源模型中达到了最先进的成果。

我们介绍了 LLaDA-Image,这是一个统一框架,将一个从零训练的 60 亿参数扩散变换器(DiT)与一个基于 LLaDA2.0-Mini 扩散语言模型骨干的冻结视觉语言理解模块配对。我们没有从一开始就严重依赖配对图像文本数据,而是首先通过仅图像预训练和中间训练构建了一个强大的视觉生成先验。生成管道包含 2.2 亿个样本,其中 9800 万是真实图像。为了实现高效和可扩展的优化,我们在整个 DiT 中使用无参数 RMSNorm 以及 Muon 优化器。由此产生的统一模型能够生成高度逼真的图像,同时准确遵循细粒度的编辑指令。我们进一步将 LLaDA-Image 蒸馏为 LLaDA-Image-Turbo,使其在 2-4 个采样步骤内实现快速推理。在 Qwen-Image-Bench 上,LLaDA-Image 在英文和中文赛道分别取得了 53.53 和 53.38 的总分,在两个赛道上都树立了开源模型的新标杆。为了支持对强大且高效的生成模型的进一步研究,我们发布了模型权重、训练代码和详细配方。
查看原文
查看缓存全文

缓存时间: 2026/09/04 03:58

论文页面 - LLaDA-Image:通过完全开放的训练方案构建强大图像生成器

来源:https://huggingface.co/papers/2609.03796
发布于 9月3日

#1 当日论文 (https://huggingface.co/papers/date/2026-09-04)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,

摘要

LLaDA-Image 将一个 6B 扩散变换器与冻结的视觉语言模块统一,仅使用图像进行预训练并采用 Muon 优化器,以生成具有精确编辑能力的逼真图像,并蒸馏为一个快速的 2-4 步版本,在开源模型中达到了最先进的效果。

我们介绍了 LLaDA-Image,这是一个统一框架,它将一个从头训练的 6B 扩散变换器 (https://huggingface.co/papers?q=Diffusion%20Transformer) (DiT (https://huggingface.co/papers?q=DiT)) 与一个冻结的、基于 LLaDA2.0-Mini (https://huggingface.co/papers?q=LLaDA2.0-Mini) 扩散语言模型 (https://huggingface.co/papers?q=diffusion%20language%20model) 骨干构建的视觉语言理解 (https://huggingface.co/papers?q=vision-language%20understanding) 模块配对。我们并非一开始就严重依赖配对的图像-文本数据,而是首先通过图像预训练 (https://huggingface.co/papers?q=image-only%20pre-training) 和中期训练建立一个强大的视觉生成先验。生成管线包含 2.2 亿样本,其中 9800 万是真实图像。为了实现高效且可扩展的优化,我们在整个 DiT (https://huggingface.co/papers?q=DiT) 中使用了无参数 (https://huggingface.co/papers?q=parameter-free) RMSNorm (https://huggingface.co/papers?q=RMSNorm) 并配合 Muon 优化器 (https://huggingface.co/papers?q=Muon%20optimizer)。所得到的统一模型能够生成高度逼真的图像,同时准确遵循细粒度的编辑 (https://huggingface.co/papers?q=dit) 指令。我们进一步将 LLaDA-Image 蒸馏为 LLaDA-Image-Turbo (https://huggingface.co/papers?q=LLaDA-Image-Turbo),使其能够在 2-4 个采样步骤内实现快速推理。在 Qwen-Image-Bench 上,LLaDA-Image 在英文和中文轨道上的总分分别为 53.53 和 53.38,在两条轨道上都为开源模型树立了新的最先进水平。为了支持对强大且高效的生成模型的进一步研究,我们发布了模型权重、训练代码和详细的配方。

查看 arXiv 页面 (https://arxiv.org/abs/2609.03796) 查看 PDF (https://arxiv.org/pdf/2609.03796) 项目页面 (https://github.com/inclusionAI/LLaDA-Image) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.03796)

将此论文添加到您的代理中:

hf papers read 2609\.03796

没有最新的 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 4

inclusionAI/LLaDA-Image-Turbo 文本到图像• 7B• 更新于约 2 小时前 • 2 • 3 (https://huggingface.co/inclusionAI/LLaDA-Image-Turbo)

inclusionAI/LLaDA-Image 文本到图像• 7B• 更新于约 2 小时前 • 5 • 2 (https://huggingface.co/inclusionAI/LLaDA-Image)

inclusionAI/LLaDA-Image-Turbo-FP8 文本到图像• 7B• 更新于约 2 小时前 • 2 (https://huggingface.co/inclusionAI/LLaDA-Image-Turbo-FP8)

inclusionAI/LLaDA-Image-FP8 文本到图像• 7B• 更新于约 2 小时前 • 1 (https://huggingface.co/inclusionAI/LLaDA-Image-FP8)

引用此论文的数据集 0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.03796 以从本页链接它。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.03796 以从本页链接它。

包含此论文的收藏夹 1

相似文章

LLaDA2.X (GitHub 仓库)

TLDR AI

蚂蚁集团发布LLaDA2.X系列扩散语言模型,扩展至千亿参数,采用MoE架构,开源模型权重和训练代码。

DALL·E: 根据文本创建图像

OpenAI Blog

OpenAI 推出 DALL·E,一个具有 120 亿参数的 Transformer 模型,它将文本和图像视为单一令牌流来根据文本描述生成图像。该模型展示了多种功能,包括创建拟人化物体、组合不同的概念、呈现文本和执行图像修复任务。

HiDream-ai/HiDream-O1-Image-Dev

Hugging Face Models Trending

HiDream-ai 发布了 HiDream-O1-Image-Dev,这是一个拥有 80 亿参数的开源图像生成模型,采用像素级统一 Transformer 架构,无需外部 VAE。该模型在 Artificial Analysis Text to Image Arena 排行榜中位列第 8,支持高达 2,048x2,048 的超高分辨率图像生成。

最强本地AI图像生成器来了!

YouTube AI Channels

Ernie Image,全新开源扩散模型,文字渲染与提示词忠实度全面超越Zage,可在ComfyUI本地运行,仅需约20 GB显存。