LLaDA-Image: 构建强大图像生成器的完全开放训练方案
摘要
LLaDA-Image 提出了一个统一框架,结合了一个 60 亿参数的扩散变换器和一个冻结的视觉语言模块,用于生成具有精确编辑功能的逼真图像,通过高效的训练和快速推理,在开源模型中达到了最先进的成果。
查看缓存全文
缓存时间: 2026/09/04 03:58
论文页面 - LLaDA-Image:通过完全开放的训练方案构建强大图像生成器
来源:https://huggingface.co/papers/2609.03796
发布于 9月3日
#1 当日论文 (https://huggingface.co/papers/date/2026-09-04)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
LLaDA-Image 将一个 6B 扩散变换器与冻结的视觉语言模块统一,仅使用图像进行预训练并采用 Muon 优化器,以生成具有精确编辑能力的逼真图像,并蒸馏为一个快速的 2-4 步版本,在开源模型中达到了最先进的效果。
我们介绍了 LLaDA-Image,这是一个统一框架,它将一个从头训练的 6B 扩散变换器 (https://huggingface.co/papers?q=Diffusion%20Transformer) (DiT (https://huggingface.co/papers?q=DiT)) 与一个冻结的、基于 LLaDA2.0-Mini (https://huggingface.co/papers?q=LLaDA2.0-Mini) 扩散语言模型 (https://huggingface.co/papers?q=diffusion%20language%20model) 骨干构建的视觉语言理解 (https://huggingface.co/papers?q=vision-language%20understanding) 模块配对。我们并非一开始就严重依赖配对的图像-文本数据,而是首先通过图像预训练 (https://huggingface.co/papers?q=image-only%20pre-training) 和中期训练建立一个强大的视觉生成先验。生成管线包含 2.2 亿样本,其中 9800 万是真实图像。为了实现高效且可扩展的优化,我们在整个 DiT (https://huggingface.co/papers?q=DiT) 中使用了无参数 (https://huggingface.co/papers?q=parameter-free) RMSNorm (https://huggingface.co/papers?q=RMSNorm) 并配合 Muon 优化器 (https://huggingface.co/papers?q=Muon%20optimizer)。所得到的统一模型能够生成高度逼真的图像,同时准确遵循细粒度的编辑 (https://huggingface.co/papers?q=dit) 指令。我们进一步将 LLaDA-Image 蒸馏为 LLaDA-Image-Turbo (https://huggingface.co/papers?q=LLaDA-Image-Turbo),使其能够在 2-4 个采样步骤内实现快速推理。在 Qwen-Image-Bench 上,LLaDA-Image 在英文和中文轨道上的总分分别为 53.53 和 53.38,在两条轨道上都为开源模型树立了新的最先进水平。为了支持对强大且高效的生成模型的进一步研究,我们发布了模型权重、训练代码和详细的配方。
查看 arXiv 页面 (https://arxiv.org/abs/2609.03796) 查看 PDF (https://arxiv.org/pdf/2609.03796) 项目页面 (https://github.com/inclusionAI/LLaDA-Image) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.03796)
将此论文添加到您的代理中:
hf papers read 2609\.03796
没有最新的 CLI? curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 4
inclusionAI/LLaDA-Image-Turbo 文本到图像• 7B• 更新于约 2 小时前 • 2 • 3 (https://huggingface.co/inclusionAI/LLaDA-Image-Turbo)
inclusionAI/LLaDA-Image 文本到图像• 7B• 更新于约 2 小时前 • 5 • 2 (https://huggingface.co/inclusionAI/LLaDA-Image)
inclusionAI/LLaDA-Image-Turbo-FP8 文本到图像• 7B• 更新于约 2 小时前 • 2 (https://huggingface.co/inclusionAI/LLaDA-Image-Turbo-FP8)
inclusionAI/LLaDA-Image-FP8 文本到图像• 7B• 更新于约 2 小时前 • 1 (https://huggingface.co/inclusionAI/LLaDA-Image-FP8)
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.03796 以从本页链接它。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.03796 以从本页链接它。
包含此论文的收藏夹 1
相似文章
LLaDA2.X (GitHub 仓库)
蚂蚁集团发布LLaDA2.X系列扩散语言模型,扩展至千亿参数,采用MoE架构,开源模型权重和训练代码。
LLaDA2.0-Uni:用扩散大语言模型统一多模态理解与生成
LLaDA2.0-Uni 在单一扩散式大语言模型架构内统一了多模态理解与生成。
DALL·E: 根据文本创建图像
OpenAI 推出 DALL·E,一个具有 120 亿参数的 Transformer 模型,它将文本和图像视为单一令牌流来根据文本描述生成图像。该模型展示了多种功能,包括创建拟人化物体、组合不同的概念、呈现文本和执行图像修复任务。
HiDream-ai/HiDream-O1-Image-Dev
HiDream-ai 发布了 HiDream-O1-Image-Dev,这是一个拥有 80 亿参数的开源图像生成模型,采用像素级统一 Transformer 架构,无需外部 VAE。该模型在 Artificial Analysis Text to Image Arena 排行榜中位列第 8,支持高达 2,048x2,048 的超高分辨率图像生成。
最强本地AI图像生成器来了!
Ernie Image,全新开源扩散模型,文字渲染与提示词忠实度全面超越Zage,可在ComfyUI本地运行,仅需约20 GB显存。