DALL·E: 根据文本创建图像

OpenAI Blog 模型

摘要

OpenAI 推出 DALL·E,一个具有 120 亿参数的 Transformer 模型,它将文本和图像视为单一令牌流来根据文本描述生成图像。该模型展示了多种功能,包括创建拟人化物体、组合不同的概念、呈现文本和执行图像修复任务。

我们训练了一个名为 DALL·E 的神经网络,它可以根据自然语言表达的各种概念的文本描述来创建图像。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:46

# DALL·E:从文本生成图像 来源:https://openai.com/index/dall-e/ 我们训练了一个名叫 DALL·E 的神经网络,它能根据文本描述为各种自然语言可表达的概念生成图像。 DALL·E 是 GPT‐3 的 120 亿参数版本(https://arxiv.org/abs/2005.14165),经过训练可以根据文本描述生成图像,使用的数据集包含文本-图像对。我们发现它具有多种多样的功能,包括创建动物和物体的拟人化版本、以合理的方式组合不相关的概念、渲染文字以及对现有图像进行变换。 *另见:* [*DALL·E 2*](https://openai.com/index/dall-e-2/)(*生成更逼真、更精确的图像,分辨率提高 4 倍*) GPT‐3 表明可以使用语言指导大型神经网络执行各种文本生成任务。[Image GPT](https://openai.com/index/image-gpt/) 表明同类型的神经网络也可以用于生成高保真图像。我们扩展了这些发现,证明现在已经可以通过语言来操纵视觉概念。 与 GPT‐3 一样,DALL·E 是一个 transformer 语言模型。它将文本和图像作为单个数据流接收,包含最多 1280 个 token,并使用最大似然法训练来逐个生成所有 token。 这个训练过程不仅允许 DALL·E 从头开始生成图像,还能够重新生成现有图像中任何延伸到右下角的矩形区域,使其与文本提示相一致。 我们认识到涉及生成模型的工作可能对社会产生重大、广泛的影响。未来,我们计划分析像 DALL·E 这样的模型与经济对某些工作流程和职业的影响、模型输出中的潜在偏见以及这项技术所带来的更长期伦理挑战等社会问题的关系。 我们发现 DALL·E 能够为各种探索语言组合结构的句子生成合理的图像。在下一部分,我们使用一系列交互式可视化来展示这一点。每个描述文本的样本是通过从使用 [CLIP](https://openai.com/index/clip/) 重新排序后的 512 个样本中取得前 32 个而得到的,但除了缩略图和独立显示的图像外,我们没有进行任何手工精选。 我们测试 DALL·E 修改对象的多个属性以及它出现次数的能力。 同时控制多个物体、它们的属性和空间关系提出了新的挑战。例如,考虑短语"一只戴红帽子、黄手套、蓝衬衫和绿裤子的刺猬"。要正确解释这个句子,DALL·E 不仅必须正确地将每件服装与动物组合,还要形成关联(帽子,红色)、(手套,黄色)、(衬衫,蓝色)和(裤子,绿色),而不混淆它们。 我们测试 DALL·E 在相对位置、堆叠物体和控制多个属性方面的能力。 尽管 DALL·E 确实对少量物体的属性和位置提供了某种程度的可控性,但成功率可能取决于描述的措辞方式。随着引入更多物体,DALL·E 容易混淆物体与其颜色之间的关联,成功率会急剧下降。我们还注意到,DALL·E 在这些场景中对于描述的重新表述很脆弱:在语义上等效的替代描述通常会产生错误的解释。 我们发现 DALL·E 也允许控制场景的视角和场景渲染的 3D 风格。 为了进一步推进这一点,我们测试了 DALL·E 能够从一系列等距角度重复绘制一个著名人物头部的能力,并发现我们可以恢复旋转头部的平滑动画。 DALL·E 似乎能够对场景应用某些类型的光学失真,如"鱼眼镜头视图"和"球形全景"选项所示。这促使我们探索它生成反射的能力。 "极端特写视图"和"X 光"风格的样本促使我们进一步探索 DALL·E 用截面图渲染内部结构以及用微距摄影渲染外部结构的能力。 从文本到图像的转换任务是未充分指定的:单个描述通常对应于无穷多个合理的图像,因此图像不是唯一确定的。例如,考虑描述"一只水豚坐在日出时田野中的画"。根据水豚的方向,可能需要绘制阴影,尽管这个细节从未明确提及。我们探索 DALL·E 解决三种情况下欠指定的能力:改变风格、设置和时间;在各种不同的情况下绘制相同的物体;以及生成具有特定文本写在其上的物体图像。 在不同程度的可靠性下,DALL·E 通过自然语言提供了对 3D 渲染引擎功能子集的访问。它可以独立控制少量物体的属性,在有限的范围内可以控制数量以及它们如何相互排列。它还可以控制渲染场景的位置和角度,并且可以根据角度和光照条件的精确规格生成已知物体。 与 3D 渲染引擎不同(其输入必须明确指定并完整详细),DALL·E 通常能够在描述暗示图像必须包含未明确陈述的某个细节时"填空"。 接下来,我们探索前面功能在时装和室内设计中的应用。 语言的组合性质使我们能够将概念组合在一起,以描述真实和虚构的事物。我们发现 DALL·E 也能够组合不相关的想法来合成物体,其中一些在现实世界中不太可能存在。我们在两个例子中探索这种能力:从各种概念向动物转移特质,以及通过从不相关的概念获取灵感来设计产品。 在前一部分中,我们探索了 DALL·E 在生成真实物体图像时组合不相关概念的能力。在这里,我们在艺术背景下探索这种能力,包括三种插图:动物和物体的拟人化版本、动物嵌合体和表情符号。 GPT‐3 可以仅从描述和提示中生成答案的提示被指示执行多种任务,无需任何额外培训。例如,当提示短语"以下是句子'a person walking his dog in the park'翻译成法语"时,GPT‐3 回答"un homme qui promène son chien dans le parc"。这种能力被称为*零样本推理*。我们发现 DALL·E 将这种能力扩展到视觉领域,当以正确的方式提示时,能够执行多种图像到图像的转换任务。 我们没有预料到这种能力会出现,也没有对神经网络或训练程序进行任何修改来促进它。受这些结果的启发,我们通过在 Raven 渐进矩阵上测试 DALL·E 来衡量它在类比推理问题上的能力,这是一个在 20 世纪广泛使用的视觉智商测试。 我们发现 DALL·E 已经学到了地理事实、地标和社区知识。它对这些概念的了解在某些方面惊人地精确,在其他方面则有缺陷。 除了探索随空间变化的概念知识外,我们还探索了它对随时间变化的概念的了解。 DALL·E 是一个简单的仅解码器 transformer,它将文本和图像作为包含最多 1280 个 token(文本 256 个,图像 1024 个)的单个流接收,并对所有 token 进行自回归建模。其 64 个自注意力层中每一层的注意力掩码允许每个图像 token 关注所有文本 token。DALL·E 为文本 token 使用标准因果掩码,为图像 token 使用稀疏注意力,具体为行、列或卷积注意力模式,具体取决于层。我们在[论文](https://arxiv.org/abs/2102.12092)中提供了有关架构和训练程序的更多详细信息。 文本到图像的合成自 Reed 等人的开创性工作(https://openai.com/index/dall-e/#citation-bottom-1)以来一直是一个活跃的研究领域,其方法使用以文本嵌入为条件的 GAN。嵌入由使用对比损失预训练的编码器生成,类似于 CLIP。[StackGAN](https://openai.com/index/dall-e/#citation-bottom-3) 和 [StackGAN++](https://openai.com/index/dall-e/#citation-bottom-4) 使用多尺度 GAN 来提高图像分辨率和改进视觉保真度。[AttnGAN](https://openai.com/index/dall-e/#citation-bottom-5) 在文本和图像特征之间融入了注意力,并提出了对比文本-图像特征匹配损失作为辅助目标。这与我们离线使用 CLIP 进行的重新排序进行对比很有趣。其他工作在训练期间融入了额外的监督源以改进图像质量。最后,Nguyen 等人和 Cho 等人的工作探索了利用预训练多模态判别模型的基于采样的图像生成策略。 与 [VQVAE‐2](https://arxiv.org/abs/1906.00446) 中使用的拒绝采样类似,我们使用 [CLIP](https://openai.com/index/clip/) 为所有交互式可视化中的每个描述从 512 个样本中重新排序前 32 个。这个过程也可以看作是一种语言引导搜索,对样本质量有显著影响。

相似文章

DALL·E API 现已推出公开测试版

OpenAI Blog

OpenAI 宣布 DALL·E API 现已推出公开测试版,允许开发者直接将图像生成功能集成到他们的应用中。早期采用者包括 Microsoft、CALA 和 Mixtiles,具备内置安全功能和内容审核。

DALL·E 现已无需等候名单

OpenAI Blog

OpenAI 移除了 DALL·E 测试版的等候名单,使这款文本生成图像工具立即可供所有用户使用。该公告显示有 150 万+ 活跃用户每日创建 200 万+ 张图像,并计划向开发者扩展 DALL·E API 访问权限。

DALL·E: 推出外扩绘画功能

OpenAI Blog

OpenAI 为 DALL·E 推出外扩绘画功能,使用户能够扩展生成或上传的图像,创建任意宽高比的大规模图像,同时保持阴影、反射和纹理的视觉一致性。

DALL·E 2:拓展创意可能

OpenAI Blog

OpenAI 强调来自 118 个以上国家的 3000 多位艺术家正在将 DALL·E 2 整合到他们的创意工作流中,展示了从儿童癌症患者的医学插画到博物馆展览和杂志封面等多样化应用。