文本到图像模型对文本编码器的依赖比你想象的要少

Hugging Face Daily Papers 论文

摘要

本文证明,文本到图像的扩散Transformer模型主要依赖文本编码器中的标记合并和词序,而非完整的上下文嵌入,表明图像模型本身能够解码复杂的语言结构。

文本到图像模型依赖文本提示作为与人类意图交互的主要界面。提示由文本编码器编码成嵌入,以条件化图像生成过程。除了单个标记的含义外,文本嵌入还编码了整个提示的上下文信息,例如组合性和属性绑定。然而,图像模型是否真正利用了这些更丰富的信息尚未得到充分研究。在此,我们探讨一个问题:文本表示的哪些方面对图像生成至关重要?我们表明,基于扩散Transformer的文本到图像模型通常仅依赖文本表示的两个相对简单的方面:(i) 相邻标记合并为词表示(对于跨越多个标记的词),以及 (ii) 词序,该词序由文本编码器的位置嵌入印记。为了证明这一点,我们构建了一个新的文本嵌入,它仅编码单个词的含义和顺序,但缺乏关于整个提示的任何上下文信息。我们发现,这种带有位置标签的词袋表示足以成功引导图像生成,其视觉质量和文本保真度与完整文本嵌入引导的生成相当。这表明,与普遍看法相反,文本到图像模型通常不使用文本嵌入中编码的丰富信息,仅依靠单个词的含义和词序。相反,复杂语言结构的解码是由图像模型本身完成的。项目网页:https://nsping13.github.io/contextless-TTI/
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:40

论文页面 - 文本到图像模型对文本编码器的需求比想象中更少

来源:https://huggingface.co/papers/2606.03715 发表于 6月2日

·

由https://huggingface.co/cohennoa 提交

Noa (https://huggingface.co/cohennoa) 于6月9日

摘要

文本到图像模型主要利用文本表示中的基础方面,如词合并与顺序,而非完整文本嵌入中编码的复杂上下文信息。

文本到图像模型 (https://huggingface.co/papers?q=Text-to-image%20models) 依赖文本提示作为与人类意图交互的主要接口。提示由文本编码器 (https://huggingface.co/papers?q=text%20encoder) 编码为嵌入,用于条件化图像生成过程。除了单个词的含义之外,文本嵌入 (https://huggingface.co/papers?q=text%20embeddings) 还编码了整个提示中的上下文信息,例如组合性和属性绑定。然而,图像模型是否真正利用了这些更丰富的信息仍未被充分探索。在此,我们探讨的问题是:文本表示的哪些方面对图像生成至关重要?我们发现,基于扩散变压器的文本到图像模型 (https://huggingface.co/papers?q=diffusion%20transformer-based%20models) 通常只依赖文本表示中两个相对直接的方面:(i) 将相邻token合并为词表示(针对跨多个token的词),以及 (ii) 词序,这是通过文本编码器的位置嵌入 (https://huggingface.co/papers?q=positional%20embedding) 印刻下来的。为了证明这一点,我们构建了一种新的文本嵌入,它仅编码单个词的含义和顺序,但缺乏关于整个提示的任何上下文信息。我们发现,这种“位置标记词袋” (https://huggingface.co/papers?q=bag%20of%20position-tagged%20words) 表示足以成功引导图像生成,在视觉质量 (https://huggingface.co/papers?q=visual%20quality) 和文本忠实度 (https://huggingface.co/papers?q=text%20fidelity) 方面与完整文本嵌入引导的生成相当。这表明,与普遍看法相反,文本到图像模型 (https://huggingface.co/papers?q=text-to-image%20models) 通常并不使用文本嵌入中除了单个词含义和词序之外的丰富信息。相反,复杂语言结构的解码是由图像模型自身完成的。项目页面:https://nsping13.github.io/contextless-TTI/

查看 arXiv 页面 (https://arxiv.org/abs/2606.03715) 查看 PDF (https://arxiv.org/pdf/2606.03715) 项目页面 (https://nsping13.github.io/contextless-TTI/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.03715)

在你的agent中获取此论文:

hf papers read 2606.03715

没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用该论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.03715 即可从此页面链接。

引用该论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.03715 即可从此页面链接。

引用该论文的Spaces 0

没有Space链接此论文

在Space README.md 中引用 arxiv.org/abs/2606.03715 即可从此页面链接。

包含该论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

随流而动:文本到图像模型中文本词元间的信息流动

arXiv cs.CL

本文研究了文本到图像模型中语义信息在文本词元间的分布情况,发现信息集中程度和跨条目交互显著影响图像生成的语义对齐。作者采用修补技术证明,在编码阶段进行简单干预即可提升对齐质量。

i1:一个简单且完全开放的强文本到图像模型配方

Hugging Face Daily Papers

本文介绍了i1,一个3B参数的文本到图像扩散模型,在性能上与领先的闭源模型竞争,同时完全开放(权重、数据、代码)。它提供了来自300多项控制实验的见解,并为开放研究提供了实用配方。

简单变换在文本嵌入模型间的迁移能力有多强?

arXiv cs.LG

这篇arXiv论文研究了简单的线性变换是否能在九个异构文本嵌入模型之间转换表示,发现共享结构和可迁移性共同取决于架构、训练目标、池化方法和数据分布,对普遍潜在兼容性的观念提出了挑战。