文本到图像模型对文本编码器的依赖比你想象的要少
摘要
本文证明,文本到图像的扩散Transformer模型主要依赖文本编码器中的标记合并和词序,而非完整的上下文嵌入,表明图像模型本身能够解码复杂的语言结构。
查看缓存全文
缓存时间: 2026/06/09 08:40
论文页面 - 文本到图像模型对文本编码器的需求比想象中更少
来源:https://huggingface.co/papers/2606.03715 发表于 6月2日
·
由https://huggingface.co/cohennoa 提交
Noa (https://huggingface.co/cohennoa) 于6月9日
摘要
文本到图像模型主要利用文本表示中的基础方面,如词合并与顺序,而非完整文本嵌入中编码的复杂上下文信息。
文本到图像模型 (https://huggingface.co/papers?q=Text-to-image%20models) 依赖文本提示作为与人类意图交互的主要接口。提示由文本编码器 (https://huggingface.co/papers?q=text%20encoder) 编码为嵌入,用于条件化图像生成过程。除了单个词的含义之外,文本嵌入 (https://huggingface.co/papers?q=text%20embeddings) 还编码了整个提示中的上下文信息,例如组合性和属性绑定。然而,图像模型是否真正利用了这些更丰富的信息仍未被充分探索。在此,我们探讨的问题是:文本表示的哪些方面对图像生成至关重要?我们发现,基于扩散变压器的文本到图像模型 (https://huggingface.co/papers?q=diffusion%20transformer-based%20models) 通常只依赖文本表示中两个相对直接的方面:(i) 将相邻token合并为词表示(针对跨多个token的词),以及 (ii) 词序,这是通过文本编码器的位置嵌入 (https://huggingface.co/papers?q=positional%20embedding) 印刻下来的。为了证明这一点,我们构建了一种新的文本嵌入,它仅编码单个词的含义和顺序,但缺乏关于整个提示的任何上下文信息。我们发现,这种“位置标记词袋” (https://huggingface.co/papers?q=bag%20of%20position-tagged%20words) 表示足以成功引导图像生成,在视觉质量 (https://huggingface.co/papers?q=visual%20quality) 和文本忠实度 (https://huggingface.co/papers?q=text%20fidelity) 方面与完整文本嵌入引导的生成相当。这表明,与普遍看法相反,文本到图像模型 (https://huggingface.co/papers?q=text-to-image%20models) 通常并不使用文本嵌入中除了单个词含义和词序之外的丰富信息。相反,复杂语言结构的解码是由图像模型自身完成的。项目页面:https://nsping13.github.io/contextless-TTI/
查看 arXiv 页面 (https://arxiv.org/abs/2606.03715) 查看 PDF (https://arxiv.org/pdf/2606.03715) 项目页面 (https://nsping13.github.io/contextless-TTI/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.03715)
在你的agent中获取此论文:
hf papers read 2606.03715
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.03715 即可从此页面链接。
引用该论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.03715 即可从此页面链接。
引用该论文的Spaces 0
没有Space链接此论文
在Space README.md 中引用 arxiv.org/abs/2606.03715 即可从此页面链接。
包含该论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
@xichen_pan: 现代文本到图像模型越来越多地依赖大型预训练LLM。但存在一个有趣的不匹配:LLM…
RepFusion提出了一种方法,在扩散Transformer中将预训练多模态LLM用作噪声表示编码器,用于文本到图像生成,在相似计算量下超越基线。
像素空间文本到图像扩散模型的训练实证研究
本文针对像素空间文本到图像扩散模型提出了一种从潜在空间到像素空间的训练策略,加速了收敛并提高了推理速度,同时性能与潜在空间模型相当或更优。
随流而动:文本到图像模型中文本词元间的信息流动
本文研究了文本到图像模型中语义信息在文本词元间的分布情况,发现信息集中程度和跨条目交互显著影响图像生成的语义对齐。作者采用修补技术证明,在编码阶段进行简单干预即可提升对齐质量。
i1:一个简单且完全开放的强文本到图像模型配方
本文介绍了i1,一个3B参数的文本到图像扩散模型,在性能上与领先的闭源模型竞争,同时完全开放(权重、数据、代码)。它提供了来自300多项控制实验的见解,并为开放研究提供了实用配方。
简单变换在文本嵌入模型间的迁移能力有多强?
这篇arXiv论文研究了简单的线性变换是否能在九个异构文本嵌入模型之间转换表示,发现共享结构和可迁移性共同取决于架构、训练目标、池化方法和数据分布,对普遍潜在兼容性的观念提出了挑战。