随流而动:文本到图像模型中文本词元间的信息流动

arXiv cs.CL 论文

摘要

本文研究了文本到图像模型中语义信息在文本词元间的分布情况,发现信息集中程度和跨条目交互显著影响图像生成的语义对齐。作者采用修补技术证明,在编码阶段进行简单干预即可提升对齐质量。

arXiv:2504.01137v3 公告类型:replace 摘要:文本到图像生成模型存在语义对齐问题,即生成的图像未能准确捕捉文本提示中的对象和关系。先前的工作集中在通过改进扩散过程来提高对齐度,而忽略了引导扩散的文本编码器的作用。在这项工作中,我们研究了语义信息如何在文本到图像提示的词元表示中分布,并从两个层面进行分析:(1) 条目内表示——单个词元是否代表其词汇条目(即表达单个概念的词或短语),(2) 跨条目交互——不同词汇条目的词元之间是否有信息流动。我们使用修补技术来揭示编码模式,发现信息通常只集中在条目的一个或两个词元上;例如,在条目“San Francisco's Golden Gate Bridge”中,词元“Gate”足以捕捉整个表达,而其他词元实际上可以被丢弃。词汇条目也倾向于保持孤立;例如,在提示“a green dog”中,词元“dog”没有编码关于“green”的视觉信息。然而,在某些情况下,条目确实会相互影响对方的表示,常常导致误解——例如,在提示“a pool by a table”中,词元“pool”在上下文化后表示“pool table”。我们的发现突显了词元级编码在图像生成中的关键作用,并证明编码阶段的简单干预可以显著提升对齐度和生成质量。
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:31

# 跟随流动:文本到图像模型中文本令牌间的信息流动 来源:https://arxiv.org/html/2504.01137 Guy Kaplan¹, Michael Toker²¹¹¹footnotemark:1, Yuval Reif¹, Yonatan Belinkov²,³, Roy Schwartz¹ ¹耶路撒冷希伯来大学 \{guy.kaplan3,yuval.reif,roy.schwartz1\}@mail.huji.ac.il ²以色列理工学院 – 以色列理工学院 [email protected],[email protected] ³哈佛大学肯普纳研究所 ###### 摘要 文本到图像生成模型存在对齐问题,生成的图像无法准确捕捉文本提示中的物体和关系。以往的工作侧重于通过改进扩散过程来提高对齐度,而忽略了引导扩散的文本编码器的作用。在这项工作中,我们研究了语义信息如何在文本到图像提示的令牌表示中分布,从两个层面进行分析:(1) *项目内表示*——单个令牌是否代表其词汇项(即,传达单一概念的词或表达),以及 (2) *跨项目交互*——信息是否在不同词汇项的令牌之间流动。我们使用补丁技术来揭示编码模式,并发现信息通常只集中在一两个项目的令牌中;例如,在项目“San Francisco’s Golden Gate Bridge”中,令牌“Gate”足以捕捉整个表达,而其他令牌实际上可以丢弃。词汇项也倾向于保持孤立;例如,在提示“a green dog”中,令牌“dog”不编码关于“green”的视觉信息。然而,在某些情况下,项目确实会影响彼此的表示,常常导致误解——例如,在提示“a pool by a table”中,令牌“pool”在上下文化后表示一个“pool table”。我们的发现强调了令牌级编码在图像生成中的关键作用,并表明编码阶段的简单干预可以显著改善对齐度和生成质量。¹¹¹项目仓库:https://github.com/tokeron/lens 跟随流动:文本到图像模型中文本令牌间的信息流动 Guy Kaplan¹††感谢:同等贡献。, Michael Toker²¹¹footnotemark:1, Yuval Reif¹, Yonatan Belinkov²,³, Roy Schwartz¹ ¹耶路撒冷希伯来大学\{guy.kaplan3,yuval.reif,roy.schwartz1\}@mail.huji.ac.il ²以色列理工学院 – 以色列理工学院[email protected],[email protected] ³哈佛大学肯普纳研究所 见图1:我们的主要发现。左:当基于单个输入令牌生成图像时,我们发现词汇项内的信息在其令牌的上下文化表示中分布不均。在这个例子中,一个令牌承载了整个项的含义(例如,lic代表鹈鹕,而pe和an不)。右:上下文项可能会扭曲令牌的编码,导致生成图像中出现不对齐的解释。顶部:来自完整提示“apoolby atable”(不对齐)和“apoolby achair”(对齐)的生成。底部:来自单独上下文化令牌pool的生成。使用table时,pool编码为台球桌;使用chair时,它保留了预期的游泳池含义。## 1 引言 文本到图像(T2I)模型通常由两个主要组件组成:一个文本编码器和一个扩散模型(Ho等人,2020 (https://arxiv.org/html/2504.01137#bib.bib49);Song and Ermon,2019 (https://arxiv.org/html/2504.01137#bib.bib50))。前者处理用户的提示,将其转换为一个表示,引导后者生成图像。尽管被广泛使用,T2I模型经常表现出提示-图像不对齐,即生成的图像未能捕捉用户提示中的关键概念(Chefer等人,2023a (https://arxiv.org/html/2504.01137#bib.bib28);Rassin等人,2022 (https://arxiv.org/html/2504.01137#bib.bib27);Huang等人,2023a (https://arxiv.org/html/2504.01137#bib.bib5))。先前的工作尝试通过修改扩散阶段,特别是交叉注意力机制来解决这些问题(Rassin等人,2023 (https://arxiv.org/html/2504.01137#bib.bib29);Chefer等人,2023a (https://arxiv.org/html/2504.01137#bib.bib28);Dahary等人,2024 (https://arxiv.org/html/2504.01137#bib.bib51)),其隐含假设是每个文本令牌都可靠地编码了它旨在传达的项。这引出了关于文本编码的两个基本问题:(1)词汇项的含义是均匀分布在其所有令牌中,还是集中在一两个令牌中?(2)每个令牌是否只编码其自己的词汇项,还是也可能吸收来自周围项的信息?在这项工作中,我们通过研究信息在文本编码阶段之后如何在令牌之间分布来考察这些问题。我们聚焦于*词汇项*——传达单一含义的词或短语,如“pelican”或“golden gate bridge”。我们追踪项信息是如何在单个项的令牌*内部*(*项目内*)以及不同项的令牌*之间*(*跨项目*)分布的,对两种分析使用相同的因果框架。²²²见图1 (https://arxiv.org/html/2504.01137#S0.F1)了解不同情况的示例。为此,我们使用一个因果干预框架(Toker等人,2025 (https://arxiv.org/html/2504.01137#bib.bib3)),该框架评估编码器输出处每个上下文令牌表示中编码的信息(2 (https://arxiv.org/html/2504.01137#S2))。³³³在整个工作中,我们研究文本编码器输出处的令牌表示。为简洁起见,我们有时省略“表示”一词。然后我们在来自广泛使用的T2I基准测试的提示上评估这个框架(3 (https://arxiv.org/html/2504.01137#S3))。对于*项目内*表示(4 (https://arxiv.org/html/2504.01137#S4)),我们发现词汇项的含义通常集中在一两个*代表性令牌*中(单独足以传达完整项的令牌,例如,图1 (https://arxiv.org/html/2504.01137#S0.F1)中“pelican”的“lic”)。令人惊讶的是,消融非代表性令牌不仅不会损害性能,反而将对齐度相对提高了21%。我们进一步表明,可以在不生成图像的情况下有效识别代表性令牌,为直接在T2I管道中裁剪非代表性令牌打开了大门。对于*跨项目*交互(5 (https://arxiv.org/html/2504.01137#S5)),我们应用相同的框架来询问信息是否在提示中的不同词汇项之间流动。我们在11%的情况下观察到跨项目流动。有趣的是,这种流动并不总是遵循句法结构,并且可能导致错误的项解析——尤其是对于多义词。例如,在提示“apoolby atable”中,pool可能错误地暗示table指的是台球桌,这是*语义泄漏*的一个实例(Rassin等人,2022 (https://arxiv.org/html/2504.01137#bib.bib27))。总的来说,我们的分析表明,令牌级编码通常是集中的、很大程度上项孤立的,但在多义词等情况下容易受到*语义泄漏*的影响,从而导致误解。在我们的实验中,我们还展示了用于改善对齐度的简单干预措施,强调了进一步研究文本编码器在T2I中的作用的重要性。 ## 2 方法论 我们提出了一种通过从任意令牌子集生成图像同时屏蔽其他令牌来进行因果干预的方法。⁴⁴⁴虽然令牌在整个编码过程中相互作用,但它们的最终表示可以孤立地检查。这使我们能够可视化每个令牌——在编码步骤之后——如何贡献于扩散过程。我们用其来分析两种现象:(1)信息如何在单个词汇项内的令牌之间分布(4 (https://arxiv.org/html/2504.01137#S4)),以及(2)不同的词汇项如何相互影响(5 (https://arxiv.org/html/2504.01137#S5))。 见图2:评估项目内信息流动。我们提出的框架解释词汇项内的信息流动。我们从构成词汇项的每个令牌生成图像(左)并使用VLM(右)分析它们。在这个例子中,只有令牌lic代表概念“鹈鹕”,而pe和an不。我们的方法建立在Toker等人 (2025 (https://arxiv.org/html/2504.01137#bib.bib3)) 提出的框架之上。给定一个包含N个令牌 t₁, t₂, ..., tN 的提示,我们的目标是隔离并解释这些令牌的一个子集所编码的信息。设 S ⊂ {1, ..., N} 是给定子集的索引,其中 0 < |S| ... ## 附录 A.2 评估生成图像 我们使用一个视觉语言模型(VLM)来评估生成的图像。具体来说,我们使用GPT-4o(OpenAI等人,2024 (https://arxiv.org/html/2504.01137#bib.bib15))并采用以下提示:> “在 Yes, No 和 Maybe 中。每张图像是否匹配以下描述之一:(描述字符串)?如果所有图像都匹配或关联到至少一个描述,则回答 Yes;如果只有部分匹配,则回答 Maybe;否则回答 No。”这里,*文本描述*可以是单个词汇项或完整的文本提示。 ### A.3 评估生成的文本描述 我们使用GPT-4o(OpenAI等人,2024 (https://arxiv.org/html/2504.01137#bib.bib15))来评估 Patchscopes 产生的文本解释。我们使用以下提示:> “在 Yes, No 和 Maybe 中。每张图像是否匹配描述:\{Patchscopes\_description\}?如果所有图像都匹配或关联到该描述,则回答 Yes;如果只有部分匹配,则回答 Maybe;否则回答 No。” ### A.4 评估项之间的关系 我们通过区分表现出语义泄漏的两个词汇项在感知上是否绑定在一起(例如,提示“a portrait of an old man”中的“old”和“man”)以及它们是否未绑定(例如,提示“A person wearing a cone hat is eating”中的“cone hat”和“eating”)(见图5 (https://arxiv.org/html/2504.01137#S5.F5))来增强我们的泄漏验证。为此,我们使用一个大语言模型(LLM)作为判断者。具体来说,我们使用 GPT-4o 并采用以下提示:> “用 Yes 或 No 回答:在这个提示中:\{input\_prompt\},\{item\_1\} 和 \{item\_2\} 在感知上绑定在一起吗?”然后我们过滤掉所有词汇项在感知上绑定在一起的情况,发现只有 6.5% 的实例表现出非预期的泄漏。 ### A.5 预期项评估 对于每个词汇项,我们手动创建两个解释——一个来自提示的预期解释,另一个是该词在其他上下文中可能的错误解释。例如,给定提示“A standing zebra to the right of a city bus station”,正确解释是“动物斑马”,而错误解释是“斑马线”。然后我们要求一个 VLM 评估生成的图像,并判断图像中是否存在第一种还是后一种解释。为了评估模型上下文中消歧的能力,我们为每个提示中的每个词汇项手动定义两个解释。第一个是从提示上下文中推导出的预期语义含义,第二个是另一种解释,在该上下文中是错误的。例如,在提示“A standing zebra to the right of a city bus station”中,“zebra”的预期含义是“动物”,而错误的解释是“斑马线”。随后,一个 VLM 分析生成的图像,以确定它是否描绘了我们定义的预期解释或错误解释。 ### A.6 资源 我们的计算实验涉及四个不同的文本到图像模型的推理:Flux-dev、Flux-schnell、sdxl-turbo 和 Sana。这些模型的参数大小大约为:Flux-dev 和 Flux-schnell 约 120 亿,sdxl-turbo 约 31 亿,Sana 模型范围在 0.6 到 48 亿之间,我们的实验使用了 16 亿参数的版本。这些实验的总计算预算估计约为 480 GPU 小时。计算基础设施由一个包含八张 NVIDIA A100 GPU 的集群组成。这种配置为执行的大量推理任务提供了必要的计算能力。 ### A.7 AI 助手的使用 我们使用 AI 助手来支持这项研究。对于编码实验,我们使用了微软的 Copilot 和 Anthropic 的 Claude 3;所有生成的代码都由我们手动审查和验证,以确保其符合我们的要求。对于论文,谷歌的 Gemini 模型(Pro 和 Flash)被用于改进写作和清晰度。我们仔细审查了所有内容,以确保其准确反映了我们的意图。 ## 附录 B 数据 DrawBench(Saharia等人,2022 (https://arxiv.org/html/2504.01137#bib.bib18)):我们包括除“拼写错误”、“罕见词”和“文本”之外的所有类别。总体上,我们从 DrawBench 中提取了 134 个提示。总共,我们获得了 1,053 个提示。 #### 泄漏提示的扩展数据集。我们的扩充过程包含两个组成部分。首先,我们从 Rassin 等人 (2022 (https://arxiv.org/html/2504.01137#bib.bib27)) 生成现有提示的变体(例如,将“a gentleman with a bow in the forest”修改为“a man wearing a bow in the jungle”)。其次,我们引入具有潜在语义泄漏的新提示。对于这些提示,我们应用一个单词汇项改变测试,通过从类似提示生成图像,该提示将受影响或泄漏的项替换为替代术语(例如,在“chess in ‘2 bishops playing chess’”中将“bishops”替换为“cardinals”或“checkers”)。这个测试确保了最小的词汇修改不会改变预期的语义含义,但同时由于提示中另一项的语义泄漏而产生不同的图像(参见图 8 (https://arxiv.org/html/2504.01137#A2.F8) 的前两列的一些视觉示例)。总之,这些方法丰富了数据集,并为分析语义泄漏提供了一个健壮的框架。完整的提示列表可在我们的 Git 仓库中找到。⁸⁸⁸https://github.com/tokeron/lens 见图8:我们语义泄漏方法的示例。左:泄漏包含提示的标准生成。第二:使用单词汇项改变测试作为数据集创建的一部分(一个最小替换,以验证一个微小的词汇变化会产生不同的图像)。第三:来自上下文表示(被误解的项)的图像。第四:来自非上下文表示(正确解释)的图像。右:将正确的、非上下文的表示修补到提示后的最终生成。 ## 附录 C 额外模型 ### C.1 FLUX-Dev 除了我们对 FLUX 的主要实验外,我们还使用 Flux-dev 变体重复了所有分析。冗余与代表性令牌实验显示出相似的趋势,55% 的令牌被识别为代表,45% 为非代表——这些值与使用 FLUX 观察到的值非常接近。同样,我们的项目间流动实验证实信息流动出现在 11% 的情况下(以及 3.1% 错过预期泄漏),强化了正文中报告的整体模式。值得注意的是,虽然总体趋势在模型之间是一致的,但被解析的特定词汇项在 FLUX-schnell 和 Flux-dev 之间可能不同,表明可能存在略微不同的内部词汇 (Kaplan 等人,2025 (https://arxiv.org/html/2504.01137#bib.bib8))。这些发现强调了我们方法的健壮性,同时指出了令牌表示和信息流动态中依赖于模型的细微差别。 ### C.2 SDXL-Turbo 见图9:在 SDXL-Turbo 中从单个子令牌生成的图像。我们发现,在许多情况下,某个项的表示在其任何子令牌中都没有清楚地反映出——例如,在 case

相似文章

Flow-OPD:用于流匹配模型的对策蒸馏

Hugging Face Daily Papers

Flow-OPD 是一篇研究论文,介绍了一种用于流匹配文生图模型的两阶段对策蒸馏框架。基于 Stable Diffusion 3.5 Medium,该框架显著提升了生成质量和对齐指标。