论多语言文本到图像生成中跨语言一致性的局限性
摘要
本文介绍了LingT2I,这是一个覆盖10种语言、包含33K个提示词的基准,用于评估文本到图像生成中的跨语言一致性,揭示了内容生成和文本渲染方面的语言不平等及语言依赖的权衡。
arXiv:2608.11002v1 公告类型:新
摘要:文本到图像(T2I)生成近年来取得了显著进展。然而,现有研究主要集中在仅英语环境,跨语言性能差距和语言特定影响尚未得到充分探索。为填补这一空白,我们提出了LingT2I,一个覆盖10种广泛使用语言、包含33K个提示词的基准,旨在评估内容生成和文本渲染中的跨语言影响。基于该基准,我们进行了全面的跨语言分析,揭示了评估维度上的语言不平等和语言依赖的权衡。除定量评估外,我们进一步揭示了一系列语言相关的生成模式,强调语言因素及其对应的文化背景如何系统性地影响模型输出。我们的基准和分析为研究T2I生成中的跨语言行为提供了基础,并促进了更健壮、更具包容性模型的发展。代码和数据集可在 https://github.com/RISys-Lab/LingT2I 获取。
查看缓存全文
缓存时间: 2026/08/12 08:38
# 论多语言文本到图像生成中跨语言一致性的局限性 来源:https://arxiv.org/html/2608.11002 ## 论多语言文本到图像生成中跨语言一致性的局限性 会议:第34届ACM国际多媒体会议论文集;2026年11月10–14日;巴西里约热内卢 第34届ACM国际多媒体会议论文集(MM '26),2026年11月10–14日,巴西里约热内卢 DOI:10.1145/3767308.3835058(https://doi.org/10.1145/3767308.3835058) ISBN:979-8-4007-2213-4/2026/11 CCS:计算方法论 → 计算机视觉 CCS:计算方法论 → 机器翻译 CCS:通用与参考 → 评估 张思成1,晏仲豪2,谢滨柱3,邱石3,Muzammal Naseer1,4,∗,Naveed Akhtar5,Mubarak Shah6 1哈利法大学,2伦敦玛丽女王大学,3香港中文大学,4西澳大学,5墨尔本大学,6中佛罗里达大学 ∗通讯作者 ,晏仲豪 单位:伦敦玛丽女王大学,伦敦,英国 邮箱:[[email protected]](mailto:[email protected]) 谢滨柱 单位:香港中文大学,香港,中国 邮箱:[[email protected]](mailto:[email protected]) 邱石 单位:香港中文大学,香港,中国 邮箱:[[email protected]](mailto:[email protected]) Muzammal Naseer 注:通讯作者。 单位:哈利法大学,阿布扎比,阿联酋;西澳大学,珀斯,澳大利亚 邮箱:[[email protected]](mailto:[email protected]) Naveed Akhtar 单位:墨尔本大学,墨尔本,澳大利亚 邮箱:[[email protected]](mailto:[email protected]) Mubarak Shah 单位:中佛罗里达大学,佛罗里达,美国 邮箱:[[email protected]](mailto:[email protected]) 2026;© cc ###### 关键词:多语言T2I,跨语言基准,语言公平性 ††cc-license:by-nc-nd ![[未提供说明的图片]](https://arxiv.org/html/2608.11002v1/fig/risys-lab.png) # 论多语言文本到图像生成中跨语言一致性的局限性 Sicheng Zhang1,Zhonghao Yan2,Binzhu Xie3,Shi Qiu3,Muzammal Naseer1,4,∗,Naveed Akhtar5,Mubarak Shah6 1哈利法大学,2伦敦玛丽女王大学,3香港中文大学,4西澳大学,5墨尔本大学,6中佛罗里达大学 ∗通讯作者 文本到图像(T2I)生成近年来取得了显著进展。然而,现有研究主要集中在纯英文场景,跨语言性能差距和语言特定效应尚未得到充分探索。为填补这一空白,我们提出了LingT2I,一个涵盖10种广泛使用语言、包含33K条提示词的基准,旨在评估内容生成和文本渲染中的跨语言效应。在该基准的基础上,我们进行了全面的跨语言分析,揭示了语言不平等以及各评估维度上依赖语言的权衡现象。除了定量评估,我们还进一步揭示了多种依赖语言的生成模式,阐明了语言因素及其相应的文化背景如何系统性影响模型输出。我们的基准和分析为研究T2I生成中的跨语言行为奠定了基础,并有助于开发更稳健、更具包容性的模型。 GitHub:https://github.com/RISys-Lab/LingT2I ![[未提供说明的图片]](https://arxiv.org/html/2608.11002v1/fig/huggingface_logo.png) 数据集:https://huggingface.co/datasets/RISys-Lab/LingT2I 见图注 **图1.** 多语言T2I的挑战。(i) 语言不平等:印地语版本的对象数量不正确;(ii) 文本渲染失败:字母排列错误和字符结构错误;(iii) 跨语言的多维权衡:韩语结果呈现油画风格,与预期的照片风格不一致;(iv) 依赖语言的生成模式:相同的提示词在不同语言下生成具有不同文化特征的纺织品。 ## 1. 引言 语言是人与人工智能之间的主要接口,在塑造多模态生成内容方面起着决定性作用。文本到图像(T2I)模型体现了这一趋势,通过大规模扩散框架在英文场景中取得了显著成功((58 (https://arxiv.org/html/2608.11002#bib.bib38);70 (https://arxiv.org/html/2608.11002#bib.bib23)))。然而,这些进展主要依赖于COCO Captions (9 (https://arxiv.org/html/2608.11002#bib.bib41))和LAION-5B (51 (https://arxiv.org/html/2608.11002#bib.bib21))等以英文为主的数据集,其在多语言场景中的能力在很大程度上未被充分探索。与此同时,多语言NLP研究表明,语言多样性和包容性对于开发公平且具有文化意识的AI至关重要 ((25 (https://arxiv.org/html/2608.11002#bib.bib43);32 (https://arxiv.org/html/2608.11002#bib.bib42))),这凸显了将T2I评估扩展到英文之外的重要性。 多语言T2I生成面临两个基本挑战:生成视觉内容时必须考虑不同语言中蕴含的独特文化属性;文本渲染任务——即生成包含特定文本内容的图像——则需要处理多种书写系统。以往的工作已尝试将T2I模型扩展到多语言场景,或通过引入多语言基础有限的现有编码器 ((29 (https://arxiv.org/html/2608.11002#bib.bib1);64 (https://arxiv.org/html/2608.11002#bib.bib6);47 (https://arxiv.org/html/2608.11002#bib.bib5))),或利用大型生成式LLM来增强提示词理解能力 ((70 (https://arxiv.org/html/2608.11002#bib.bib23);61 (https://arxiv.org/html/2608.11002#bib.bib39)))。然而,现有关于多语言T2I的研究仍然有限 ((50 (https://arxiv.org/html/2608.11002#bib.bib53);18 (https://arxiv.org/html/2608.11002#bib.bib22);67 (https://arxiv.org/html/2608.11002#bib.bib68);23 (https://arxiv.org/html/2608.11002#bib.bib58))),主要关注图像质量,而忽视了语言层面和文本渲染的评估。这引发了一个根本性问题:T2I模型是否真正具备多语言能力?更重要的是,造成跨语言性能差异的因素是什么? 图1 (https://arxiv.org/html/2608.11002#S0.F1) 突出了几个代表性现象:(i) 印地语等低资源语言的提示词性能始终低于高资源语言,反映出明显的*语言不平等*;(ii) 文本渲染任务中非拉丁文字系统常常出现断裂、不可读或幻觉字符,凸显了处理多样书写系统的困难;(iii) 即使语义完全相同的提示词,不同语言在真实性、语义保真度和风格等维度上表现出不同的权衡;这些交互可能表现为联合提升、冲突趋势或折中平衡,凸显了跨语言泛化的不稳定性;(iv) 不同语言下的生成行为具有系统性差异,表明T2I模型不仅受文本语义影响,还受语言特定先验的影响。其成因,包括数据分布、语言形态和书写系统,仍未得到充分探索,这凸显了建立系统性跨语言分析框架的必要性。 为了研究这些挑战,我们提出了LingT2I,一个专门用于分析跨语言效应的基准,涵盖10种广泛使用的语言,并同时评估内容生成和文本渲染任务。这个统一的数据集为大规模分析多语言T2I生成奠定了基础。我们对多种最先进的T2I模型——包括Nano Banana (58 (https://arxiv.org/html/2608.11002#bib.bib38))、Z-Image (62 (https://arxiv.org/html/2608.11002#bib.bib47))和EasyText (35 (https://arxiv.org/html/2608.11002#bib.bib28))——在LingT2I上进行了基准测试,并开展了全面的跨语言分析。我们的结果揭示了三个关键发现:(i) 通用模型表现出严重的语言不平等,性能偏向高资源的印欧语系语言;(ii) 非拉丁书写系统仍是一个主要瓶颈,导致文本渲染出现断裂或不可读的现象;(iii) 语言特定的文化和类型学因素系统性影响生成行为,重塑了各评估维度之间的权衡。这些发现揭示了当前多语言T2I系统的根本局限,并为开发更公平、更具文化包容性的生成模型提供了指导。 我们的**主要贡献**如下: - 我们提出了LingT2I,一个新的数据集,涵盖10种广泛使用的语言,包含33K条提示词,专为分析通用内容生成和文本渲染中的跨语言效应而设计。 - 我们提供了首个全面的跨语言分析,揭示了T2I模型中各维度上的语言不平等和语言特定权衡。 - 我们的分析揭示了多种依赖语言的生成模式,为模型设计提供了有价值的见解。 ## 2. 相关工作 **多语言文本到图像生成。** 近期工作赋予文本到图像模型多语言能力。模型 (53 (https://arxiv.org/html/2608.11002#bib.bib7);19 (https://arxiv.org/html/2608.11002#bib.bib48);71 (https://arxiv.org/html/2608.11002#bib.bib18);7 (https://arxiv.org/html/2608.11002#bib.bib4)) 如SD 3.5 (54 (https://arxiv.org/html/2608.11002#bib.bib2))、FLUX (29 (https://arxiv.org/html/2608.11002#bib.bib1))和Z-Image (62 (https://arxiv.org/html/2608.11002#bib.bib47))采用扩散或扩散Transformer(DiT)架构,其中语言理解主要由预训练文本编码器处理 ((64 (https://arxiv.org/html/2608.11002#bib.bib6);47 (https://arxiv.org/html/2608.11002#bib.bib5);57 (https://arxiv.org/html/2608.11002#bib.bib49)))。近期方法如HunyuanImage-3.0 (61 (https://arxiv.org/html/2608.11002#bib.bib39))、Janus-Pro (8 (https://arxiv.org/html/2608.11002#bib.bib3))和NextStep-1 (59 (https://arxiv.org/html/2608.11002#bib.bib72))直接在自回归Transformer中对文本和图像token进行建模,多语言能力内置于预训练LLM骨干中 ((63 (https://arxiv.org/html/2608.11002#bib.bib50);14 (https://arxiv.org/html/2608.11002#bib.bib51);74 (https://arxiv.org/html/2608.11002#bib.bib73)))。Qwen-Image (70 (https://arxiv.org/html/2608.11002#bib.bib23))和Omni-Diffusion (56 (https://arxiv.org/html/2608.11002#bib.bib74))等先进方法超越了传统流程,通过统一语言和视觉建模,多语言能力源自共享的建模空间和训练数据。为了专门增强多语言能力,一个方向是利用AltDiffusion (75 (https://arxiv.org/html/2608.11002#bib.bib10))与AltCLIP (10 (https://arxiv.org/html/2608.11002#bib.bib8))等强大的多语言编码器;另一个方向侧重于通过轻量适配器实现编码器-生成器对齐(GlueGen (43 (https://arxiv.org/html/2608.11002#bib.bib12))、MuLan (72 (https://arxiv.org/html/2608.11002#bib.bib11)));第三个方向则利用从英文教师模型的参数高效蒸馏(PEA-Diffusion (36 (https://arxiv.org/html/2608.11002#bib.bib14))、X2I (37 (https://arxiv.org/html/2608.11002#bib.bib13)))。 **多语言文本渲染。** 在图像中生成指定文本的能力是衡量T2I模型语言能力的关键指标。近期进展如Glyph-ByT5 (33 (https://arxiv.org/html/2608.11002#bib.bib34);34 (https://arxiv.org/html/2608.11002#bib.bib35))、AnyText (66 (https://arxiv.org/html/2608.11002#bib.bib26);65 (https://arxiv.org/html/2608.11002#bib.bib27))和EasyText (35 (https://arxiv.org/html/2608.11002#bib.bib28))引入了结合字形感知编码器、OCR引导特征或DiT的专门方法,以改进多语言文本渲染。同时,通用模型 (29 (https://arxiv.org/html/2608.11002#bib.bib1);58 (https://arxiv.org/html/2608.11002#bib.bib38);70 (https://arxiv.org/html/2608.11002#bib.bib23))已开始强调文本生成能力。然而,多语言文本渲染在能力和系统性评估方面仍然有限。 **语言相关偏差与跨语言效应。** 在NLP中,跨语言行为已被广泛分析 ((44 (https://arxiv.org/html/2608.11002#bib.bib61);48 (https://arxiv.org/html/2608.11002#bib.bib63);41 (https://arxiv.org/html/2608.11002#bib.bib64);24 (https://arxiv.org/html/2608.11002#bib.bib65);52 (https://arxiv.org/html/2608.11002#bib.bib66))),研究表明不同语言之间存在显著的语言不平等 ((25 (https://arxiv.org/html/2608.11002#bib.bib43);4 (https://arxiv.org/html/2608.11002#bib.bib60);49 (https://arxiv.org/html/2608.11002#bib.bib62);45 (https://arxiv.org/html/2608.11002#bib.bib45);78 (https://arxiv.org/html/2608.11002#bib.bib46)))。在此基础上,近期工作开始更广泛地研究T2I模型中的偏差 ((11 (https://arxiv.org/html/2608.11002#bib.bib69);68 (https://arxiv.org/html/2608.11002#bib.bib75);17 (https://arxiv.org/html/2608.11002#bib.bib76))),如社会偏差 (3 (https://arxiv.org/html/2608.11002#bib.bib54);28 (https://arxiv.org/html/2608.11002#bib.bib57))、文化偏差 (39 (https://arxiv.org/html/2608.11002#bib.bib59);27 (https://arxiv.org/html/2608.11002#bib.bib37);76 (https://arxiv.org/html/2608.11002#bib.bib40))和地理偏差 (2 (https://arxiv.org/html/2608.11002#bib.bib55);20 (https://arxiv.org/html/2608.11002#bib.bib15))。然而,这些研究仍主要使用英文提示词,难以将模型固有偏差与依赖语言的生成模式分离开来。尽管已有这些努力,针对T2I模型中跨语言效应的研究仍然有限,且大多集中于孤立的特定现象或狭窄的技术方面 ((23 (https://arxiv.org/html/2608.11002#bib.bib58);18 (https://arxiv.org/html/2608.11002#bib.bib22);26 (https://arxiv.org/html/2608.11002#bib.bib67);67 (https://arxiv.org/html/2608.11002#bib.bib68))),例如概念覆盖率的差异 (50 (https://arxiv.org/html/2608.11002#bib.bib53);75 (https://arxiv.org/html/2608.11002#bib.bib10))、非拉丁字符的影响 (55 (https://arxiv.org/html/2608.11002#bib.bib56)),或针对个别语言的案例研究 (38 (https://arxiv.org/html/2608.11002#bib.bib52))。此外,NeoBabel (15 (https://arxiv.org/html/2608.11002#bib.bib78))研究了原生多语言生成,并评估了跨语言一致性和代码切换鲁棒性。然而,对固有语言不平等、多维权衡以及潜在依赖语言生成模式的系统性研究仍严重不足。 ## 3. 跨语言基准:LingT2I ### 3.1. 基准覆盖范围 **任务选择。** 多语言环境带来两个基本挑战。首先,模型必须理解不同语言的提示词,同时生成语义准确、文化连贯的图像。其次,模型必须能够在多种书写系统下忠实渲染文本,而每种书写系统都有各自的字形复杂度、布局和格式规则。为了结构化地抓住这些挑战,LingT2I定义了两个评估任务:内容生成和文本渲染。 **语言覆盖。** 为了同时兼顾内容生成和文本渲染,我们的语言集合平衡了文化与语义多样性以及书写系统多样性。*语言分支*将提示词根植于不同的文化和语义语境,而*书写系统*则提供了从表音文字到表意文字、从拉丁字母到复杂音节文字的广泛覆盖。这一设计确保基准能够剥离语义内容与语言形式的影响,从而揭示语言不平等的根因。 我们选择了10种语言:英语、中文、印地语、西班牙语、法语、阿拉伯语、孟加拉语、葡萄牙语、俄语和日语。选择标准包括:(i) 同时覆盖高资源和低资源语言;(ii) 横跨印欧语系、汉藏语系、亚非语系、达罗毗荼语系等主要语系;(iii) 覆盖拉丁、天城文、阿拉伯文、汉字、西里尔文、假名等多种书写系统。每对语言的书写系统重叠最少,确保在评估文本渲染时能有效测试跨文字系统的泛化能力。 **数据收集与提示词设计。** LingT2I包含33K条提示词,分为两个任务。对于内容生成,我们从高质量英文提示词出发,组织为10个语义主题:动物、食物、建筑、自然景观、日常生活、职业、艺术风格、科技、运动和节日。每个主题包含若干模板,再对模板进行扩展,生成多样化的具体提示词。所有英文提示词均由专业翻译人员人工翻译为其余9种语言,并经过二次审校以保证语义一致性、文化适应性和自然度。对于文本渲染,我们从多样化的文本内容类别(如标牌、海报标题、产品名称、简短消息)中人工构建文本片段,并确保其在不同语言中具有相应书写系统的代表性字符。最终,我们形成了包含33K条提示词的LingT2I数据集,每条提示词都提供10种语言版本。 **评估维度。** 对于内容生成,我们从三个维度进行评估:(i) 语义保真度,衡量生成内容与提示词语义的一致性;(ii) 文本-图像对齐,衡量图像中是否包含提示词的视觉元素并排除多余内容;(iii) 视觉质量,考量真实性、美学和文化适宜性。对于文本渲染,我们评估:(i) 文本准确性,即生成文本是否与给定文本完全匹配;(ii) 可读性,即字符是否清晰可辨;(iii) 结构完整性,即字形和布局是否符合书写系统的规则。图2展示了这些维度的定义、多语言示例以及高/低质量生成结果。 请参考图2:内容生成任务的评估维度。对每个维度,我们提供其定义、多语言示例以及生成图像中高质量和失败案例的代表性示例。 ## 4. 实验设置 ### 4.1. 评估模型 我们在LingT2I上对多个代表性的T2I模型进行基准测试,涵盖不同架构和训练目标: - **通用扩散模型:** Stable Diffusion 3.5、FLUX.1-dev、Nano Banana。 - **自回归生成模型:** HunyuanImage-3.0、Janus-Pro-7B、NextStep-1。 - **多语言增强模型:** AltDiffusion、MuLan。 - **文本渲染增强模型:** AnyText、EasyText、Glyph-ByT5。 所有模型均使用公开权重和默认推理设置。对于需要英文提示词的模型,我们使用人工翻译的英文版本作为输入;对于支持多语言的模型,我们直接使用相应语言的提示词。 ### 4.2. 评估指标 对于内容生成,语义保真度采用CLIPScore(基于多语言CLIP)和人工评估的子集;文本-图像对齐采用基于检测的指标(如对象存在率)和人工标注;视觉质量采用Image Reward和人工评分。对于文本渲染,文本准确性采用字符级F1分数(在归一化后),可读性和结构完整性采用人工评估。所有人工评估均由母语者完成,每个语言至少3名评估者。 ## 5. 结果与分析 ### 5.1. 主要结果:语言之间的显著性能差距 表1报告了LingT2I上各语言的平均性能。结果显示,所有模型在英语上的表现均显著优于其他语言。以Nano Banana为例,其在英语上的语义保真度比印地语高18.4%,比孟加拉语高21.2%。这一模式在所有模型中一致存在,表明语言不平等是当前多语言T2I系统的一个普遍特征。我们还观察到,不同语言之间的性能差距随模型类型变化:基于自回归LLM的模型(如HunyuanImage-3.0)在高资源语言上的性能差异较小,但在低资源语言上的下降仍很明显。相比之下,文本渲染增强模型在非拉丁文字上的性能仍然大幅落后。 表1:LingT2I上各语言的平均语义保真度(CLIPScore)。数值越高越好。最佳模型加粗,
相似文章
跨语言共识:通过多语言自一致性对齐多语言文化知识
本文提出一个自监督框架,利用多语言自一致性和自我批评机制在不同语言间迁移文化知识,通过从本地语言表征中揭示潜在文化知识,在BLEnD基准测试的英语查询中平均提升5.03%。
语言模型中跨语言泛化的体外研究
本文引入了一个使用两种程序生成语言的体外框架,用于研究语言模型中的跨语言泛化,发现分词对可复用子结构的保留能力对于跨语言能力迁移比词汇相似性或数据平衡更为关键。
CroCo:基于自生成的跨语言对比偏好调优
本文介绍了CroCo,一种基于自生成响应的跨语言对比偏好调优方法,表明在英语偏好上训练的奖励模型能够有效对其他语言的响应进行排序,在无需特定语言标注的情况下,提升模型在14种语言上的性能。
StableI2I:识别图像到图像转换中的非预期变化
本文介绍了 StableI2I,这是一种无需参考图像的评估框架,用于评估图像到图像生成任务中的内容保真度和一致性。此外,本文还提出了 StableI2I-Bench,一个用于评估多模态语言模型在这些评估任务上表现的基准。
衡量跨语言理解差距:证据语言如何影响语言模型的理解
本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。