Jako Tako还是流利?介绍PoVisLE:一个波兰视觉语言评估基准
摘要
介绍了PoVisLE,一个波兰视觉语言评估基准,包含1,117张图像和2,366个手动标注的VQA问答对,旨在评估超越表面识别的、植根于文化的多模态理解。
arXiv:2608.07763v1 公告类型:新
摘要:视觉语言模型(VLMs)在图像描述、视觉问答和图像到文本生成等任务上取得了强劲的性能。然而,它们主要基于以英语为中心的数据进行训练,这限制了其处理植根于文化的视觉理解的能力,并导致在解释特定区域含义、符号性内容和依赖上下文的视觉线索时出现失败。现有的文化能力基准通常由模板驱动,且侧重于表面识别,不足以评估在特定文化情境中更深层的语言和语用理解。我们提出了PoVisLE,一个面向波兰语的单文化视觉语言基准,旨在基于扎根的评估范式(grounded evaluation paradigm)评估植根于文化的多模态理解,在该范式中,语言与视觉语境交互进行解释。该数据集包含1,117张图像和2,366个手动标注的VQA问答对。总体而言,我们的数据集为评估超越表面识别的、植根于文化的视觉语言理解提供了一个受控且具有挑战性的资源。
查看缓存全文
缓存时间: 2026/08/11 08:05
# Jako Tako 还是 Fluent?介绍 PoVisLE:一个波兰语视觉-语言评测基准
来源:https://arxiv.org/html/2608.07763
Anna Kołos,Grzegorz Statkiewicz,Karolina Seweryn,Katarzyna Kowol,Karolina Piosek,Wojciech Kusa
NASK 国家研究所,波兰华沙
通讯邮箱:\{名\.姓\}@nask\.pl
###### 摘要
视觉-语言模型(VLM)在图像描述、视觉问答和图像到文本生成等任务上取得了强劲的性能。然而,它们主要基于以英语为中心的数据进行训练,这限制了它们处理植根于文化的视觉理解的能力,并导致在解读区域特定含义、符号内容以及依赖上下文的视觉线索时出现失败。现有文化能力基准往往由模板驱动,且侧重于表层识别,难以评估在文化情境中更深层的语言与语用理解。我们提出了 **PoVisLE**,一个面向波兰语的单一文化视觉-语言基准,旨在一种“落地评估”范式下评估植根于文化的多模态理解,即语言在与视觉语境的交互中被解释。该数据集包含 1,117 张图像和 2,366 个人工标注的 VQA 对。总体而言,我们的数据集为评估超越表层识别的、植根于文化的视觉-语言理解提供了一个受控且具有挑战性的资源。¹¹¹为促进未来研究,我们公开发布数据集和代码:https://huggingface.co/collections/NASK-PIB/povisle,https://github.com/NASK-NLP/PoVisLE
Jako Tako 还是 Fluent?介绍 PoVisLE:一个波兰语视觉-语言评测
Anna Kołos,Grzegorz Statkiewicz,Karolina Seweryn,Katarzyna Kowol,Karolina Piosek,Wojciech Kusa
NASK 国家研究所,波兰华沙
通讯邮箱:\{名\.姓\}@nask\.pl
## 1 引言
近年来,VLM 的进展使得高质量的图像描述、视觉问答和图像到文本生成成为可能,加速了它们在广告、内容创作和数字助手等应用中的部署。然而,这些系统主要基于以英语为中心的数据集进行训练,导致本地语境、文化和语言的代表性不足。因此,模型在面对文化特定含义、符号解读和依赖上下文的视觉线索时往往表现不佳,尤其是在中低资源语言中。虽然构建大规模、植根于文化的数据集仍然具有挑战性,但稳健的评估基准是必不可少的(Vintar et al. (2025) (https://arxiv.org/html/2608.07763#bib.bib24))。与区域语境的错位不仅是伦理问题,也是实际限制,可能导致在现实应用中产生不准确或不恰当的输出。这一问题在欧洲背景下尤为突出,因为无障碍法规,例如 Web 内容无障碍指南(WCAG),要求为视觉内容提供替代文本描述。尽管多模态模型提供了一种有前景的解决方案(Mähr and Twente (2025) (https://arxiv.org/html/2608.07763#bib.bib13);Zheng et al. (2025) (https://arxiv.org/html/2608.07763#bib.bib28);Elisiário and Watanabe (2025) (https://arxiv.org/html/2608.07763#bib.bib5)),但它们必须正确解读文化本地化内容才能被可靠部署。当前对文化能力的评估仍然有限,尤其是在英语之外。现有数据集往往侧重于表层识别任务,例如识别物体或地标,并依赖模板化格式,这限制了语言和语境的多样性(Yadav et al. (2025) (https://arxiv.org/html/2608.07763#bib.bib27))。
参见标题 参见标题
图 1:上方:PoVisLE 数据集构建的两阶段流程概览。下方:数据集中的一个示例,为清晰起见附有推理步骤。更多示例见附录 A (https://arxiv.org/html/2608.07763#A1)。
为在特定文化背景下解决这些局限,我们提出了 **PoVisLE**(波兰语视觉-语言评测;见图 1 (https://arxiv.org/html/2608.07763#S1.F1)),这是第一个面向波兰文化和语言能力(包括区域特定知识)的单一文化视觉-语言基准。现有的植根于文化的基准仅针对文化知识,而 PoVisLE 还通过方言和区域变体等语言现象与视觉语境的交互来测试语言现象,将纯文本的波兰语评测(特别是 PLCC,Dadas et al. (2025) (https://arxiv.org/html/2608.07763#bib.bib4))扩展到多模态环境。所有问题和答案均为人工创作,不使用模板,并且设计上要求对视觉证据、语言和文化知识进行多跳推理。我们的贡献如下:
- • 我们发布了 PoVisLE,包含 1,117 张图像和 2,366 个人工撰写的 VQA 对,针对波兰文化和语言能力。近 30% 的图像来自标注者的私人收藏,未出现在网络规模的训练语料中,提供了更严格的泛化测试。
- • 我们将一个层次化的文化与语言现象分类法改编并扩展到波兰语多模态情境,支持细粒度的诊断分析,并通过与基于模板的基准进行文体比较,验证了我们问题的语言丰富性。
- • 我们对 16 个开源和闭源 VLM 进行了基准测试。最强的模型 Qwen3.5-397B 达到了 71.4571.45% 的准确率。方言和区域主义问题是最弱的类别,表明语言内部变异的覆盖有限。移除图像或问题的消融实验证实,该基准无法仅凭文本先验或选项伪影解决,而在波兰语、英语和德语中的评估表明,性能也取决于提示语言。
## 2 PoVisLE 数据集构建
数据集构建的主要目标是开发一个高度多样化、人工标注的数据集,用于评估 VLM 对波兰文化和语言的理解。在先前关于文化情境评估的工作以及现有纯文本 PLCC 基准(Dadas et al. (2025) (https://arxiv.org/html/2608.07763#bib.bib4))的基础上,我们将文化操作化为有形文化制品与无形共享社会实践的结构化组合。在本工作中,我们将波兰视为一个文化和语言上相对连贯的群体的代表,假设标注者和目标用户之间具有共享的文化知识基线,同时承认内部区域差异。重要的是,该数据集并不以单一的都市或制度化视角为中心——这可能会偏向首都中心文化——而是纳入了波兰各地区在地理上分布的文化和语言多样性。这包括区域特定传统以及方言和词汇变异。因此,该数据集反映了一种多中心的波兰文化观,而非同质化的国家原型,确保了更广泛的文化实践覆盖,并减少都市或首都区域偏差。
我们假设,如果一个概念满足以下至少一项要求,则被认为具有文化相关性:(i) 在波兰境内被广泛认可,无论是在全国范围内还是在特定区域或文化子群体中;(ii) 在小学或中学教育中教授;(iii) 出现在共享媒体话语中;(iv) 是解读植根于文化的视觉场景所必需的。因此,我们的定义明确排除了高度专业化或专家级的知识(例如,大学层面的领域特定概念),这些不属于共享文化理解的一部分。
最近的研究发现,视觉-语言模型中存在系统性的“落地差距”:虽然模型可以从文本表征中回忆事实关联,但当它们必须依赖指向同一实体的视觉输入时,性能会下降(Ashok et al. (2025) (https://arxiv.org/html/2608.07763#bib.bib1))。基于这一观察,我们数据集中的所有问题都明确设计为需要视觉参考,从而防止模型仅依赖文本关联或记忆知识。关键的是,这一设计原则也扩展到了以视觉语境为根基的语言导向问题。我们的分类法在 2.1 节 (https://arxiv.org/html/2608.07763#S2.SS1) 中描述。数据集构建过程分两个阶段进行,分别在 2.2 节 (https://arxiv.org/html/2608.07763#S2.SS2) 和 2.3 节 (https://arxiv.org/html/2608.07763#S2.SS3) 中描述,整体流程见图 1 (https://arxiv.org/html/2608.07763#S1.F1)。
### 2.1 基于内容的分类法
原始 PLCC 的六个核心类别是“艺术与娱乐”、“文化与传统”、“地理与自然”、“历史”、“语法”和“词汇”。在 VQA 情境中,我们保留前四个类别,并将“语法”和“词汇”合并为一个统一的“语言”类别。子类别通过调整和引入更严格的内容匹配标准进一步细化。由此产生的层次化分类法概览见表 1 (https://arxiv.org/html/2608.07763#S2.T1),它支持领域特定的错误分析和更精确的基准诊断。所定义的域涵盖了与有形文化制品相关的事实型知识,以及与无形实践(如符号、习俗和共享社会指涉)相关的文化推理要素。
与一些知识驱动的 VQA 数据集不同,例如 CUS-QA(Libovickỳ et al. (2025) (https://arxiv.org/html/2608.07763#bib.bib11)),其问题通常围绕基于模板的事实检索(例如“何时”、“何地”、“谁”)构建,并且主要产生命名实体答案,而我们的数据集优先考虑语言和文化的自然性。具体而言,问题是手工撰写的,以反映母语者的价值观、语言模式和真实交际行为,强调多跳视觉理解,而非依赖表层的实事查询。此外,我们的方法明确纳入了在多模态评估中往往被忽视的语言维度。数据集包含的问题涵盖短语学、语义学、语法、方言和区域主义、正字法等子类别。这种设计允许对视觉-语言模型进行更全面的评估,捕捉它们在多模态语境中处理植根于文化的语言现象的能力,而不仅仅是纯文本语言基准通常评估的内容。
虽然该基准主要针对植根于文化的推理,但有一小部分(2,366 个 VQA 对中的 168 个)侧重于更一般的多模态理解,归类为“图像理解”和“视觉推理”。尽管这些实例并非总是需要明确的文化知识,但它们仍然嵌入在波兰的视觉和语言语境中(例如,公共空间或波兰语文本),因此仍依赖于模型解读文化情境线索的能力。
### 2.2 图像收集
视觉数据构成了后续标注过程的基础。数据收集过程分两个阶段进行:人工策展和基于 Wikimedia 的增广。
##### 人工收集
在初始阶段,标注者的任务是从三个主要来源中逐个选择图像:(i) Wikimedia Commons;(ii) 其他开放许可、公开可用的数据集或图像;(iii) 自有资源,前提是标注者明确同意放弃其版权特权并将其贡献给项目。标注者将选定的图像上传到一个专门的 GUI 辅助应用程序中,并负责提供准确的元数据描述,包括有效的超链接和来源归属,以及来源类型和相应许可条件的信息。
类别 / 子类别 | 开放 | MCQ | Y/N | 总计(%)
---|---|---|---|---
艺术与娱乐 | 150 | 208 | 186 | 544(23.0%)
文学 | 25 | 38 | 39 | 102(4.3%)
建筑 | 25 | 34 | 24 | 83(3.5%)
体育 | 22 | 26 | 34 | 82(3.5%)
绘画 | 24 | 24 | 26 | 74(3.1%)
音乐 | 12 | 30 | 27 | 69(2.9%)
电影 | 21 | 27 | 17 | 65(2.7%)
媒体 | 14 | 16 | 7 | 37(1.6%)
雕塑 | 7 | 13 | 12 | 32(1.4%)
语言 | 149 | 159 | 169 | 477(20.2%)
短语学 | 11 | 35 | 47 | 93(3.9%)
语义学 | 26 | 34 | 23 | 83(3.5%)
语法 | 33 | 28 | 14 | 75(3.2%)
方言和区域主义 | 21 | 19 | 30 | 70(3.0%)
正字法 | 21 | 5 | 16 | 42(1.8%)
修辞格 | 8 | 10 | 23 | 41(1.7%)
语言基础与语音学 | 19 | 11 | 8 | 38(1.6%)
口语与俚语 | 10 | 17 | 8 | 35(1.5%)
地理与自然 | 110 | 161 | 164 | 435(18.4%)
人造物 | 56 | 76 | 60 | 192(8.1%)
社会政治 | 31 | 41 | 53 | 125(5.3%)
无生命自然 | 12 | 30 | 27 | 69(2.9%)
有生命自然 | 11 | 14 | 24 | 49(2.1%)
历史与社会 | 86 | 131 | 162 | 379(16.0%)
时事与社会 | 32 | 44 | 56 | 132(5.6%)
近代与现代史 | 24 | 39 | 42 | 105(4.4%)
第二次世界大战 | 12 | 14 | 23 | 49(2.1%)
战后历史 | 9 | 14 | 25 | 48(2.0%)
中世纪 | 9 | 20 | 16 | 45(1.9%)
文化与传统 | 81 | 133 | 149 | 363(15.3%)
美食 | 24 | 28 | 50 | 102(4.3%)
宗教与传统 | 25 | 32 | 44 | 101(4.3%)
区域与族群文化 | 17 | 46 | 33 | 96(4.1%)
流行文化 | 15 | 27 | 22 | 64(2.7%)
图像理解 | 50 | 45 | 23 | 118(5.0%)
视觉推理 | 17 | 18 | 15 | 50(2.1%)
总计 | 643 | 855 | 868 | 2366(100.0%)
总计 % | 27.2% | 36.1% | 36.7%
表 1:按类别和问题类型划分的问题分布。Y/N 表示是非题;括号中的数字是该(子)类别占所有 2,366 个问题的百分比。
由于从个人收藏中获取图像更耗时,从一开始就预期这类资源的使用相对于 Wikimedia Commons 等现成来源会有限。然而,在初始人工策展集中,39.5% 的图像来自标注者提供的收藏。这些图像尤其有价值,因为它们是真实的非公开数据。类似方法也已在特定文化基准中采用,例如 TaiwanVQA(Hsieh et al. (2026) (https://arxiv.org/html/2608.07763#bib.bib7))。数据集元数据包括来源类型标注,使分析模型在标注者提供的图像与公开来源图像上的性能差异成为可能。
通过自行选择图像,标注者能够利用他们的文化知识、经验和解读直觉来构建超越表层事实查询的问题。与诸如“描绘的是谁?”这样的标准提示不同,由此产生的问题通常需要更深层的文化、历史或语言理解与推理,反映了内容中那些不太可能通过模板方法或 LLM 生成的标注来捕获的方面。然而,这种方法也可能引入主观偏差,因为标注者可能偏好与其个人经验或区域背景一致的内容。这一风险在后续数据集设计中得到了考虑。
##### Wikimedia 数据增广
数据收集的第二阶段旨在通过从 Wikimedia Commons 的波兰相关类别中为标注者分配图像,而非允许他们独立选择图像,来缓解选择偏差并增加数据集多样性。标注者首先评估图像是否适合进行植根于文化的 VQA,如果适合,则制定相应的问题。为考虑标注者的置信度,图像可以被标记为适合 VQA 但超出标注者的置信范围,这表明虽然图像满足一般适用性标准,但在问题制定方面需要更确定或更专业的知识。这些案例随后被相应重新分配。此外,相似文章
@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。
LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。
VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?
介绍了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,面向视觉语言模型,涵盖反馈引导的修复和参考引导的重新样式化。评估了20个VLM,并提出了VisEditAgent,一个基于渲染的编辑框架,将通过率从55.75%提升到67.99%。
VIABench:一项由视障人士收集的全面视频基准,用于视觉障碍辅助
介绍了VIABench,这是一个全面的视频基准,用于评估多模态大语言模型在真实世界中对盲人和视障人士的视觉辅助能力,涵盖了761个视频和14,526个标注,涉及三个任务。
Almieyar-Oryx-BloomBench:一种用于认知驱动评估视觉语言模型的双语多模态基准
BloomBench是一个基于认知理论的双语(英语-阿拉伯语)多模态视觉语言模型基准,系统评估基于布鲁姆分类学的六个认知层次。实验揭示了当前模型中显著的认知不对称和跨语言性能差距。
主动观察者的测试
本文介绍了ActiveVision,一个用于评估多模态大语言模型主动观察能力的基准测试。前沿模型如GPT-5.5和Claude Fable 5表现不佳,分别仅解决了10.6%和3.5%的任务,而人类达到了96.1%,凸显了迭代视觉感知的缺失。