L'etzCross: 一个针对卢森堡语文档的多模态检索跨语言页面级基准

arXiv cs.CL 论文

摘要

LëtzCross 是一个用于卢森堡语PDF文档跨语言页面级检索的基准,比较了在低资源设置下纯文本和多模态检索器。

arXiv:2608.21714v1 Announce Type: new 摘要:最近的页面图像检索器如ColPali在视觉丰富文档的检索方面有所改进,但在跨语言、低资源设置下的行为知之甚少。我们引入L'etzCross,一个针对卢森堡语PDF文档的跨语言页面级检索基准,文档页面被索引为图像,查询以英语、法语、德语和卢森堡语提供。该基准结合了文本聚焦的QA对和视觉基础的QA对,覆盖了基于PDF的RAG中的文本和视觉检索需求。我们使用L'etzCross比较了基于OCR的纯文本检索器和ColPali风格的页面图像检索器,并发现后者在系统级比较中跨查询语言表现更佳。我们还考察了单语言和多语言微调。微调在查询语言间转移,其中法语在单语言设置中对卢森堡语查询产生了最高的平均性能。在多语言设置中,包括卢森堡语给出了最强结果,并显著提高了对卢森堡语查询的检索。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:15

# LëtzCross:一个针对卢森堡语文档的跨语言页面级多模态检索基准
来源:https://arxiv.org/html/2608.21714
Omar El Bachyr Fred Philippy 隶属机构:卢森堡大学,卢森堡 Laura Maria Bernardy 隶属机构:卢森堡大学,卢森堡 \[0\.5em\] Saad Ezzini 隶属机构:沙特阿拉伯法赫德国王石油与矿产大学 Jacques Klein 隶属机构:卢森堡大学,卢森堡 Tegawendé F\. Bissyandé 隶属机构:卢森堡大学,卢森堡

###### 摘要

近期的页面图像检索器,例如 ColPali (6) [1],已经提升了针对视觉丰富文档的检索效果,然而人们对其在跨语言、低资源环境下的行为知之甚少。我们推出了 **LëtzCross**,一个针对卢森堡语 PDF 文档进行跨语言页面级检索的基准,其中文档页面以图像形式被索引,查询提供英语、法语、德语和卢森堡语。该基准结合了以文本为中心的问答对和以视觉为依据的问答对,涵盖了基于 PDF 的检索增强生成系统中的文本和视觉检索需求。我们使用 LëtzCross 比较了基于 OCR 的纯文本检索器与 ColPali 风格的页面图像检索器,发现在系统级比较中,后者在各种查询语言下表现更优。我们还研究了单语言和多语言微调。微调效果可以跨查询语言迁移,在单语言设置中,法语查询在卢森堡语查询上取得了最高的平均性能。在多语言设置中,包含卢森堡语能产生最强结果,并显著提升了对卢森堡语查询的检索效果。

## 1 引言

检索增强生成和文档检索系统越来越多地在多语言环境中运行,其中用户查询和源文档可能使用不同语言书写。在这种设置下,跨语言信息检索随着密集检索架构和多语言编码器的发展而取得了显著进步 (12) [2];(4) [3]。然而,大多数当前评估集中在以文本为中心、资源丰富的场景中,未能反映视觉丰富的 PDF 文档所带来的挑战。

最近的视觉-语言检索模型,例如 DSE (17) [4] 和 ColPali (6) [1],通过联合建模文本和视觉证据,改进了对文档页面的检索。但它们在低资源语言环境下的行为仍未得到充分探索。我们通过卢森堡语的案例研究来探讨这一挑战。卢森堡语是一种低资源语言,其自然语言处理资源正在增长,但与高资源语言相比仍然有限 (16) [5];(2) [6];(21) [7]。

为解决这一差距,我们推出了 **LëtzCross**,一个针对卢森堡语 PDF 页面进行跨语言页面级检索的基准,其中页面以图像形式表示。该基准结合了以文本为中心和以视觉为依据的问答对,并围绕检索增强生成流水线中现实的页面级检索需求设计,其中答案可能依赖于文本内容、视觉结构或两者兼有,而查询可能以多种语言发出。

我们的主要贡献如下:

- • 我们推出了 LëtzCross,一个针对卢森堡语 PDF 页面进行跨语言页面级检索的基准,其中页面以图像形式表示。
- • 我们在此任务上对多语言纯文本检索器和后期交互页面图像检索器进行了基准测试。
- • 我们研究了针对卢森堡语文档页面进行跨语言检索的、特定于查询语言的微调。
- • 我们分析了卢森堡语文档页面作为低资源语言使用案例的检索中的多语言微调设置。

总的来说,我们的发现表明,后期交互页面图像检索器是卢森堡语文档页面跨语言检索的有力候选者,在系统级比较中超越了所评估的基于 OCR 的纯文本基线。我们进一步表明,特定于查询语言的微调可以跨语言迁移,而当包含目标低资源语言时,多语言微调最为有效。这些结果共同将 LëtzCross 定位为一个有用的基准,用于研究检索增强生成设置下卢森堡语 PDF 文档的跨语言页面级检索。

我们通过 GitHub 仓库 (https://github.com/OmarElbachyr/letzcross-benchmark) 发布了 LëtzCross 以及所有实验代码和资源。

## 2 相关工作

#### 卢森堡语自然语言处理资源

卢森堡语的自然语言处理领域仍在发展中。针对卢森堡语的自然语言处理技术主要在低资源环境下开发,并严重依赖于人工努力,例如数据收集和标注。近年来,这种方法推动了若干基础资源和应用的开发,包括情感分析系统 (24) [8];(7) [9]、一个卢森堡语依存句法树库 (20) [10] 以及零样本主题分类 (19) [11]。这些举措通过计算方法促进了对卢森堡语语言特性更好的理解。在此背景下,Lothritz 等人推出了 LuxemBERT (16) [5],这是一个使用人工数据增强策略训练的语言模型。除了模型本身,他们还扩展了卢森堡语在多个下游任务中的资源,包括词性标注、命名实体识别和新闻分类。此后又建立了两个卢森堡语语言模型:LuXGPT (2) [6],使用迁移学习技术开发;以及最近的 LUXT5 (21) [7],受益于多语言预训练。除语言建模外,实际的自然语言处理应用也已出现。这些包括用于自动语音识别的 LUX-ASR (8) [12],以及用于自动评论审核 (23) [13] 和拼写校正 (22) [14] 的系统。

#### 跨语言检索

基于 Transformer 的跨语言信息检索建立在多语言表示学习和密集检索架构的基础上,这些架构能够实现跨语言的语义匹配。早期的基础包括 BERT (5) [15],它引入了用于检索模型的上下文化 Transformer 表示;以及 XLM-R (4) [3],一个提供强大跨语言嵌入的多语言 Transformer。密集段落检索后续确立了密集检索系统中广泛使用的双编码器架构。在此基础上,更新的研究探索了无监督和生成式方法,例如 (11) [16] 提出的无监督多语言密集检索,该方法使用生成式伪标签来训练密集检索器,无需并行监督;以及关于将大型语言模型适配到检索任务的研究 (10) [17]。近期的多语言嵌入模型,如 BGE-M3 (3) [18]、Qwen3 Embedding (26) [19] 和 voyage-4-nano (1) [20],进一步改进了跨语言语义表示,并被广泛用作现代跨语言信息检索系统的基线。

#### 视觉语言检索

纯文本编码器在信息检索方面已取得强大性能,例如 (3) [18];(26) [19];(1) [20] 等模型在多语言和密集检索任务中展示了高效性。然而,信息检索领域的最新研究已经超越了传统的纯文本系统,开始融入视觉特征。DSE (17) [4] 提出使用视觉-语言模型对完整文档截图进行编码,成功地在无需光学字符识别的情况下保留了文本和视觉信息。类似地,ColPali (6) [1] 通过将 ColBERT (13) [21] 的后期交互相似度评分机制适配到页面图像上,解决了视觉丰富文档中文本聚焦检索的不足。这产生了多向量视觉嵌入,使得查询词元与文档页面特定视觉区域之间能够进行细粒度匹配。

请参阅图注

图 1:LëtzCross 基准构建流程概览。

## 3 LëtzCross 基准构建

LëtzCross 是一个针对卢森堡语文档构建的问答跨语言页面级检索基准,查询提供英语 (EN)、法语 (FR)、德语 (DE) 和卢森堡语 (LB)。文档以页面图像形式表示,答案基于相应页面。图 1 (https://arxiv.org/html/2608.21714#S2.F1) 总结了该过程,具体步骤如下所述。

### 3\.1 PDF 文档获取

我们通过遍历 FinePDFs (14) [22] 数据集的卢森堡语 (LB) 部分并检索每份文档的来源,来获取原始 PDF 文档。当文档存档在 Common Crawl 中时,我们直接从网页存档中提取相应的 PDF;否则,我们从数据集提供的原始 URL 下载 PDF。此过程使我们能够恢复与数据集条目相关的原始 PDF 文件。

### 3\.2 PDF 文档筛选与整理

下载 PDF 后,我们执行自动验证步骤,通过验证每份 PDF 是否可被成功解析和处理,来移除损坏或无法读取的文档。然后,我们将已验证的 PDF 手动分类为视觉丰富子集和文本主导子集。当文档包含提供超越周围文本的实质性信息的有信息视觉元素(如图表、示意图或表格)时,该文档被视为视觉丰富。无信息的视觉内容,如肖像、风景和徽标,不予考虑。信息主要通过连续文本传达、具有很少或没有有信息视觉元素的文档被归类为文本主导。生成的语料库作为后续问答生成步骤的基础。

### 3\.3 问答生成

然后,我们使用上一步验证的 PDF 生成问答对。我们生成英语查询,以确保高质量且一致的问题表述,因为这能产生更可靠的卢森堡语页面问答对。该基准结合了两种互补的问答来源:针对视觉丰富页面的、人工编写的以视觉为依据的问答对,以及针对文本主导页面的、自动生成的以文本为中心的问答对。

#### 人工编写以视觉为依据的问答。

对于包含丰富视觉组件的 PDF 子集,一位母语为卢森堡语的人士手动制作页面级问答对,这些问答对有意针对以视觉为依据的证据,如图表、图形、示意图、图形和其他布局相关元素,而不是仅仅依赖文本内容。问题被构建成独立且可从单个页面图像回答的,答案简洁并基于视觉内容。

#### 自动生成以文本为中心的问答。

使用文本主导的 PDF 子集,我们使用 GPT-5-mini 自动生成页面级问答对。每一页作为图像被独立处理,并被提示生成独立的问题,其简洁答案基于其文本内容。为验证生成的问答对,每个查询及其对应的 PDF 被提供给 Gemini-2.5-Flash,该模型从文档中提取答案。然后,我们通过精确匹配和语义匹配比较提取的答案与**标准答案**;后者通过提示 GPT-5-mini 评估两个答案是否传达相同含义来执行。总体而言,90.28% 的问答对被 GPT-5-mini 判定为语义等效,71.50% 包含完全相同的文字标准答案。未能产生一致答案的问答对被丢弃,从而得到一个用于后续人工验证步骤的经过一致性筛选的集合。

### 3\.4 质量控制与检索增强生成对齐

作为后续步骤,人工编写的问答对直接包含在最终基准中。相比之下,自动生成的问答对经历了一个仅专注于问题表述的人工验证阶段:标注者只看到问题,并在需要时进行修改,以产生清晰、自然的查询,反映与检索增强生成相关的信息需求(例如,现实的、检索导向的查询)。

### 3\.5 跨语言查询翻译

为实现跨语言检索评估,我们使用受控的大型语言模型提示,将最终确定的英语查询翻译成德语、法语和卢森堡语,该提示强制语义保留并防止释义或额外解释。这产生了跨语言的对齐查询集,其中每个翻译后的查询旨在保留与原始英语查询相同的检索意图。对于德语和法语,我们使用 Gemini-3-Flash,对于卢森堡语,则使用 Gemini-3-Pro。这个选择是在手动检查了一小组试验翻译后做出的:Gemini-3-Pro 产生了更好的卢森堡语翻译,而 Gemini-3-Flash 对德语和法语已足够。

最终基准包含 579 个问答对,覆盖 908 个文档页面。表 1 (https://arxiv.org/html/2608.21714#S3.T1) 总结了基准统计数据,包括自动生成的以文本为中心的问答对与人工编写的以视觉为依据的问答对之间的分布情况。基准构建期间使用的所有提示均可在随附的仓库中获取。

基准统计项 数值 页面数 908 查询数 579 平均查询长度 19\.5 平均语料库项长度 722\.5 问答类型分布 自动生成的以文本为中心 530 人工编写的以视觉为依据 49 表 1:LëtzCross 评估基准概览统计。查询和语料库项长度以词元为单位报告。

## 4 方法

本节介绍我们通过后期交互页面图像检索器,将卢森堡语文档页面的跨语言检索作为一个低资源案例研究的方法。

### 4\.1 训练数据构建

我们通过抓取卢森堡语维基百科文章并将其转换为 PDF 文档来构建训练数据。我们首先应用基于大小的过滤,设置最小和最大页面阈值以排除琐碎或过长的文档(例如,仅包含脚注的页面)。然后,使用与基准中相同的自动生成以文本为中心的问答生成流程(第 3\.3 节 (https://arxiv.org/html/2608.21714#S3.SS3.SSS0.Px2)),从 4,977 份 PDF(共 11,833 页)生成问答对。这产生了 22,028 个问答对。此外,我们从相同的维基百科衍生流程中构建了 450 个问答对,并将其保留为

相似文章

衡量跨语言理解差距:证据语言如何影响语言模型的理解

arXiv cs.CL

本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。