面向文化图像描述的长上下文检索增强翻译:Gators在AmericasNLP 2026共享任务中的提交

arXiv cs.CL 论文

摘要

佛罗里达大学Gators团队提交至AmericasNLP 2026共享任务,该任务涉及面向土著语言的文化图像描述。我们采用双阶段流水线:使用Qwen2.5-VL生成西班牙语中间描述,然后通过检索增强的多示例提示,利用Gemini 2.5 Flash生成目标语言描述。与基线相比,取得了显著提升。

arXiv:2605.20626v1 公告类型:新 摘要:我们介绍了佛罗里达大学Gators团队提交至AmericasNLP 2026共享任务的作品,该任务面向土著语言的文化图像描述。我们的双阶段流水线使用Qwen2.5-VL生成西班牙语中间描述,然后通过检索增强的多示例提示,利用Gemini 2.5 Flash生成目标语言描述。在开发集评估中,与共享任务基线相比,我们在Bribri、Guaraní和Orizaba Nahuatl描述任务上分别取得了164.1%、131.7%和122.6%的提升,并在测试集评估中保持对Bribri和Orizaba Nahuatl语言超过150%的提升。我们发现检索高度依赖语言,仅对大规模领域内语料库有效,并且合成数据增强贡献了开发集Guaraní性能提升中约28个chrF++。我们的提交是共享任务的总冠军,在目标语言描述的人工评估中位列五个决赛提交中的第二名。
查看原文
查看缓存全文

缓存时间: 2026/05/21 06:34

# 检索增强的长上下文翻译用于文化图像描述:Gators 在 AmericasNLP 2026 共享任务中的提交
来源:https://arxiv.org/html/2605.20626
Christopher Driggers\-Ellis 佛罗里达大学 driggersellis\.cw@ufl\.edu
Dzmitry Kasinets 佛罗里达大学 dkasinets@ufl\.edu
Christan Grant 佛罗里达大学 christan@ufl\.edu
Daisy Wang 佛罗里达大学 daisyw@cise\.ufl\.edu

###### 摘要

我们呈现了佛罗里达大学 Gators 在 AmericasNLP 2026 共享任务(针对土著语言的文化图像描述)中的提交。我们的两阶段流水线首先生成西班牙语中间描述(使用 Qwen2\.5\-VL),然后通过使用 Gemini 2\.5 Flash 的检索增强多样本提示生成目标语言描述。在我们的开发集评估中,我们相较于共享任务基线在 Bribri、Guaraní 和 Orizaba Nahuatl 描述上分别实现了 164.1%、131.7% 和 122.6% 的提升,并在测试集评估中为 Bribri 和 Orizaba Nahuatl 语言保持了 >150% 的提升。我们发现检索高度依赖语言,仅对大规模、领域内语料库有益,并且合成数据增强大约贡献了开发集 Guaraní 性能提升中的 28 个 chrF\+\+ 点。我们的提交是共享任务的总冠军,在目标语言描述的人工评估中,名列五个入围提交中的第二名。代码和提示可在 GitHub 上获取。¹¹¹https://github.com/dhawan98/AmericasNLP2026-Gators-Submission

## 1 引言

AmericasNLP 2026Buiet al.\(2026 (https://arxiv.org/html/2605.20626#bib.bib29)\) 的任务是为美洲土著语言中的图像生成具有文化背景的描述。我们识别出三个主要挑战。首先,目标语言是低资源语言。其次,描述是特定于文化的,而非通用的视觉描述。第三,该任务不仅需要词汇转换,还需要风格控制。成功的系统必须生成简短、自然的描述,并与组织者预期的参考语域相匹配。

虽然文化图像描述任务对 AmericasNLP 2026 来说是新任务,但我们发现当前的视觉-语言模型(VLM)无法直接用目标语言描述图像。鉴于目标语言的训练数据有限,这并不意外。因此,我们将问题表述为:先用高资源语言进行图像描述,再将描述从该语言机器翻译成共享任务的目标语言之一,这镜像了共享任务的基线方法。

我们首先尝试在Dhawanet al.\(2026 (https://arxiv.org/html/2605.20626#bib.bib18)\) 的工作基础上,将中间西班牙语(Es)VLM 描述提供给基于 mBART 的机器翻译(MT)模型。Dhawanet al.\(2026 (https://arxiv.org/html/2605.20626#bib.bib18)\) 显示,合成平行数据和语言特定的预处理改善了低资源土著语言 MT,包括 Es-Guaraní(Grn)翻译。然而,在 2026 年的共享任务中,标准的神经机器翻译流水线被证明不够充分。当我们对从开发图像生成的西班牙语中间描述应用现有的 Es-Grn 翻译模型时,生成的描述在句子层面上通常足够流畅,但不符合目标描述语域。换句话说,性能瓶颈从通用翻译质量转移到领域适应和文化上恰当的描述风格。

为解决这种不匹配,我们从序列到序列翻译转向使用大型语言模型(LLM)进行检索增强的上下文翻译。核心思想很简单。我们不依赖在混合领域低资源语言语料库上微调的单一模型,而是检索与当前描述相似的 Es-低资源(LoRes)示例,并将其作为上下文示例提供。这种设计使得解码器在推理时能够调整其词汇选择和风格语域。我们评估了多个 OpenAI 和 Gemini 模型,变化了检索训练示例和开发示例的数量,并测试了提示变体和检索启发式方法。

我们的实验得出三个主要发现。首先,在 OpenAI 模型中,多样本直接翻译优于我们的 mBART 基线和 LLM 后校正,但提升有限且对提示组合高度敏感。其次,Gemini 2.5 FlashComaniciet al.\(2025 (https://arxiv.org/html/2605.20626#bib.bib25)\) 在 Es-LoRes 上下文翻译中显著强于 GPT 系列模型。第三,开发参考样例作为上下文示例有助于匹配预期的描述语域,但必须谨慎解读,因为同池开发提示可能会夸大开发集得分。

我们的主要贡献如下。我们提出了一种用于低资源文化图像描述的检索增强 LLM 描述翻译流水线。我们记录了一系列广泛的负面和正面消融实验,包括模型替换、提示修订和开发示例超参数搜索。最后,我们强调评估设计是低资源描述中基于开发条件上下文学习的一个核心方法论问题。

## 2 背景

美洲土著语言的机器翻译主要通过 AmericasNLP 共享任务取得进展,这些任务建立了评估基准,并为许多低资源语言提供了平行语料库Mageret al.\(2021 (https://arxiv.org/html/2605.20626#bib.bib8)\); Ebrahimiet al.\(2023 (https://arxiv.org/html/2605.20626#bib.bib23)\); Ebrahimi and others \(2024 (https://arxiv.org/html/2605.20626#bib.bib10)\)。这些共享任务中的强大系统通常依赖于多语言预训练模型(如 mBART、M2M-100 或 NLLB-200),通常与合成数据生成、多语言迁移和额外语料库收集相结合Gow-Smith and Sánchez Villegas \(2023 (https://arxiv.org/html/2605.20626#bib.bib11)\); Tonjaet al.\(2023 (https://arxiv.org/html/2605.20626#bib.bib12)\); Costa-Jussàet al.\(2022 (https://arxiv.org/html/2605.20626#bib.bib7)\)。这些文献中一个反复出现的模式是,性能提升不仅来自更大的模型,也来自模型容量、增强策略与目标领域之间更好的对齐。

基于字符的评估指标在该领域也尤为重要。chrF 和 chrF\+\+ 被广泛用于形态丰富的语言,因为它们对屈折变化和拼写差异比 BLEU 更鲁棒Popović \(2015 (https://arxiv.org/html/2605.20626#bib.bib21),2017 (https://arxiv.org/html/2605.20626#bib.bib22)\)。AmericasNLP 2026 的组织者同样使用 chrF\+\+ 作为共享任务的第一阶段排名指标。

最后,我们的工作与上下文学习在低资源生成中的更广泛应用相关。检索增强提示可以在推理时使解码器适应当前示例,而不是在微调后仅依赖固定的模型参数。在我们的场景中,这尤其有吸引力,因为目标输出短且风格受限:平行演示不仅可以用作语义指南,也可以直接证明期望的描述语域。

## 3 数据集与方法

### 3.1 基线系统

我们将我们的检索增强 LLM 流水线与 Qwen3VL-8BQwen Team \(2025 (https://arxiv.org/html/2605.20626#bib.bib27)\) 描述和 Sheffield 2023Gow-Smith and Sánchez Villegas \(2023 (https://arxiv.org/html/2605.20626#bib.bib11)\) MT 方法进行比较,后者是当前图像描述共享任务的既定基线。我们将此基线应用于我们每个适用目标语言的开发集描述提交结果,并报告相对于基线得分的提升百分比。

对于 Guaraní 描述的 MT,我们还将与Dhawanet al.\(2026 (https://arxiv.org/html/2605.20626#bib.bib18)\) 的基于 mBART 的 Es-Grn 模型进行比较,该模型在精选和合成平行数据上训练。这作为我们流水线中最强的传统翻译基线,使我们能够评估检索增强的上下文生成是否优于标准序列到序列翻译。我们评估了几个检索增强的 GPT-4 系列\(OpenAIet al.,2024 (https://arxiv.org/html/2605.20626#bib.bib26)\)模型变体,总结在表2 (https://arxiv.org/html/2605.20626#S4.T2)中:GPT-4o-mini、GPT-4.1-mini、GPT-4.1,以及竞争的 Gemini 2.5 Flash。

在这些模型中,我们变化了检索训练示例数量 $r$、开发示例数量 $d$ 以及提示策略。

### 3.2 任务数据

官方开发集 $\mathcal{D}$(dev set)包含 50 个示例,组织者以 JSONL 格式与图像配对发布数据。试点集包含西班牙语描述作为参考,但组织者明确说明这些仅用于试点,不会出现在开发或测试中。

我们最终的提交流水线分为两个阶段。阶段 1 使用 Qwen 2.5BBaiet al.\(2025b (https://arxiv.org/html/2605.20626#bib.bib16)\) 从图像生成西班牙语描述。阶段 2 使用 Gemini 2.5 FlashComaniciet al.\(2025 (https://arxiv.org/html/2605.20626#bib.bib25)\) 进行 Es-LoRes 翻译。

### 3.3 按语言划分的数据集

共享任务涵盖五种目标语言:Guaraní、Yucatec Maya、Orizaba Nahuatl、Bribri 和 Wixárika。如表̃1 (https://arxiv.org/html/2605.20626#S3.T1)所示,可用的检索数据 $\mathcal{R}$ 在不同语言间差异很大,这促使我们将检索大小 $r$ 和开发示例数量 $d$ 作为推理时超参数处理,这些超参数根据目标语言提交而变化。

#### Guaraní

我们在设置中使用最大的检索库。Es-Grn 检索库包含 53,183 个平行句对,包含来自 MultiScript30k 项目的 AmericasNLP 2023Ebrahimiet al.\(2023 (https://arxiv.org/html/2605.20626#bib.bib23)\) 训练数据以及合成示例Driggers-Elliset al.\(2025 (https://arxiv.org/html/2605.20626#bib.bib15)\)。Guaraní 检索数据集与描述任务相对较好地对齐,因为它包含文化特定术语、专有名词和适用于视觉描述生成的简短描述性示例。

#### Yucatec Maya

我们没有可比较的平行训练语料用于检索。开发集 $\mathcal{D}$ 是唯一的检索来源,因此我们依赖开发示例和 LLM 的预训练知识,并将 $r=0$ 固定在所有实验中。

#### 其他目标语言

我们使用可用的 Es-LoRes 平行数据作为检索库。它们的检索库在规模和领域匹配度上各不相同:Orizaba Nahuatl 有 16,145 对,Bribri 有 7,508 对,Wixárika 有 8,966 对。Wixárika 检索数据明显更不像描述,因为可用的语料库大部分是叙述性或文学性的,而非视觉描述导向。这些差异促使我们报告表̃1 (https://arxiv.org/html/2605.20626#S3.T1)中特定于语言的超参数选择。

### 3.4 检索库与提示构建

对于每种目标语言,我们从上述可用平行数据构建一个语言特定的 Es-LoRes 检索库 $\mathcal{R}$。每个检索库的西班牙语侧使用 BM25Robertson and Zaragoza \(2009 (https://arxiv.org/html/2605.20626#bib.bib24)\)(一种 TF-IDF 风格的词汇检索方法,通过查询项重叠度结合词项重要性和文档长度归一化来对候选示例进行排序)建立索引。在推理时,阶段 1 生成的西班牙语描述用作查询 $q$,并选择前 $r$ 个检索到的平行句对作为 $\mathcal{R}_r(q) \subset \mathcal{R}$。

除了检索到的训练句对,某些配置还包括开发示例。令 $\mathcal{D}$ 表示共享任务中目标语言的开发集,并令 $\mathcal{D}_d \subset \mathcal{D}$ 表示提示中包含的 $d$ 个开发示例。对于查询描述 $q$,完整的提示上下文定义为

$$P(q) = \mathcal{D}_d \cup \mathcal{R}_r(q),$$

其中 $\mathcal{R}_r(q)$ 提供基于检索的语义和词汇基础,而 $\mathcal{D}_d$ 提供任务期望的描述风格示例。模型随后在 $P(q)$ 的条件下生成目标语言描述。

我们在适用时扫查 $r$ 和 $d$。提交时选择的数值见表̃1 (https://arxiv.org/html/2605.20626#S3.T1),详细的网格搜索结果见附录。

### 3.5 提示策略

MT 提示结构故意保持简单。系统提示指示模型从西班牙语翻译成目标语言,匹配示例风格,保持简洁,适当保留文化特定名词,并仅输出一行。用户提示包含两个证据块:开发示例 $\mathcal{D}_d$ 和检索到的西班牙语-目标语言句对 $\mathcal{R}_r(q)$,随后是当前的西班牙语描述。

我们跨目标语言使用相同的通用提示结构,仅当需要时添加语言特定的修改。经过几次提示工程尝试后,我们发现更激进的指令(例如抑制通用开场白或强制名词优先的措辞)会降低性能。因此最终的提示保持系统指令最小化,并依赖上下文示例来进行词汇和风格指导。我们在附录的表̃5 (https://arxiv.org/html/2605.20626#Sx2.T5)中总结了最终和消融提示文件。

### 3.6 佛罗里达大学 Gators 提交

我们的提交系统采用检索增强的长上下文翻译器,嵌入在两阶段图像描述流水线中。图1 (https://arxiv.org/html/2605.20626#S3.F1) 展示了完整的系统,分为五个步骤。阶段 1 对应图中的步骤 1。视觉-语言模型为每个目标图像生成一个西班牙语描述 $q$。我们在该阶段使用 Qwen2.5-VL-72B-Instruct(4 位精度)或 Qwen3-VL-8BBaiet al.\(2025a (https://arxiv.org/html/2605.20626#bib.bib17)\)。提示具有文化意识;遵循名词优先风格;并鼓励对可见实体、物体、服装、动作和场景上下文的简洁描述。我们将此阶段视为固定的,不在本文中对其进行大量优化。

图注见图1:提出的两阶段图像描述流水线概览。这里,$\mathcal{R}$ 表示完整的 Es-LoRes 检索库,$\mathcal{R}_r(q) \subset \mathcal{R}$ 表示为西班牙语描述 $q$ 检索到的前 $r$ 个最接近的 Es-LoRes 训练句对,$\mathcal{D}$ 表示完整的开发集,$\mathcal{D}_d \subset \mathcal{D}$ 表示多样本提示中使用的 $d$ 个黄金开发句对。

阶段 2 对应图1 (https://arxiv.org/html/2605.20626#S3.F1) 中的步骤 2–5。它使用检索增强的多样本 MT 将生成的西班牙语描述 $q$ 转换为最终的目标语言描述。$q$ 被用作 BM25 查询,在可用的 Es-LoRes 检索库 $\mathcal{R}$ 的西班牙语侧进行搜索。在步骤 3 中,检索到的子集 $\mathcal{R}_r(q)$ 和开发子集 $\mathcal{D}_d$ 被组装成一个多样本提示,并带有从西班牙语翻译成目标语言同时匹配示例风格的指令。每个提示大约包含 3K–5K 个 token。前 $r$ 个最接近的 Es-LoRes 训练句对提供语义和词汇基础,而 $d$ 个开发句对则提供风格指导。

相似文章

GAVEL:有依据的描述错误验证与定位

arXiv cs.CL

GAVEL 提出了一个新任务,用于验证、解释和定位图像-文本对中的错误,并附带一个数据集和基准。一个监督基线显示出相对于强闭源模型的改进。

RefCaptioner:多参考图像 grounded 视频字幕生成

Hugging Face Daily Papers

介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。