思考再链接:多语言实体链接中的稀有性、推理与检索

arXiv cs.CL 论文

摘要

本文介绍了一种多语言多模态实体链接框架,通过结合推理和检索,提高了对稀有实体的准确性,并在MERLIN基准测试中取得了显著提升。

arXiv:2609.10745v1 公告类型:新 摘要:多模态实体链接将文本和图像中的实体提及关联到知识库条目。这些系统在稀有实体上性能下降,但先前工作主要通过基于流行度的指标(如页面浏览量)来衡量稀有性。我们使用知识图谱结构指标来拓宽这一视角,这些指标捕捉了实体被记录和连接的程度。这些指标识别了许多流行度指标遗漏的稀有实体。在由此产生的稀有实体切片中,最先进的准确率下降了15.4%-39.9%,表明不同的稀有性定义揭示了不同的失败模式。为了解决这些失败,我们引入了一个简单的、无需训练的框架,其中具有推理能力的视觉语言模型在Wikipedia上迭代搜索和推理,动态收集证据。受控实验表明,推理和检索是互补的。仅推理在稀有实体上并未显著提高准确率。无推理的检索提高了稀有实体准确率,但可能损害整体准确率。它们的组合表现最佳。在MERLIN上,一个涵盖五种语言(印地语、印度尼西亚语、日语、泰米尔语、越南语)的多语言多模态实体链接基准测试中,我们最好的系统整体上比最先进技术提高了6.9%,在稀有实体切片上提高了多达23.3%。我们发布了MERLIN-Rare,即用于针对性评估的稀有实体测试切片,并附上我们的框架。
查看原文
查看缓存全文

缓存时间: 2026/09/11 08:15

# 先链接再思考:多语言实体链接中的稀有性、推理与检索  
来源:https://arxiv.org/html/2609.10745  
Simran Khanuja  
隶属机构:卡内基梅隆大学  
Graham Neubig  
隶属机构:https://neulab.github.io/think-before-you-link/  

###### 摘要  
多模态实体链接将文本和图像中的实体提及映射到知识库条目。这类系统在处理稀有实体时性能会下降,但现有研究主要通过基于流行度的指标(如页面浏览量)来衡量稀有性。我们利用知识图谱的结构化指标(反映实体文档完整度与连接程度)拓宽了这一视角。这些指标识别出了许多被流行度指标遗漏的稀有实体。在由此划分的稀有实体切片中,最先进模型的准确率下降了15.4%至39.9%,表明不同的稀有性定义会暴露不同的故障模式。为解决这些问题,我们提出一个无需训练的简单框架,其中具备推理能力的视觉语言模型能在维基百科上迭代搜索并推理,动态收集证据。控制实验表明推理与检索具有互补性:仅依靠推理无法显著提升稀有实体的准确率;无推理的检索虽能提升稀有实体准确率,但可能损害整体准确率;两者结合则效果最佳。在覆盖五种语言(印地语、印尼语、日语、泰米尔语、越南语)的多语言多模态实体链接基准测试MERLIN上,我们的最佳系统整体优于现有技术6.9%,在稀有实体切片上最高提升23.3%。我们发布了针对定向评估的稀有实体测试切片集MERLIN-Rare及配套框架。  

## 1 引言  
参见标题图1:多模态实体链接。日语文本提及通用的“邮轮”,仅凭文本无法解析。附图显示船体上的“钻石公主号”名称,从而支持定向搜索以链接到正确实体。  
实体链接(将文本提及映射到知识库条目)是知识密集型自然语言处理应用的基础(Sevgili等人,2022;Shen等人,2015)。随着视觉语言模型能力增强,多模态实体链接日益受到关注——视觉上下文有助于消解仅凭文本难以消除的指代歧义(Shi等人,2024;Moon等人,2018)。这在多语言场景中尤为重要,图像可提供与语言无关的信号来弥合文本覆盖缺口(Ramamoorthy等人,2025)。  

图2:我们的最佳系统(8B-Think+Embed)与基线对比  
(a) 五种语言完整测试集准确率:相比SOTA平均提升+6.9%  
(b) 在底部5%稀有实体切片上相比Pangea优势达+23.3%  
(c) 在按语言版本划分的底部5%稀有实体中,Pangea准确率为47.6%,我们的系统达63.9%  

当前实体链接模型在常见高频实体上表现良好,但在长尾部分性能骤降(Boscariol等人,2025;Hoveyda等人,2024;Ilievski等人,2018)。此问题对文化特色实体尤为严重——这类实体可能在特定语言社区内知名,但在跨语言知识库中表征稀疏(Veselovsky等人,2025;Naous等人,2024),不同于单纯不流行的实体。然而,先前研究主要通过基于流行度的代理指标(如维基百科页面浏览量、内向链接数)评估实体稀有性(Graciotti等人,2025;Mallen等人,2023;Chen等人,2021),这些指标仅反映访问频率,可能无法体现文化特异性。  

我们在MERLIN基准(Ramamoorthy等人,2025)上研究此问题。该基准涵盖五种语言(印地语、印尼语、日语、泰米尔语、越南语)的多模态实体链接任务。我们提出更全面的实体稀有性描述框架,以区分文化特异性与单纯不流行性。通过知识图谱结构指标,我们发现结构稀疏性与基于流行度指标常遗漏的实体性能显著下降相关。底部5%的实体集合平均仅重叠37%,准确率在结构稀疏端持续下降。直觉上,不同稀有性定义揭示了不同故障模式:某实体可能文档丰富但访问量低,或在单语社区内流行但跨语言/图谱覆盖稀疏。单一流行度指标无法区分这些情况,因此我们考虑多种稀有性定义以揭示综合评估中隐藏的故障模式。  

在当前最先进模型(de Dieu Nyandwi等人,2025)上,不同底部5%切片的准确率下降15.4%至39.9%。结构指标显示最高降幅达37.0%(与页面浏览量的37.7%相近),但识别的实体集大不相同。标准流行度指标遗漏了大量模型失效的稀有实体。  

稀有实体在模型权重中很可能未被充分表征,这促使了在推理时访问外部知识的检索增强方法(Ding等人,2025;Pons等人,2024;Liu等人,2024)。但仅靠检索可能不足,因为实体消歧常需上下文推理。我们研究一个简单框架:结合具备推理能力的视觉语言模型与维基百科检索能否解决稀有实体故障。研究发现推理与检索作用互补:仅推理无法显著提升稀有实体准确率;无推理的检索虽提升稀有实体性能,但会损害非推理模型在完整测试集上的表现;两者结合性能最优,表明推理能帮助模型更有效地利用检索证据。  

如图2所示,我们的最佳系统在不同语言上相比SOTA基线提升2.1%至10.0%。稀有实体上的增益更大,完整数据集+6.9%的优势在最难稀有实体切片上增至+23.3%。  

综上,我们的贡献包括:  
- • 稀有性特征化:提出基于Wikidata结构指标的多维实体稀有性描述框架,表明不同稀有性定义识别不同实体集和故障模式。发布用于定向评估的稀有实体测试切片集Merlin-Rare。  
- • 框架:提出结合推理型视觉语言模型与维基百科迭代检索的简单框架,在MERLIN上超越SOTA 6.9%,在稀有实体切片上最高提升23.3%。  
- • 分析:详细分析模型行为,揭示检索对非推理模型在常见实体上有害但对稀有实体有益;检索失败占残余错误的72%;推理模型的检索调用更少但更精准。  

## 2 相关工作  
#### 基于大语言模型的实体链接  
实体链接已从候选集分类转向直接生成,始于GENRE(Cao等人,2021a)的自回归实体检索,并通过上下文增强和自适应路由扩展(Ding等人,2024;Ding等人,2025;Xin等人,2025;Liu等人,2024;Li等人,2025)。LELAH(Haffoudhi等人,2026)检索一次后通过自一致性投票推理;ELA(Luo等人,2025)使用单次检索且无查询优化。所有方法均为纯文本且以英语为主;均未研究针对文化特色实体的迭代证据收集。  

#### 多模态与多语言实体链接  
多模态EL利用视觉上下文消解文本歧义提及(Moon等人,2018;Wang等人,2022;Shi等人,2024;Liu等人,2025),多语言EL通过自回归和端到端方法取得进展(Cao等人,2021b;Limkonchotiwat等人,2023)。MERLIN(Ramamoorthy等人,2025)是此交叉领域的首批基准;Cultural Pangea(de Dieu Nyandwi等人,2025)通过在文化标注数据上微调多语言视觉语言模型确立SOTA,但在结构稀有实体上仍显著下降(第4节)。  

#### 实体稀有性与文化表征  
EL系统在稀有实体上性能下降(Ilievski等人,2018;Hoveyda等人,2024;Boscariol等人,2025),稀有性通常等同于低流行度(Mallen等人,2023;Kandpal等人,2023;Chen等人,2021)。但不流行不等于文化特异性。LLM存在西方中心实体偏差(Naous等人,2024),VLM性能与每种语言的维基百科规模相关(Bugliarello等人,2022),本地文化知识在跨语言表征中不足(Veselovsky等人,2025;Tao等人,2024;Adilazuarda等人,2024)。我们通过区分结构稀疏性与流行度来解析这些现象。  

#### 检索增强推理  
ReAct(Yao等人,2023)和IRCoT(Trivedi等人,2023)将推理与检索交替进行;通过强化学习训练的原生推理模型(Guo等人,2025;Team,2025;Jin等人,2025;Feng等人,2025)学会在思考中调用搜索;推理时计算可替代参数(Snell等人,2024)。此范式尚未应用于实体链接,这正是我们填补的空白。  

## 3 任务定义  
实体链接是将文本实体提及映射到知识库条目的任务(Shen等人,2015)。我们研究其多语言、多模态形式,聚焦给定标记提及的实体链接。采用MERLIN(Ramamoorthy等人,2025)作为评估集。遵循其设置:给定源语言文本段落T、附图I及标记实体提及m∈T,任务是预测m所指实体的英文维基百科标题。评估采用与黄金标注的精确匹配准确率。  

## 4 实体稀有性分析  
在阐述方法论前,我们先描述激发本方法的稀有性问题。我们沿多个维度定义实体稀有性,并证明当前SOTA在稀有实体上失效。  

### 4.1 实体稀有性定义  
先前研究通常使用流行度信号(如维基百科页面浏览量或内向链接数)定义实体稀有性(Graciotti等人,2025;Xin等人,2025;Mallen等人,2023;Ilievski等人,2018)。但流行度仅是稀有性的一个维度。直观上,某实体可能受公众关注但结构化或跨语言信息有限。维基百科内容指标衡量实体文档丰富度,Wikidata指标衡量其结构连接性与跨语言覆盖度。这些维度反映了实体链接的不同难点来源:文档不足减少可用文本证据,知识图谱稀疏提供更少实体关系,跨语言覆盖低使源语言提及更难关联到英文知识库条目。先前研究也表明维基百科关注度可能与Wikidata结构不一致(Erenrich,2024),文化背景内容常在各语言版本中覆盖有限(Miquel-Ribé和Laniado,2018)。基于流行度的定义可能遗漏那些受关注但在多语言EL系统所用资源中表征不足的实体。我们考虑多种稀有性定义以识别流行度指标可能未揭示的模型故障模式。  

#### 稀有性指标  
通过维基百科和Wikidata API收集两类指标:  
**基于维基百科的指标**反映编辑关注度与文档深度:页面浏览量(90天)、反向链接、文章大小、修订次数、独立编辑者数、分类数、外部链接、参考文献数、图片数。  
**基于Wikidata的指标**反映结构连接性与跨语言覆盖:内向链接、外向链接、语言版本数(拥有文章的维基百科语言数)、陈述数、限定词数、实体年龄。  

#### 定义  
若实体e在指标m上的值m(e)处于测试集分布的底部q%(正文q=5),则该实体在指标m上*稀有*。若实体在访问频率指标(页面浏览量、反向链接)上稀有则为*不流行*,在Wikidata指标(语言版本数、陈述数、限定词数、链接数)上稀有则为*结构稀疏*。“稀有”作为涵盖这些特定指标尾部的总称,包括访问频率低的不流行实体、维基百科内容不足的文档薄弱实体、Wikidata覆盖有限的结构稀疏实体。我们使用底部

相似文章

通过可操控模型合并增强多语言推理

arXiv cs.CL

本文提出ST-Merge,一种可操控的模型合并框架,利用门控交叉注意力机制自适应地调节多语言模型和推理模型的贡献,在涵盖21种语言的多语言推理基准测试中优于固定合并方法。

推理大语言模型中的隐藏语言一致性现象

arXiv cs.CL

本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。