鞑靼斯坦地名:用于地理空间问答的双语数据集与混合 RAG 系统
摘要
介绍了鞑靼斯坦地名的双语数据集以及用于地理空间问答的混合 RAG 系统,在多语言模型上实现了高召回率和 F1 分数。
arXiv:2605.05962v1 公告类型:new
摘要:本文研究了针对多语言地名数据的自动地理空间问答。本文介绍了一个关于鞑靼斯坦共和国地名的原创双语数据集,包含 9,688 条结构化记录,涵盖语言学、词源、行政区划及坐标信息(其中 93.1% 已进行地理编码)。基于该数据集,构建了一个约 39,000 个“问题-上下文-答案”三元组的问题-答案语料库,并保证了答案的定位。混合检索器将密集语义索引(multilingual-e5-large)与通过 KD 树和哈文辛公式计算的地理空间过滤相结合。在 500 个测试查询中,混合搜索实现了 Recall@1=0.988、Recall@5=1.000 和 MRR=0.994,显著优于 BM25 和纯空间方法。在测试的阅读器架构(RuBERT、XLM-RoBERTa-large、T5-RUS)中,XLM-RoBERTa-large 表现最佳:EM=0.992,F1=0.994。在原始输出方面,RuBERT 模型在坐标问题上表现失败(F1=0),而 XLM-RoBERTa-large 的 F1 达到 0.984;然而,简单的后处理消除了数值间隙,使 RuBERT 的准确率恢复到 100%。这种差异源于分词差异和预训练语料库组成的不同。所有资源(数据集、QA 语料库、模型权重、网页演示)均已通过 Hugging Face 公开发布。研究结果适用于多语言地区的地理空间问答服务、地理编码和数字人文领域。
查看缓存全文
缓存时间: 2026/05/08 06:57
# 鞑靼斯坦地名:用于地理空间问答的双语数据集与混合 RAG 系统
来源: https://arxiv.org/html/2605.05962 [![[无标题图片]](https://arxiv.org/html/2605.05962v1/x1.png)M\. K\. Arabov](https://orcid.org/0000-0003-2525-1183) 数据分析与编程技术系 计算数学与信息研究所 喀山(伏尔加地区)联邦大学 俄罗斯喀山 MKArabov@kpfu\.ru
###### 摘要
本文解决了针对多语境地名数据进行端到端自动地理空间问答的任务。介绍了一个原创的鞑靼斯坦共和国地名双语数据集,包含 9,688 条结构化记录,具有详细的语言学、词源学、行政区划和坐标信息(93.1% 的对象已进行地理参照)。基于该数据集,构建了一个包含约 39,000 个“问题-上下文-可提取答案”三元组的专用问答语料库,并保证答案在文本中的定位。为了解决这一任务,提出了一种结合两个关键组件的架构:一个混合检索器,它将使用 multilingual-e5-large 的密集语义索引与地理空间过滤和排序(KD-tree,Haversine 距离)相结合;以及一个基于微调 Transformer 模型的提取式阅读器。在 500 个测试查询上,混合搜索实现了 Recall@1 = 0.988,Recall@5 = 1.000,MRR = 0.994,在统计上显著优于 BM25 和纯空间方法。在测试的阅读器架构(RuBERT、XLM-RoBERTa-large、T5-RUS)中,多语言 XLM-RoBERTa-large 模型达到了最佳的答案提取质量:EM = 0.992,F1 = 0.994。观察到一个对比效应:在原始输出中,基于 RuBERT 的模型无法回答与坐标相关的问题(F1 = 0),而 XLM-RoBERTa-large 实现了 F1 = 0.984;然而,简单的后处理完全消除了数值缺口,并将 RuBERT 的准确率恢复到 100%。这种差异归因于分词特性以及预训练语料的构成。创建的资源(数据集、QA 语料库、训练模型权重和网页演示器)已公开发布在 Hugging Face 平台上。获得的结果可直接应用于地理空间问答服务、地理编码系统以及多语言地区的数字人文项目开发。
*关键词* 鞑靼斯坦地名 ⋅ 问答 ⋅ RAG ⋅ 提取式阅读 ⋅ 混合搜索 ⋅ 语义嵌入 ⋅ 地理空间分析 ⋅ 双语数据集 ⋅ 鞑靼语 ⋅ 俄语 ⋅ XLM-RoBERTa ⋅ 多语言 E5 ⋅ 自然语言处理
## 1 引言
地理名称是空间数据基础设施的基本组成部分,在制图学、导航、区域治理和数字人文研究中发挥着关键作用(Suleymanov et al., 2021 (https://arxiv.org/html/2605.05962#bib.bib1); Galimov et al., 2023 (https://arxiv.org/html/2605.05962#bib.bib2))。在鞑靼斯坦共和国等多语言地区,俄语和鞑靼语均为官方国家语言,地名同时在两种语言代码中发挥作用,并积累了丰富的词源、历史和方言学信息。这一特征使鞑靼斯坦地名成为一个极具价值但难以处理的信息资源。传统的地理空间资源(GeoNames, OpenStreetMap)提供基本的坐标和分类数据;然而,它们缺乏深入的语言学和词源学细节,且并未设计用于适应地理术语同义词(“selo” – “derevnya” [村庄],“reka” – “pritok” [河流 – 支流])和同一对象的多语言拼写变体的语义搜索(Rehurek and Sojka, 2006 (https://arxiv.org/html/2605.05962#bib.bib3))。
与此同时,过去十年见证了鞑靼语计算处理的显著进步:创建了代表性文本语料库(24 (https://arxiv.org/html/2605.05962#bib.bib4); 28 (https://arxiv.org/html/2605.05962#bib.bib5); 16 (https://arxiv.org/html/2605.05962#bib.bib6)),开发了形态分析系统(Gilmullin and Gataullin, 2017 (https://arxiv.org/html/2605.05962#bib.bib7))和分词工具(Arabov, 2026b (https://arxiv.org/html/2605.05962#bib.bib8)),并提出了语义标注方法(Mukhamedshin et al., 2025 (https://arxiv.org/html/2605.05962#bib.bib9); Mindubaev and Gatiatullin, 2024 (https://arxiv.org/html/2605.05962#bib.bib10))以及构建分布式词和文档表示的方法(Arabov, 2026a (https://arxiv.org/html/2605.05962#bib.bib11); Gafarov et al., 2025 (https://arxiv.org/html/2605.05962#bib.bib12))。然而,直到目前,专门考虑地名特异性的问答数据集仍然缺失。现有的 QA 集合(SQuAD, SberQuAD 及其俄语对应版本)主要针对新闻和百科全书文本,并未涵盖包含坐标、对象类型和词源描述的结构化地理信息。
同时,“梅沙河位于何处?”、“兰特马克村的坐标是多少?”以及“卡班湖为何得名?”这类查询对于地理服务和教育平台的用户来说是自然的。支撑检索增强生成(RAG)的现代生成模型需要可靠的检索组件来提供相关上下文。在地理搜索领域,将从多语言 Transformer(多语言 E5 (Liang et al., 2022 (https://arxiv.org/html/2605.05962#bib.bib13)),XLM-RoBERTa (Conneau et al., 2020 (https://arxiv.org/html/2605.05962#bib.bib14)))获得的密集语义嵌入与地理空间排序和过滤相结合,具有特别重要的意义。然而,将这些方法集成到多语境地名数据中,特别是结合随后的提取式阅读,仍处于探索不足的状态。所确定的差距——即在双语环境中既缺乏数据集,也缺乏用于地理查询的端到端问答架构——决定了本研究的相关性。
## 2 相关工作
**鞑靼语的地名数据与资源。** GeoNames 和 OpenStreetMap 等国际项目提供开放的坐标和属性信息;然而,它们不包含学术人名学研究所必需详细词源和语言学数据(14 (https://arxiv.org/html/2605.05962#bib.bib15))。关于鞑靼斯坦地名的学术著作(Garipova, Sattarov, Äkhmätÿanov 的词典)已在“鞑靼斯坦地名”门户网站上部分数字化,但缺乏机器可读的应用程序编程接口。在本研究的框架内,作者收集并公开发布了一个结构化数据集,包含 9,688 条记录,具有俄语和鞑靼语名称、对象类型、词源以及 93% 条目的坐标参照(TatarNLPWorld, (https://arxiv.org/html/2605.05962#bib.bib16));正是这个数据集构成了本工作的实证基础。
**鞑靼语自动处理工具。** 对于鞑靼语,已开发出通用语料库(24 (https://arxiv.org/html/2605.05962#bib.bib4); 28 (https://arxiv.org/html/2605.05962#bib.bib5); 16 (https://arxiv.org/html/2605.05962#bib.bib6))、形态分析系统(Gilmullin and Gataullin, 2017 (https://arxiv.org/html/2605.05962#bib.bib7))、分词器(Arabov, 2026b (https://arxiv.org/html/2605.05962#bib.bib8)),以及基于知识图谱(Mukhamedshin et al., 2025 (https://arxiv.org/html/2605.05962#bib.bib9))和机器学习(Mindubaev and Gatiatullin, 2024 (https://arxiv.org/html/2605.05962#bib.bib10))的语义标注方法。已创建用于构建词和文档向量表示的软件解决方案(Arabov, 2026a (https://arxiv.org/html/2605.05962#bib.bib11); Gafarov et al., 2025 (https://arxiv.org/html/2605.05962#bib.bib12))。所有列出的资源均整合在 Hugging Face 平台上的 TatarNLPWorld 组织中,确保实验的可重复性(TatarNLPWorld, (https://arxiv.org/html/2605.05962#bib.bib16))。
**语义与地理空间搜索。** 经典的词汇方法如 BM25(Rehurek and Sojka, 2006 (https://arxiv.org/html/2605.05962#bib.bib3))难以处理跨语言和同义词查询。Transformer 架构的发展导致了密集检索模型的出现。E5 家族(Liang et al., 2022 (https://arxiv.org/html/2605.05962#bib.bib13))在多语言集合上使用对比损失函数进行训练,能够将文档和查询编码到统一的语义空间中。multilingual-e5-large 模型在低资源和多语言场景中表现出高效性(Conneau et al., 2020 (https://arxiv.org/html/2605.05962#bib.bib14); Schweter and Tekir, 2020 (https://arxiv.org/html/2605.05962#bib.bib17))。与此同时,地理信息学采用空间索引(KD-trees (Bentley, 1975 (https://arxiv.org/html/2605.05962#bib.bib18)),R-trees)和考虑地球曲率的度量(Haversine 距离 (Sinnott, 1984 (https://arxiv.org/html/2605.05962#bib.bib19)))。一些工作(Galimov et al., 2023 (https://arxiv.org/html/2605.05962#bib.bib2); Burnashev et al., 2025 (https://arxiv.org/html/2605.05962#bib.bib20))提出了将模糊逻辑与空间数据相结合的地理语言系统用于方言分析;然而,它们并未利用密集嵌入。结合文本和地理相关性的混合方法已成功应用于推荐服务和兴趣点搜索,但此类解决方案此前未针对具有详细词源归属的多语境地名进行过研究。
**问答系统与提取式阅读。** 对于提取式 QA 任务,SQuAD(Rajpurkar et al., 2016 (https://arxiv.org/html/2605.05962#bib.bib21))及其多语言版本已成为事实上的标准数据集。俄语对应版本,如 SberQuAD(Efimov and others, 2020 (https://arxiv.org/html/2605.05962#bib.bib22)),主要面向新闻和百科全书文本,不包含带有坐标的结构化地理数据。更广泛的俄语诊断基准,特别是 Russian SuperGLUE(Fenogenova et al., 2021 (https://arxiv.org/html/2605.05962#bib.bib28)),能够评估语言理解的多个方面,但也未包括需要提取数值坐标和词源信息的任务。在模型方面,基于 BERT 的架构处于领先地位:RuBERT(Devlin et al., 2019 (https://arxiv.org/html/2605.05962#bib.bib23))(在俄语文本上进一步预训练)和多语言 XLM-RoBERTa(Conneau et al., 2020 (https://arxiv.org/html/2605.05962#bib.bib14)),后者在一百种语言上进行了训练。后者在识别嵌套命名实体(包括地理实体)方面展示了优异的结果,例如在俄语竞赛 RuNNE-2022(Artemova et al., 2022 (https://arxiv.org/html/2605.05962#bib.bib29))中得到证实。生成式 T5 模型(Raffel et al., 2020 (https://arxiv.org/html/2605.05962#bib.bib24))也被应用,但通常是在答案生成设置中。最近实验揭示的单语模型的一个重大局限性(Chourey et al., 2022 (https://arxiv.org/html/2605.05962#bib.bib25))是由于 WordPiece 分词特性以及训练集中相关示例的短缺,导致其无法处理数值坐标。相比之下,采用 SentencePiece 的多语言模型成功提取数值序列。迄今为止,尚未提出结合结构化地理信息与词源和坐标组件的专用 QA 基准。
因此,文献综述证实了离散组件的存在(鞑靼语资源、密集检索模型、地理空间过滤方法、提取式阅读模型);然而,缺乏将它们集成到一个统一系统中,以在俄语或鞑靼语中找到所需地名并为任意地理查询提取精确答案的能力。本工作旨在填补这一空白。
## 3 方法论
### 3.1 混合检索:架构与方法
检索组件的目的是接收文本查询 $q$,可选地伴随地理点 $(lat_q, lon_q)$ ($\textit{lat}_{q}, \textit{lon}_{q}$) 和半径 $R$,并从一组文档 $D$ 中生成最相关的 $k$ 个地名的排名列表,每个文档都配备有坐标。该架构包含两个并行的索引阶段——语义和空间——它们在查询处理期间通过混合排序程序进行交互。
**语义索引。** 为了表示文档的内容部分,采用多语言编码器模型 intfloat/multilingual-e5-large(Liang et al., 2022 (https://arxiv.org/html/2605.05962#bib.bib13)),它将上下文字段 $context$ 转换为 1024 维的密集向量。选择该模型是因为它在跨语言搜索中展示了最先进的结果,并支持俄语和鞑靼语。所有文档嵌入均归一化为单位 $L_2$ 范数,允许通过点积评估余弦相似度。计算使用 GPU 以 32 个文档的批次进行。为了高效的最近邻搜索,使用 FAISS 库(Johnson et al., 2019 (https://arxiv.org/html/2605.05962#bib.bib26))构建扁平内积索引(IndexFlatIP);当有 GPU 加速器时,索引放置在 GPU 内存中。查询处理简化为使用相同模型编码其文本,$L_2$ 归一化查询向量,并提取具有最大点积的前 $k$ 个文档。所得数量 $\textit{sem\_score}(i) = \langle e_q, e_i \rangle$ 被解释为文档 $i$ 的语义相关性。
**地理空间过滤与排序。** 空间选择在两遍中实现。在第一阶段,围绕查询点构建边界框:$\Delta \textit{lat} = R/111320, \quad \Delta \textit{lon} = R/(111320 \cdot \cos(\phi))$,其中 $\phi$ 是以弧度为单位的纬度,$R$ 是搜索半径。坐标落入该区域的对象被声明为候选者。然后,对于每个候选者,计算精确的 Haversine 距离(Sinnott, 1984 (https://arxiv.org/html/2605.05962#bib.bib19)),并过滤掉距离超过 $R$ 的那些对象。剩余候选者的空间得分由距离的指数衰减函数确定:$\textit{geo\_score}(i) = \exp\left(-\frac{d_i}{R}\right)$。为了加速过滤阶段,在语料库准备期间,在所有文档的坐标上构建 KD-tree(Bentley, 1975 (https://arxiv.org/html/2605.05962#bib.bib18)),从而能够在对数时间内检索给定邻域内的对象子集。
**组合相关性。** 最终相关性形成归一化语义得分和空间得分的加权和。语义得分使用通过地理过滤器的候选者中的最小-最大缩放进行归一化:
$\textit{sem\_norm}(i) = \frac{\textit{sem\_score}(i) - \min_{\textit{sem}}}{\max_{\textit{sem}} - \min_{\textit{sem}}}$,
在退化情况下(当差异接近相似文章
HybridRAG-BN:一种用于孟加拉语KBQA的检索增强框架与微调验证
本文提出了HybridRAG-BN,一种用于孟加拉语知识库问答的检索增强框架,该框架结合了混合检索、基于Gemma的生成以及LoRA微调的验证,以F1分数0.71654和0.72912获得第一名。
面向低资源语言的文本去毒化系统Tatoxa:以鞑靼语为例
介绍了Tatoxa,一个用于鞑靼语文本去毒化的最先进系统,优于现有的大语言模型。引入了一个新数据集,并表明跨语言迁移的效果比使用原生数据差。
AB-RAG:自适应预算检索增强生成用于可靠问答
AB-RAG是一种无需训练、骨干无关的框架,通过估计答案置信度自适应地检索段落以进行问答,在多个骨干和数据集上提高了效率和准确性。
少即是多:通过多信号晚期融合实现无图谱多模态RAG
TrioRAG是一个无图谱的多模态RAG框架,使用多信号晚期融合来实现高效的跨文档问答,性能匹配或超越基于图谱的系统。此外,它引入了AutoQA,一个基于网络图像的汽车基准测试。
通过针对性检索器微调实现乌兹别克语法律RAG的云端和本地部署
本文描述了构建和部署乌兹别克语检索增强生成(RAG)法律助手在云端和本地环境中的过程,创建领域基准,并发布微调嵌入器UTE-1,以推动低资源语言的法律自然语言处理(NLP)。