使用生物标本记录对非地名录地名进行地理参照

arXiv cs.CL 论文

摘要

本文介绍了对生物标本记录中发现的历史和方言地名(这些地名不在当前地名录中)进行地理参照的方法,比较了确定性方法、概率方法和基于LLM的方法。概率推理实现了最高精度,而LLMs提供了有竞争力但精度稍低的估计。

arXiv:2608.06884v1 公告类型:新 摘要:自然历史机构收集的生物标本记录构成了时间地理知识的丰富来源,捕捉了不同时期记录的区域景观的生物多样性信息。本研究利用艾伦植物标本馆(新西兰)的数字化数据,识别出这些标本地点描述中未出现在当前地名录中的地名;我们称这些为非地名录地名(NGPs)。这些地名通常是历史的、方言的或口语化的,并且在采集时被用作地标来描述标本的位置。然后,我们研究了仅利用标本记录中可用有限信息对NGPs进行地理参照的问题。为了解决这个问题,我们利用同一地名在不同标本记录中的重复出现,这些记录具有不同的标本位置和空间关系术语,提取并反转这些关系以推导出对NGP位置的约束。该方法在确定性方法、概率方法和基于LLM的方法中实例化,从而能够比较分析它们在基于文本的空间推断中的优势和局限性。在伪NGP基准测试上,概率推理实现了最高精度(中位误差1.43公里;A@1 km 36%),而LLM给出了有竞争力但精度稍低的估计(中位误差1.80公里;A@1 km 31%),这表明,尽管LLM取得了进步,但在需要高空间精度时,传统建模仍然具有优势。
查看原文
查看缓存全文

缓存时间: 2026/08/10 08:04

# 利用生物标本记录对未收录于地名词典的地名进行地理参考

来源: https://arxiv.org/html/2608.06884

数学与计算科学学院,梅西大学,新西兰奥克兰  
[email protected]  
https://orcid.org/0009-0000-8088-6646

数学与计算科学学院,梅西大学,新西兰奥克兰  
[email protected]  
https://orcid.org/0000-0003-0701-0204

数学与计算科学学院,梅西大学,新西兰奥克兰  
[email protected]  
https://orcid.org/0000-0002-5828-6430

联合灾害研究中心,梅西大学,新西兰惠灵顿  
[email protected]  
https://orcid.org/0000-0002-5608-6558

计算机科学与信息学院,卡迪夫大学,英国  
[email protected]  
https://orcid.org/0000-0001-6847-7575

\Copyright  
Aneesha Fernando, Surangika Ranathunga, Kristin Stock, Raj Prasanna, and Christopher B. Jones

\ccsdesc[500]Information systems Geographic information systems  
\ccsdesc[500]Computing methodologies Natural language processing  
\ccsdesc[500]Mathematics of computing Probabilistic inference problems

\supplementdetails  
数据集: https://doi.org/10.6084/m9.figshare.32397048

\funding  
本工作得到了新西兰商业、创新与就业部智慧创意基金(基金编号 MAUX2104)的支持。

\EventEditors  
Sabine Timpf, Gabriele Filomena, Armand Kapaj, Rui Zhu, Nicholas Giudice, and Ed Manley

\EventNoEds 6  
\EventLongTitle 第十七届空间信息理论国际会议(COSIT 2026)  
\EventShortTitle COSIT 2026  
\EventAcronym COSIT  
\EventYear 2026  
\EventDate 2026年9月22–25日  
\EventLocation 英国约克  
\EventLogo  
\SeriesVolume 393  
\ArticleNo 8

Surangika Ranathunga  
Kristin Stock  
Raj Prasanna  
Christopher B. Jones

###### 摘要

自然历史机构收集的生物标本记录是丰富的时间地理知识来源,记录了不同时期观测到的区域景观生物多样性信息。本研究利用新西兰艾伦植物标本馆(Allan Herbarium)的数字化数据,识别了这些标本地点描述中当前地名词典所缺失的地名;我们将这些地名称为未收录地名(non-gazetteer place names,NGPs)。这些地名通常具有历史性、地方性或者口语化特征,当时被用作地标来描述标本的采集地点。然后,我们研究了仅利用标本记录中有限的可用信息来对这些未收录地名进行地理参考的问题。为了解决这一问题,我们利用了同一地名在多个标本记录中反复出现的情况,这些记录对应不同的标本位置和空间关系术语。我们提取并反转这些关系,从而推导出对未收录地名位置的约束。该方法以确定性方法、概率方法和基于大语言模型(LLM)的方法进行实例化,从而对它们在进行基于文本的空间推断时的优缺点进行比较分析。在一个伪未收录地名基准测试上,概率推断取得了最高的精度(中位误差 1.43 公里;A@1 km 36%),而大语言模型给出了具有竞争力但精度稍低的估计(中位误差 1.80 公里;A@1 km 31%),这表明尽管大语言模型已有进展,但当需要高空间精度时,传统建模方法仍然具有优势。

###### 关键词:  
未收录地名词典的地名、地名词典、地名、地理参考、空间关系建模、大语言模型

## 1 引言

生物标本采集记录的内容和元数据是一种丰富但未被充分利用的地理信息来源。这些记录通常包含地点描述,由博物馆和植物标本馆等自然历史机构以数字化方式常规记录[chapman_georeferencing_2020,wieczorek_point-radius_2004]。一个典型的地点描述会指明生物标本的采集位置,通常至少包含一个地名,往往涉及多个地名,以及用于描述标本相对于这些地点位置的空间关系术语。这些记录跨越一个多世纪,记录了采集当时的地理信息。因此,这些描述中记录的某些地名并不存在于当前地名词典中,可归类为未收录地名(NGP)。我们将未收录地名定义为完全不存在于现有地名词典中的地名,包括别名和其他变体,因此在这些地名词典中没有相应的空间范围。它们缺失的原因可能源于地名的历时变化、非正式或当地公认名称的使用,或者现有地名词典对某些地区和要素类型覆盖不完整[hill2009georeferencing]。鉴于全球范围内可获得数百万条此类记录,这些描述代表了一个重要且基本未被开发的地理知识来源。将这些地名连同其推断出的空间范围纳入数字地名词典,有可能改善空间参考覆盖范围,并支持更稳健的地名解析,不仅用于标本地理参考,还可用于更广泛的地理信息检索应用和分析。

在本研究中,我们重点关注利用生物标本记录中可用的信息对未收录地名进行地理参考。生物标本记录中包含的信息包括自由文本地点描述(指示标本采集地点)、采集地点的坐标、栖息地描述,以及州或省等更高级别的行政单元¹¹¹例如,艾伦植物标本馆标本记录:https://scd.landcareresearch.co.nz/Specimen/CHR%20508209。这些要素共同用于对地点描述中的地名进行地理参考和消歧,其中标本坐标作为重要的空间锚点,约束了相对空间关系的解释,并减少了未知地名推断位置的不确定性。生物标本采集实践还提供了一种被证明很有价值的空间冗余来源。在野外工作中,采集者通常会沿着特定路线行进,并在有限的地理区域内记录多个标本。因此,许多标本的地点描述中共享共同的地理特征和地名。在现代采集流程中,标本坐标通常在野外记录,随后由地理参考人员验证。然而,在历史数据集中,坐标也可能是根据地点描述回溯性赋予的,因此坐标可能存在一定程度的不确定性。此外,相当一部分记录(尤其是在全球定位系统(GPS)广泛使用之前采集的记录)仍未完成地理参考,现有地理参考的质量参差不齐[marcer2021quality]。为了弥补这一空白,人们开发了多种地理参考方法,从使用GIS工具和地图进行耗时的手动解读[wieczorek_point-radius_2004],到基于规则技术的自动化方法[van_erp_georeferencing_2015]、机器学习[scott_automated_2021]以及现代大语言模型(LLM)[Fernando21012026]。

在此背景之上,我们的方法利用了数字化的标本记录,并利用同一个未收录地名在多个地点描述中的重复出现作为空间证据来源。当一个未知地名出现在多个描述中时,每条记录中表达的空间约束会被结合起来,以推断其最可能的位置。表1(https://arxiv.org/html/2608.06884#S1.T1)展示了该地名在多个地点描述中重复出现的模式。未收录地名*Cabstand*²²²新西兰保育部发布的出版物《班克斯半岛保育步道》[doc_banks_peninsula_walks]将"Cabstand"称为班克斯半岛峰会路上一个交叉口的名称。出现在四条独立的地点描述中,每条都与不同的标本以及相应标本位置的坐标相关联。每条描述都使用了诸如"以北"、"以南"或"东南"等相对空间关系术语来表述标本相对于"Cabstand"的位置,从而对其位置施加了定性约束。综合来看,这些多次引用施加了互补的空间约束,可以通过反转(逆转)空间关系来推断未收录地名的位置。相关的标本坐标充当空间锚点,界定了"Cabstand"必须位于的合理区域。通过将反转的相对方向术语与标本位置的空间分布相结合,即使在没有明确地名词典条目的情况下,也可以近似估计"Cabstand"的位置。

为了将这一想法付诸实践,我们研究了三种互补的地理参考方法。第一种是确定性方法,借鉴了Chen等人[chen_georeferencing_2018]的形式化搜索空间模型,通过建模地点描述中相对于标本坐标所表达的空间关系约束,为未收录地名构建近似位置区域(Approximate Location Region,ALR)。当地名在多个描述中出现时,它们各自约束区域的交集会逐步缩小ALR,从而产生越来越精确的候选位置。第二种方法采用概率框架,其中空间关系被表示为以标本坐标和参考地名为条件的似然函数。多次出现被聚合起来,从最终的空间概率分布中估计最可能的位置,用连续表示取代了离散的几何边界。第三种方法探索了基于大语言模型(LLM)的方法,即将地点描述和标本坐标作为提示输入,要求LLM结合文本和数字线索来推断未收录地名位置。这使我们能够评估LLM在多大程度上能够整合空间语言和坐标信息用于地理参考。在这三种方法中,概率方法产生了最精确的结果,尽管其他方法也表现出了竞争力。据我们所知,这项研究是首次系统性地利用生物标本记录作为主要数据源来提取和地理参考未收录地名。本文提出的方法和结果证明了利用标本衍生的空间信息来丰富数字地名词典的可行性和价值。

本工作的贡献如下:

1. 我们证明了生物标本记录包含未收录于地名词典的地名,强调这些记录是长期以来未得到充分利用的地理信息来源。
2. 我们提出了一种数据驱动的策略,利用生物标本记录对未收录地名进行地理参考,即利用同一地名在不同标本地点描述中的多次出现,为未知位置推导空间约束。
3. 我们对基于文本的空间建模和未收录地名位置推断的确定性方法、概率方法和LLM方法进行了系统比较,评估了各自的优缺点。
4. 我们构建了一个新的基准数据集,用于评估来源于生物标本记录的地理参考方法,这些记录包含丰富的空间知识。

本文其余部分组织如下。第2节回顾相关工作,第3节详细介绍方法。第4节呈现结果,第5节讨论局限性和未来研究方向并得出结论。

表1:示例展示了多个标本地点描述如何指向同一个未收录地名(“Cabstand”),每条描述都附有独特的坐标,并通过不同的空间关系术语(例如,附近、以北、以南、东南)来描述未收录地名相对于标本位置的位置。

## 2 相关工作

本节回顾了与地名词典中缺失地名的地理参考相关的研究。首先概述了从文本描述中对地名进行地理参考的一般方法,这为研究问题提供了基础,然后考察了针对未收录地名的研究,阐明了该问题与一般地理参考的不同之处,并指出了文献中现有的空白。

自动化地理参考将文本描述或其他位置引用信息与地理坐标关联起来。虽然有些方法侧重于对整个文本文档进行地理参考,例如维基百科文章、新闻报道或社交媒体帖子[wikigeorefOlivier,han2014text],但另一些方法则专门关注对文本描述中提到的地名进行地理参考。后者通常涉及两个主要步骤:识别地名(地名识别)和确定其正确位置(地名消歧或地理编码)[liu_geoparsing_2022,wang_are_2019]。在许多应用中,这两个步骤都与地名词典密切相关:识别受益于名称列表,消歧则是从候选地名词典条目中进行选择。早期的地理参考方法将地名视为地名词典查询,并采用启发式消歧,偏好人口众多或行政上重要的地点[alex2019geoparsing,alex2016homing]。无监督模型通过仅使用地名词典数据来选择空间上一致的候选集合,从而改进了这一点[Kamalloo2018A]。然而,依赖地名词典的方法的一个根本局限性在于它们对地方性、口语化和细粒度地名的覆盖不完整[hill2009georeferencing,acheson2017quantitative,smart2010multi]。正如Wang等人[wang_are_2019]所观察到的,许多地理解析语料库将标注限制在城市级及以上,排除了街道名称或公园和纪念碑名称等细粒度地名。这些方法也难以解析现代地理数据库中已不存在的历史或过时名称[gritta2018s]。然而,这类名称经常出现在文学、档案和其他具有历史维度、领域特定的文本来源中[alex2019geoparsing]。为了克服这一问题,诸如TopoCluster等独立于地名词典的方法从大规模地理参考语料库(GeoWiki)中学习空间词分布,并根据上下文的 geographic overlap 来解析地名[DeLozier_Baldridge_London_2015]。深度学习方法用学习到的上下文表示取代了手工设计的启发式规则。对于地名识别,神经序列模型(例如BiLSTM-CRF和CNN–RNN混合模型)能够捕捉非正式拼写和噪声文本,其性能优于基于规则和仅依赖地名词典的系统[Aldana-Bobadilla2020Adaptive,Zhou2023TopoBERT:,2022Chinese]。对于地名消歧,神经模型要么根据上下文嵌入直接预测连续坐标,将地球视为回归曲面,要么将任务视为瓦片分类或共享嵌入学习,从而在严格的地名词典查找之外实现基于相似性的定位[Cardoso2021A,Fize2021Deep]。然而,这些方法依赖于大规模训练语料库,并且仍然预设目标与其训练分布中表示的地点相似。

大语言模型(LLM)正开始通过向语言表示注入更强大、更明确的地理知识来改变地名识别和消歧。地理空间基础变换……

相似文章