通过二次嵌入实现位置感知的语言模型
摘要
本文提出了一种轻量级、模型无关的方法,通过利用位置数据增强嵌入来提升语言模型的地理空间感知能力,从而在保持标准NLP性能的同时改善空间对齐。
arXiv:2609.00454v1 公告类型:新
摘要:预训练的基于transformer的语言模型在广泛的NLP任务中表现出色,但在编码地理语义方面存在局限,导致对地名和空间实体的表示不佳。在这项工作中,我们提出了一种轻量级、模型无关的方法,通过注入地理空间感知到预训练嵌入中,而无需修改分词器或进行昂贵的重训练。我们的方法通过结合地名及其对应的经纬度来增强输入表示的结构化地理信号,并采用位置聚焦掩蔽以更好地将文本表示与真实世界的空间关系对齐。这种设计使模型能够在保留现有语义和句法知识的同时融入地理空间上下文。实验结果表明,在保持标准NLP基准(如GLUE)上可比性能的同时,地理空间对齐得到了显著提升。该方法计算效率高,仅需几分钟的额外训练,并且在多个模型架构和规模上具有泛化能力。
查看缓存全文
缓存时间: 2026/09/02 05:52
# 通过二次嵌入实现位置感知语言模型 来源:https://arxiv.org/html/2609.00454 ###### 摘要 基于预训练Transformer的语言模型在各种NLP任务中表现强劲,但在编码地理定位语义方面仍存在局限性,导致对地名和空间实体的表示不够理想。本文提出一种轻量级、与模型无关的方法,能在不修改分词器或进行昂贵重训练的情况下,将地理空间感知注入预训练嵌入中。我们的方法通过结合地名及其对应的经纬度,用结构化地理信号增强输入表示,并采用位置聚焦掩码机制,更好地使文本表示与现实空间关系对齐。这种设计使模型能在保留现有语义和句法知识的同时,融入地理空间上下文。实验结果表明,在GLUE等标准NLP基准测试性能相当的前提下,地理空间对齐性得到显著提升。该方法计算效率高,仅需数分钟额外训练,且能泛化至多种模型架构与规模。 ###### 关键词:语言模型 掩码语言建模(MLM) 地理位置 ## 1 引言 BERT[3 (https://arxiv.org/html/2609.00454#bib.bib1)]和RoBERTa[11 (https://arxiv.org/html/2609.00454#bib.bib3)]等预训练语言模型的最新进展,展现了捕捉词语间语义和句法关系的卓越能力。尽管如此,这些模型在处理需要额外上下文基础的专业领域时往往表现不佳。其中,地理定位感知对于理解空间关系以及提供情境相关输出(如路线描述、定向广告和本地化搜索结果)至关重要。然而,现有模型在有效编码城市、地标或区域等实体的地理语义方面仍存在不足。 参见图1说明:城市实际地理位置(左)与其在BERT嵌入空间中对应的t-SNE可视化(右)比较。可视化显示,地理距离遥远的城市在嵌入空间中常常距离很近,凸显了预训练语言模型缺乏地理空间感知的问题。 如图1 (https://arxiv.org/html/2609.00454#S1.F1)所示,城市名称的嵌入在潜在空间中结构不佳,这主要是由于语言模型中缺乏明确的地理基础。例如,萨尔布吕肯和萨尔茨堡在BERT嵌入空间中距离很近,尽管它们在地理上相距甚远。这种差异凸显了模型反映现实空间关系能力的不足。这一局限性的成因部分在于分词过程。虽然子词分词对一般文本表示很有效,但它会分割命名实体,削弱其独特的语义身份。例如,城市名“英戈尔施塔特”被拆分为子词“ing”、“#ols”和“#tadt”,导致部分嵌入无法将该实体作为一个连贯的整体概念来捕捉。当不同地点拥有相同名称时(例如法国巴黎与美国得克萨斯州巴黎),问题会加剧,因为模型缺乏地理空间信息来区分它们。因此,不同实体的嵌入常坍缩到向量空间的同一区域,错误地表示了它们之间的相对邻近性。 现有的融合地理信息方法通常需要架构修改或昂贵的再训练流程,这限制了其可扩展性和实际适用性[9 (https://arxiv.org/html/2609.00454#bib.bib13), 10 (https://arxiv.org/html/2609.00454#bib.bib14), 4 (https://arxiv.org/html/2609.00454#bib.bib15)]。一个看似直接的解决方案是扩大分词器的词表以包含所有地名。然而,这种方法并不实用,因为它会显著增加模型大小和训练成本。例如,仅向BERT-base词表添加1,000个新词,嵌入参数就增加约3.2%。此外,再训练此类模型以将新词集成到其表示空间中,计算成本高昂,且可能降低下游NLP任务的性能。 为了解决这些限制,我们提出一种轻量级且与模型无关的方法,用于将地理信息集成到预训练嵌入中,无需修改分词器或进行大规模再训练。我们的方法向嵌入空间注入结构化地理空间信号,使表示与现实空间关系对齐,同时保留现有的语言知识。结果,模型以最小的计算开销获得了位置感知能力,且不损失下游性能。 本工作的主要贡献如下: - •我们提出一种轻量级方法,将地理定位信息集成到预训练语言模型嵌入中,无需修改分词器或词表。 - •我们的方法用结构化地理信号丰富嵌入空间,同时保留现有的句法和语义知识。 - •我们证明在不降低GLUE等下游基准性能的前提下,地理空间感知能力得到显著提升。 - •我们还验证了该方法在不同模型架构、规模和多语言设置下的泛化能力。 ## 2 相关工作 先前研究表明,将地理信息融入语言模型可以改善空间实体的表示,并提升地理文本理解任务的表现[9 (https://arxiv.org/html/2609.00454#bib.bib13), 10 (https://arxiv.org/html/2609.00454#bib.bib14), 4 (https://arxiv.org/html/2609.00454#bib.bib15), 14 (https://arxiv.org/html/2609.00454#bib.bib16)]。SpaBERT[9 (https://arxiv.org/html/2609.00454#bib.bib13)]在掩码语言建模之外,采用了掩码实体预测目标来捕捉实体间的地理关系。GeoLM[10 (https://arxiv.org/html/2609.00454#bib.bib14)]将掩码语言建模与对比学习相结合,以联合建模语言和地理信息。类似地,MGeo[4 (https://arxiv.org/html/2609.00454#bib.bib15)]引入了一种多模态架构,配备了专门的地理编码器用于查询与兴趣点匹配。尽管这些方法展示了地理空间建模的益处,但它们依赖于专门的架构、额外的学习目标或大量训练来获取位置感知能力。相比之下,我们的方法通过轻量级的输入增强将地理信号注入预训练语言模型,无需修改分词器,无需在掩码语言建模之外增加额外学习目标,且仅需短时间训练,同时保留了一般的语义知识。 ## 3 方法 参见图2说明:将地理空间信息融入预训练语言模型嵌入的提议框架概述。给定包含位置实体的输入句子,我们构建一个二次嵌入来编码相应的地理信息(城市名、纬度和经度)。该信息通过特殊令牌(`<loc>`、`</loc>`和`<loc_sep>`)集成到输入序列中,将结构化的位置信号注入模型。训练过程中,我们采用两种掩码策略:(1)使用随机令牌掩码的标准掩码语言建模(MLM)(左图),以及(2)选择性掩码城市名称的位置聚焦掩码方案(右图)。模型被训练使用上下文和地理空间线索来恢复被掩码的实体,从而获得改进的位置感知表示。 ### 3.1 数据集生成 我们使用从德国长途火车时刻表的一般公交运输馈送规范中衍生的信息,构建了一个合成数据集[111]。预处理后,我们提取了820个对应火车站的唯一地点名称,作为地理实体。为生成自然语言训练数据,我们使用两个大型语言模型:Mistral[7 (https://arxiv.org/html/2609.00454#bib.bib5), 6 (https://arxiv.org/html/2609.00454#bib.bib6)]和LLaMA 3[5 (https://arxiv.org/html/2609.00454#bib.bib7)],生成包含站名、到达和出发时间以及其他上下文细节的旅程描述。最终得到一个包含5,965个文本样本、总计62,758次位置实体出现的语料库。除了文本数据,我们将每个地点与其对应的经纬度坐标关联,形成一个结构化的地理空间参考,后续将其纳入训练过程。 ### 3.2 使用二次嵌入进行持续预训练 为实现地理空间感知,我们使用三个特殊令牌:`<loc>`(位置开始)、`</loc>`(位置结束)和`<loc_sep>`(位置分隔符)。这些令牌明确定义了输入序列中特定位置信息的边界。我们为每个`stop_name`(站点名称)与其地理坐标(纬度和经度)之间构建一个映射,我们称之为二次嵌入。与纯粹从文本中学习的标准词元嵌入不同,这些嵌入编码了结构化的空间信息,在训练过程中作为辅助信号。 分词时,每个位置实体的出现都被增强为以下结构化格式:`<loc> stop_name <loc_sep> latitude <loc_sep> longitude </loc>`。这种表示直接将文本和基于坐标的信息注入模型的输入流,使模型能够将实体与其对应的空间属性关联起来。 我们使用掩码语言建模(MLM)目标进行持续预训练,并采用两种不同的掩码策略(图2 (https://arxiv.org/html/2609.00454#S3.F2)): - •随机掩码(R):遵循标准的BERT训练流程[3 (https://arxiv.org/html/2609.00454#bib.bib1)],随机遮蔽一部分词元。 - •位置掩码(L):我们专门遮蔽`<loc>`块内的`stop_name`词元,同时保留相关的纬度和经度信息。模型被训练使用上下文和地理空间线索来预测被掩码的位置实体。这一针对性目标鼓励文本表示与其底层地理结构对齐。 我们分别使用每种掩码策略训练模型,并比较它们在诱导地理空间感知方面的有效性。 ## 4 实验细节 ### 4.1 评估 我们方法的首要目标是丰富预训练语言模型嵌入的地理定位信息,同时保留其现有的语义知识。为验证位置感知预训练不会削弱语言能力,我们在GLUE基准测试[15 (https://arxiv.org/html/2609.00454#bib.bib11)]上评估模型。我们报告MRPC的F1分数、STS-B的皮尔逊相关系数以及其余任务的准确率。与基线相当的性能表明,注入的地理空间信息没有损害一般语言理解能力。 为评估位置感知,我们分析了嵌入空间中的距离与现实世界地理距离之间的一致性。我们使用哈弗辛公式基于经纬度坐标计算地点间的成对地理距离,并将其视为真实距离矩阵。由于模型嵌入位于高维空间,我们使用欧几里得距离和余弦相似度来衡量位置嵌入间的距离。我们在真实数据上的实证评估表明,基于嵌入的距离与哈弗辛距离之间存在强相关性,表明欧几里得距离和余弦相似度是嵌入空间中地理距离的可靠代理指标。然后,我们计算地理距离矩阵与相应的嵌入距离矩阵之间的皮尔逊和斯皮尔曼相关系数。更高的相关性表明学习到的嵌入空间更好地保留了现实世界的的空间关系。 ### 4.2 实现细节 我们在第3.1节描述的合成数据集上训练模型,训练25个epoch,批次大小为60,学习率为1×10^-4,使用AdamW优化器。我们使用Hugging Face Transformers库[16 (https://arxiv.org/html/2609.00454#bib.bib12)]中的预训练模型。对于GLUE任务,微调最多50个epoch,批次大小为256,学习率为1×10^-5,使用bfloat16精度。我们采用早停法,耐心值为5,以防止过拟合。除非另有说明,所有实验均使用每个预训练模型的基础变体进行。位置感知训练在单块NVIDIA H100 GPU上约15分钟内完成,证明了所提方法的计算效率。 表1:基线模型与位置感知模型在多个架构上的GLUE基准测试结果。其中R和L分别表示使用随机掩码和位置特定掩码训练的模型。结果表明,位置感知训练在保持一般语言性能的同时,实现了相当或略有提升的分数。 ## 5 结果与讨论 表1 (https://arxiv.org/html/2609.00454#S4.T1)展示了我们的位置感知模型在多个架构上的GLUE基准测试结果。总体而言,结果表明该方法保留了通用语言理解能力,所有任务的性能与基线预训练模型相当。 仔细观察表1 (https://arxiv.org/html/2609.00454#S4.T1)可以看出,位置感知变体常常匹配或略微超越基线性能。例如,BERTbase在使用位置掩码后,性能从81.16提升至81.96;而ALBERT则从81.44显著提升至82.07。这些改进表明,注入地理空间信息不会干扰语言知识,并且在某些情况下能提供额外的有用信号。 在不同架构中,位置特定掩码(L)相比随机掩码(R)倾向于带来更一致的提升,特别是对于BERT[3 (https://arxiv.org/html/2609.00454#bib.bib1)]和ALBERT[8 (https://arxiv.org/html/2609.00454#bib.bib9)]。这表明,明确掩码位置实体为对齐文本与地理空间表示创造了一个更强且更具针对性的学习信号。相比之下,随机掩码主要保持了基线性能,未带来持续改进。 #### 嵌入分析 为评估位置信息如何被编码,我们比较了两种嵌入提取策略:`[CLS]`词元和所有词元的平均池化。虽然两者都能捕捉位置感知信号,但平均池化始终表现出与地理结构更强的对齐性。例如,在RoBERTa中,皮尔逊相关系数从0.2997(基线)提升至使用`[CLS]`时的0.3343,使用平均嵌入时进一步提升至0.4503。这表明地理空间信息分布在各个词元中,而非集中在单个表示中。 #### 分词器的影响 我们观察到分词器的选择显著影响位置感知适配的有效性。基于WordPiece分词的模型(例如BERT和DistilBERT)表现出更
相似文章
大型语言模型中地理条件作用的意外影响
本文识别并分析了LLM中的“位置泄漏”现象,即地理条件作用导致模型即使在与位置无关的提示中也过度依赖位置元数据,揭示了超出内容的结构性条件作用效应。
地球嵌入中有什么?位置编码器的可解释性分析
本文介绍了将地理隐式神经表示中的位置嵌入分解为人类可解释特征的方法,例如稀疏潜在概念、自然语言概念和视觉特征,揭示了森林和城市区域等地理结构。
从视频中学习几何表征以赋予多模态大语言模型空间智能
GeoVR 通过利用多个几何目标从3D基础模型中蒸馏几何知识,重构多模态大语言模型的语义潜空间,从而增强其3D感知能力。
基于Wasserstein重心的交互场在空间因子模型中的应用:来自语言模型表示的证据
本文提出了一种使用Wasserstein重心重建语言模型嵌入场的方法,用于预测空间因子模型中的同伴错配惩罚,其性能优于常规加权方案。
大型语言模型的地理空间概念探测:抽象性、组合性与接地
本文引入了一个以概念为中心的基准,用于探测LLM对方向、距离和拓扑等地理空间概念的理解,测试不同模型架构和规模下的抽象性、组合性与接地性。研究结果揭示了当前LLM在概念理解上的明显局限。