从位置短语到地理实体:人员搜索中的任务适应性检索

arXiv cs.AI 论文

摘要

本文提出了一种任务适应性检索方法,用于将自由形式的位置短语映射到人员搜索中的地理实体,采用提示不对称双编码器,提高了相关性,尤其是在非规范查询中,这在生产和基准评估中得到了证实。

arXiv:2608.28965v1 公告类型:新 摘要:人员搜索必须将自由形式的位置短语映射到用作结构化检索过滤器的地理实体。词汇标准化器能很好地处理规范名称,但对别名、拼写错误、大都市表述和同名歧义较为脆弱。我们将此任务制定为在固定本体上的分级、集值实体检索。我们确定了三个耦合的设计要求:区分保持身份的变化与依赖知识的别名,控制有效同名实体中的假阴性,以及将稳定变换与可变实体知识分离。我们通过一个带有校准别名支持、有界歧义感知负样本和可编辑实体文档的提示不对称双编码器来实现这些要求,支持局部更新而无需重新训练。 在固定的生产驱动开发基准和公开的GeoNames转移任务上,任务适应性比冻结编码器和标准令牌基线有显著改进。受控开发消融显示,专门监督超越标准任务微调和编码器缩放有所贡献。在GeoNames上,适应模型在零到中等字符重叠范围内提高了已知目标Recall@1,而字符n-gram在聚合Target Recall@5上保留了小优势。在分层生产挑战集上的盲人人类比较中,我们的模型将相关P@1从28.0%提高到46.0%(p=0.012)。固定查询端点估计在非规范查询上有所改善,并在频繁查询上保持接近对照;随机实时实验未检测到参与度下降。这些结果支持任务适应性地理实体检索作为当前基于分类标准化器的实用替代方案,在非规范查询上具有最大的相关性增益。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:44

# 从位置短语到地理实体:面向人物搜索的任务自适应检索
来源:https://arxiv.org/html/2608.28965

CCS:信息系统 检索模型与排序CCS:信息系统 用户与交互式检索CCS:计算方法学 学习潜在表示  
郑楚杰注:工作于LinkedIn期间完成。单位:LinkedIn,加利福尼亚州桑尼维尔市,美国  
徐嘉皓单位:LinkedIn,加利福尼亚州桑尼维尔市,美国  
切坦·博霍尔单位:LinkedIn,加利福尼亚州桑尼维尔市,美国邮箱:[yanbli@linkedin\.com](mailto:[email protected])  
张凌宇单位:LinkedIn,加利福尼亚州桑尼维尔市,美国  
普尼特·辛格·阿卢瓦利亚单位:LinkedIn,加利福尼亚州桑尼维尔市,美国  
凯文·阮单位:LinkedIn,加利福尼亚州桑尼维尔市,美国  
拉加万·穆图雷古纳坦单位:LinkedIn,加利福尼亚州桑尼维尔市,美国邮箱:[clzhang@linkedin\.com](mailto:[email protected])  
桑托什·萨辛德兰单位:LinkedIn,加利福尼亚州桑尼维尔市,美国  
萨钦·阿胡贾单位:LinkedIn,加利福尼亚州桑尼维尔市,美国  
费多尔·鲍里苏克注:通讯作者。单位:LinkedIn,加利福尼亚州桑尼维尔市,美国邮箱:[ssachindran@linkedin\.com](mailto:[email protected])

###### 摘要\。

人物搜索必须将自由格式的位置短语映射为用作结构化检索过滤器的地理实体。词汇标准化器能够很好地处理规范名称,但对于别名、拼写错误、大都市区表述以及同名歧义则显得脆弱。我们将此任务定义为在固定本体上进行的分级、集值实体检索。我们识别出三个相互关联的设计要求:区分保持身份的变异与依赖知识的别名、控制有效同名实体中的假阴性,以及分离稳定变换与可变的实体知识。我们在一个具有校准别名支持、有界歧义感知负例以及支持局部更新而无需重新训练的可编辑实体文档的提示非对称双编码器中实现了这些要求。

在一个固定的生产衍生开发基准和公开的GeoNames迁移任务中,任务自适应相较于冻结编码器和标准词元基线有显著提升。受控的开发消融研究表明,专门监督超越了标准任务微调和编码器规模扩展。在GeoNames上,自适应模型在零至中等字符重叠范围内提升了已知目标的Recall@1,而字符n元组在整体Target Recall@5上仍保持微小优势。在对分层生产挑战集进行的盲评人类对比中,我们的模型将相关P@1从28.0%提升至46.0%(p=0\.012)。固定查询端点估计在非常规查询上有所改善,在频繁查询上保持接近对照组;一项随机线上实验未检测到参与度下降。这些结果支持将任务自适应的地理实体检索作为基于现有分类法标准化器的实用替代方案,其在非常规查询上带来最大的相关性增益。

###### 关键词:

位置落地,地理实体检索,稠密检索,地名消歧,可编辑实体表示,人物搜索

## 1\.引言

人物搜索查询将非结构化意图(如技能、头衔、姓名和公司)与结构化约束相结合。像“大波士顿地区的工程师”这样的查询需要将位置短语映射为候选生成所使用的规范实体。这种映射通常通过*地理标准化器*实现:给定查询理解模块提取出的位置跨度,它返回一个来自精心策划的地理本体的标识符。

生产环境的标准化器传统上结合了地名辞典、分类别名、首字母索引和手动指定的字符串规则。这些系统可解释性强,且在高频、格式良好的查询上准确率高,但在不太常规的表达上覆盖率会下降。缩写(如“la”、“WPB”)、非正式名称(如“粉色之城”)、大都会区表述(如“费城都市区”)、拼写错误以及顺序或标点符号的变化可能没有精确对应的别名表条目。添加规则可以改善单个案例,但需要持续维护,并且可能在共享表面形式的不同地点之间引入冲突。

稠密检索将多样的表面形式和规范实体映射到共享空间,但这一设定提出了三个相互关联的设计问题。哪些查询变换保留了实体身份,而哪些别名需要外部验证?如何训练才能暴露易混淆的同名实体,同时不会将有效的替代方案错误地判定为假阴性?哪些变换属于共享模型参数,而哪些可变事实应保留在实体文档中?这些问题涉及正例支持、负例采样和内存位置,而不仅仅是编码器规模。

我们提出一个部署在大型专业社交网络人物搜索栈中的地理标准化器。该系统微调了一个0.6亿参数的指令嵌入模型作为共享权重的双编码器。查询和实体输入使用不同的提示,而实体表示是预先计算的。本文中的实验评估了一种用于固定库存检索的紧凑表示。

我们的表述联合定义了三个对象:有效查询形式的支持范围、可混淆负例的分布,以及稳定变换(模型参数中)与可变知识(实体文档中)之间的边界。我们在一个固定的本体检索目标中形式化了这些对象。该设计不需要编码器特定的架构更改,也适用于具有非常规表面形式、歧义名称和演变实体元数据的固定库存检索任务。

贡献\。

1. (1) 我们将短查询地理落地形式化为在固定的多粒度本体上进行的分级、集值检索。这种表述捕获了下游语义,其中有序的Top-k个实体成为析取的候选生成约束。
2. (2) 我们实例化了一个统一的监督设计,包含三个匹配组件:保持身份的视图扩展不变的支持范围;生成-验证-校准过程添加依赖知识的别名而不压倒规范形式;以及支配门控、有界的同名负例在控制假阴性的同时增加可混淆性。
3. (3) 我们将模型参数中的稳定跨实体变换与实体文档中的可变事实分离,并比较了仅实体更新与词法插入。这种比较揭示了互补的更新路径:实体文档支持局部神经更新而无需重新训练,而词法插入对于已知的确定性映射仍然更强。
4. (4) 我们评估了完整设计相较于标准表面形式微调和冻结编码器(最大80亿参数)的性能,在GeoNames上测试了与词法基线的公共迁移能力,并在一项五名标注者的盲评研究中直接与生产系统进行了比较。在线评估将固定查询相关性与实时参与度护栏分离开来。

在固定的种子控制开发研究下,选定的任务自适应系统将nDCG@10从标准表面形式微调下的0.8099提升至0.9201;更大的冻结编码器未能弥合差距。公开的GeoNames迁移提供了独立、无需人工评判的目标指标:自适应模型超越了精确、前缀和BM25检索,整体提升了Target Recall@1并在零至中等字符重叠范围内均有效,由于高重叠别名的存在,其聚合Target Recall@5略逊于字符n元组。实体文档编辑在不改变无关对照的情况下改善了保留别名的检索,但付出了规范保留代价;直接词法插入对于精心策划的映射仍然更强。在对分层生产挑战集上,模型将人工判断的相关P@1从28.0%提升至46.0%。固定查询端点点估计在非常规查询上上升,而实时实验未检测到参与度下降。

## 2\.相关工作

人物搜索与结构化查询理解。专业人物搜索结合了自由文本意图和结构化约束,必须大规模地检索和排序个人资料(Geyik等人,2018 (https://arxiv.org/html/2608.28965#bib.bib19))。最新的系统超越了词汇匹配:Gupta等人简化了查询和成员文档,微调了一个嵌入模型,并使用套娃表示进行语义档案检索(Gupta等人,2025 (https://arxiv.org/html/2608.28965#bib.bib20));Borisyuk等人结合了查询理解、嵌入检索、LLM相关性判断和蒸馏重排器(Borisyuk等人,2026 (https://arxiv.org/html/2608.28965#bib.bib21))。这些系统从用户的整体意图中检索档案。我们研究了一个互补的查询理解阶段:在位置跨度被提取后,它必须被落地到一个固定的地理本体,其有序的Top-k个实体ID成为一个析取的检索约束。因此,输出是一个实体集而非成员排序,并且多个地理粒度可能同时相关。

地名消歧与地理表示。地名消歧传统上检测文档中的地名提及,并将它们链接到地名辞典条目,使用上下文来消歧像“墨尔本”这样的名称(Gritta等人,2018 (https://arxiv.org/html/2608.28965#bib.bib6);Weissenbacher等人,2019 (https://arxiv.org/html/2608.28965#bib.bib5))。GeoNorm利用本体和人口信号改进了候选生成和Transformer重排(Zhang and Bethard, 2023 (https://arxiv.org/html/2608.28965#bib.bib7));GeoPLACE在约束确定性的本体查找之前预测地理属性(Zhang等人,2024 (https://arxiv.org/html/2608.28965#bib.bib22))。互补的工作从坐标、地图关系或附近实体学习空间表示(Li等人,2022 (https://arxiv.org/html/2608.28965#bib.bib23);Li等人,2023 (https://arxiv.org/html/2608.28965#bib.bib8))。最近的检索表述对比编码兴趣点提及和地名辞典条目(Nakatani等人,2025 (https://arxiv.org/html/2608.28965#bib.bib24)),而Masis和O’Connor研究了有噪声的、多语言的、用户提供的位置字符串(Masis and O’Connor, 2024 (https://arxiv.org/html/2608.28965#bib.bib9))。我们的输入通常包含很少的上下文,因为它们仅由提取的搜索跨度组成。正确的输出可能包含多个粒度或同名地点。因此,我们评估有序的本体实体集,而不仅仅是单个坐标或地名辞典条目。

基于别名丰富本体的实体归一化。稠密实体检索提供了最接近的非地理先例。双编码器无需别名表候选生成器即可检索知识库实体(Gillick等人,2019 (https://arxiv.org/html/2608.28965#bib.bib25)),而BLINK将此表述扩展到百万级实体链接(Wu等人,2020 (https://arxiv.org/html/2608.28965#bib.bib4))。生物医学归一化使别名问题变得明确:BioSyn通过同义词边缘化从不完整的同义词集中学习(Sung等人,2020 (https://arxiv.org/html/2608.28965#bib.bib26)),而SapBERT对齐属于同一本体概念的别名(Liu等人,2021 (https://arxiv.org/html/2608.28965#bib.bib27))。最近的工作也系统地研究了双编码器消歧中的标签口语化和负例采样(Rücker and Akbik, 2025 (https://arxiv.org/html/2608.28965#bib.bib28))。我们的设置结合了三个特性:查询简短且经常拼写错误,依赖知识的别名可能不在本体中,并且一个表面形式可能有多个具有不同相关性等级的有效输出。这促使我们对保持身份的变异、经过验证的别名获取和有界的同名消歧采用单独的监督,而不是将每个未标记实体视为负例。

合成监督与负例构建。LLM生成的查询可以将演示转化为特定任务的检索器训练数据;Promptagator还使用往返一致性过滤生成的配对(Dai等人,2023 (https://arxiv.org/html/2608.28965#bib.bib29))。稠密检索也从挖掘的负例中受益(Xiong等人,2021 (https://arxiv.org/html/2608.28965#bib.bib10)),但未标记的正例使得未过滤的硬负例挖掘不可靠。RocketQA通过交叉编码器去噪的负例来解决这个问题(Qu等人,2021 (https://arxiv.org/html/2608.28965#bib.bib30))。我们的生成-验证-校准过程则针对特定实体的地理别名:生成扩展知识支持,验证检查指称对象,校准采样防止合成形式取代规范查询。同样,我们的负例使用本体身份、层次结构和有界的突出度关系,而不是将检索排名等同于不相关性。

紧凑检索与可编辑实体记忆。双编码器使得候选表示可以预先计算(Huang等人,2013 (https://arxiv.org/html/2608.28965#bib.bib1);Karpukhin等人,2020 (https://arxiv.org/html/2608.28965#bib.bib2);Reimers and Gurevych, 2019 (https://arxiv.org/html/2608.28965#bib.bib3)),而套娃训练使得向量前缀在多个维度上都有用(Kusupati等人,2022 (https://arxiv.org/html/2608.28965#bib.bib11))。基于描述的零样本实体链接表明,独立编码的内容可以支持在任务监督期间未见过的实体(Logeswaran等人,2019 (https://arxiv.org/html/2608.28965#bib.bib31));检索增强模型更广泛地将参数行为与外部记忆分离(Lewis等人,2020 (https://arxiv.org/html/2608.28965#bib.bib32))。DynamicER通过持续适应研究新出现的提及和演变的实体(Kim等人,2024 (https://arxiv.org/html/2608.28965#bib.bib33))。我们研究了一个针对固定本体的更窄的更新操作:将保留的别名添加到受影响的实体文档中,仅重新嵌入该实体,保持模型参数固定。这使知识边界变得可操作,而不仅仅是架构层面的。

LLM相关性评估。LLM评判降低了评估成本,但需要明确的有效性证据(Faggioli等人,2023 (https://arxiv.org/html/2608.28965#bib.bib13))。校准的评估者可以重现搜索者的偏好,但仍对提示的释义敏感(Thomas等人,2024 (https://arxiv.org/html/2608.28965#bib.bib14));UMBRELA报告了LLM和人工判断之间系统排名的强相关性(Upadhyay等人,2024 (https://arxiv.org/html/2608.28965#bib.bib15))。这种运行级别的对应并不意味着查询-结果标签可以互换。在八个评估者中,Fröbe等人发现LLM-LLM的一致性比LLM-人类的一致性更强,并且可能存在对基于LLM排名器的偏好(Fröbe等人,2025 (https://arxiv.org/html/2608.28965#bib.bib16))。LARA和LLM-Rubric使用人工校准或明确的多维度评分标准来减少这种差距(Takehi等人,2025 (https://arxiv.org/html/2608.28965#bib.bib17);Hashemi等人,2024 (https://arxiv.org/html/2608.28965#bib.bib18))。SAGE遵循针对人物搜索的这一领域校准方向(Le等人,2026 (https://arxiv.org/html/2608.28965#bib.bib12)),但没有验证我们提示的地理实体评判器。因此,我们冻结评判器的模型、提示、评分标准和输入字段,跨系统使用,并直接测量其与五名标注者盲评研究的一致性。

综上所述,先前的工作主要作为单独的问题处理上下文地名链接、别名丰富的实体归一化、合成检索器监督、可编辑实体记忆和LLM评估。

相似文章

通过二次嵌入实现位置感知的语言模型

arXiv cs.CL

本文提出了一种轻量级、模型无关的方法,通过利用位置数据增强嵌入来提升语言模型的地理空间感知能力,从而在保持标准NLP性能的同时改善空间对齐。