BeLink:生物医学实体链接结合生成式重排序
摘要
BeLink 提出了一种集合式指令微调的方案,用于生物医学实体链接中的生成式重排序,与现有最先进系统相比,准确率提升了3-24%,并且推理速度更快。
arXiv:2605.22501v1 公告类型:新
摘要:尽管近期取得了进展,但使用大语言模型(LLMs)进行生物医学实体链接(BEL)在计算上仍然效率低下,且在实际部署中具有挑战性。在这项工作中,我们证明,在BEL管道的重排序阶段应用开放源代码生成模型的指令微调可以提供有效的解决方案。我们提出了一种集合式指令微调公式,能够实现快速且准确的候选选择。我们的方法在多个BEL基准测试中表现出强劲性能,与现有最先进技术相比,链接准确率提升了3%-24%,同时减少了推理时间。我们将生成式重排序器集成到BeLink中,这是一个为实际BEL应用设计的模块化端到端系统。
查看缓存全文
缓存时间: 2026/05/22 08:48
# BeLink:生物医学实体链接遇上生成式重排序
来源:https://arxiv.org/html/2605.22501 \(2026\)
###### 摘要。
尽管近年来取得了进展,但使用大型语言模型(LLM)进行生物医学实体链接(BEL)在计算上仍然效率低下,且在实际部署中面临挑战。在本工作中,我们展示了在BEL流水线的重排序阶段应用指令微调的开源生成模型可以提供一种有效的解决方案。我们提出了一种集合式指令微调方案,能够实现快速且准确的候选选择。我们的方法在多个BEL基准测试上展现了强大的性能,与最先进的方法相比,链接准确率提升了3%–24%,同时推理时间更短。我们将此生成式重排序器集成到BeLink中,这是一个为实际BEL应用设计的模块化端到端系统。
实体链接;概念归一化;概念识别;检索增强生成;查询重构;生成式重排序
††期刊年份:2026
††版权:cc
††会议:第49届ACM SIGIR信息检索研究与发展国际会议论文集;2026年7月20–24日,澳大利亚墨尔本
††书刊名:第49届ACM SIGIR信息检索研究与发展国际会议论文集(SIGIR '26),2026年7月20–24日,澳大利亚墨尔本
††DOI:10.1145/3805712.3809918
††ISBN:979-8-4007-2599-9/2026/07
††提交ID:sp119
††CCS:信息系统 → 语言模型
††CCS:信息系统 → 排序学习
††CCS:应用计算 → 健康信息学
## 1. 引言
生物医学实体链接(BEL)涉及将非结构化文本中的生物医学实体提及映射到专业术语或知识库(KB)中的标准概念标识符¹¹¹。该任务也称为概念归一化或实体消歧,仅关注链接步骤,其中待归一化的实体跨度已经确定。因此,它不同于概念识别,后者在实体链接之前需要一个跨度检测步骤(Shlyk et al., 2024 (https://arxiv.org/html/2605.22501#bib.bib21), 2026 (https://arxiv.org/html/2605.22501#bib.bib22))。它在从语义搜索到生成医疗账单代码等多种应用中都很重要。现代BEL系统广泛采用的检索-重排序范式将实体链接任务分解为两个连续的阶段:候选生成和重排序(Xu et al., 2023 (https://arxiv.org/html/2605.22501#bib.bib29))。第一阶段通常被表述为一个检索问题,旨在为下一阶段的重排序器提供来自参考KB的相关候选概念集。然后,重排序器的目标是从该候选集中检测出与目标提及相对应的正确概念,以确保准确的链接预测。传统上,大多数重排序方法依赖于基于BERT的预训练语言模型(PLM),使用交叉编码器架构进行逐点重排序(Sanz-Cruzado and Lever, 2025 (https://arxiv.org/html/2605.22501#bib.bib18); Xu et al., 2023 (https://arxiv.org/html/2605.22501#bib.bib29); Varma et al., 2021 (https://arxiv.org/html/2605.22501#bib.bib25); Donoso et al., 2025 (https://arxiv.org/html/2605.22501#bib.bib5))。这些方法训练一个分类器来对候选-提及对的兼容性进行评分,并且依赖于有标签数据的可用性来进行监督模型训练。
最近的研究越来越多地探索使用生成式LLM进行零样本实体链接,以消除训练需求(Haffoudhi et al., 2026 (https://arxiv.org/html/2605.22501#bib.bib10); Zhou et al., 2024 (https://arxiv.org/html/2605.22501#bib.bib34))。与监督方法不同,使用现成LLM的基于提示的重排序方法表现出显著的泛化能力,无需额外训练即可快速适应领域(Ye and Mitchell, 2025 (https://arxiv.org/html/2605.22501#bib.bib31))。然而,在实际部署基于LLM的BEL重排序仍然存在几个挑战。首先,现有的基于LLM的方法(Xie et al., 2024 (https://arxiv.org/html/2605.22501#bib.bib28); Haffoudhi et al., 2026 (https://arxiv.org/html/2605.22501#bib.bib10))由于昂贵的推理策略(包括多阶段提示、长推理链以及每个查询需要多次LLM调用的自一致性机制),导致了高计算成本和延迟增加(Li et al., 2025 (https://arxiv.org/html/2605.22501#bib.bib14))。此外,生物医学领域的实体链接本质上是知识密集型的,基于提示工程的零样本方法通常难以与开源的中等规模语言模型竞争(Qin et al., 2024 (https://arxiv.org/html/2605.22501#bib.bib17); Ye and Mitchell, 2025 (https://arxiv.org/html/2605.22501#bib.bib31); Sun et al., 2024 (https://arxiv.org/html/2605.22501#bib.bib23))。大型商业LLM(如GPT-4)的封闭性和高运营成本限制了它们在BEL应用中的适用性,因为BEL应用要求快速、可靠且可扩展的推理,以及对模型行为和预测的更强控制。
受现有基于LLM方法局限性的启发,我们设计了BeLink,这是一个端到端的BEL解决方案,通过在检索-重排序流水线的两个阶段中集成生成技术,将高召回率的候选检索与准确的重排序相补充。基于我们最近关于有效第一阶段候选检索技术的研究(Shlyk and Hunter, 2026 (https://arxiv.org/html/2605.22501#bib.bib20)),本工作重点通过指令微调中等规模的开源基础模型来提高第二阶段重排序器的效率和准确性。我们提出了一种高效的集合式任务方案,使用生成式骨干LLM进行受约束的多选题候选选择。实验结果表明,我们的重排序方法在链接准确性上取得了显著提升,同时保持了快速且稳定的推理,其吞吐量仅次于优化的基于BERT的交叉编码器,并且相比逐点式Qwen3重排序器实现了大约四倍的加速。进一步的实验表明,指令微调后的模型在相关生物医学领域之间具有很高的可迁移性,突显了它们在低资源设置中的复用潜力。我们在以下链接提供了系统实现:https://github.com/dash-ka/BeLink
参见标题
图1. BeLink流水线示意图。
## 2. BeLink方法
任务描述。令 \( \mathcal{C} \) 为目标生物医学KB中的一组概念。每个概念 \( c \in \mathcal{C} \) 都有一个唯一标识符,并关联一组同义词,作为替代概念名称。例如,“atelosteogenesis, type 1”、“AO1”和“giant cell chondrodysplasia”都指向同一个概念 `MESH:C535396`。给定包含生物医学实体提及 \( m \) 的文本 \( T \),BEL任务是在 \( \mathcal{C} \) 中识别出 \( m \) 所指的概念 \( c \),或者在找不到此类概念时将该提及标记为不可链接。
BeLink基于两阶段检索-重排序流水线提供了一个模块化的BEL解决方案,如图1 (https://arxiv.org/html/2605.22501#S1.F1)所示。流水线的第一阶段采用轻量级提示策略,使用无需微调的LLM进行零样本生成式查询重构(GenQR)(Wang et al., 2023 (https://arxiv.org/html/2605.22501#bib.bib26)),以提高候选检索期间的召回率。第二阶段则依赖于一种新颖的集合式指令微调方案,使用开源生成语言模型构建专门的重排序器。第2.1节和第2.2节将更详细地介绍这两个阶段。
### 2.1. 使用GenQR进行候选检索
流水线的第一阶段旨在将给定提及的候选空间缩小到一个小的相关概念子集 \( C_m \subset C \),这些概念随后被传递给重排序器。借鉴了主要的同义词匹配BEL方法(Garda and Leser, 2024 (https://arxiv.org/html/2605.22501#bib.bib8); Sung et al., 2020 (https://arxiv.org/html/2605.22501#bib.bib24)),我们通过对预编码的KB进行密集检索来实现这一点。具体来说,该方法首先构建一个参考KB中列出的唯一概念名称的索引,并缓存它们的嵌入向量以实现高效的相似性搜索。提及跨度 \( m \) 被当作查询,使用相同的嵌入方法进行编码。候选集 \( C_m \) 通过检索与 \( m \) 嵌入最接近的 top-k 同义词来构建。
为了进一步提高检索效果,我们在此阶段引入了生成式查询重构机制,该机制接受初始查询 \( m \),并使用零样本LLM生成的反馈 \( F \) 来修改其表示。BeLink采用了Shlyk和Hunter(2026 (https://arxiv.org/html/2605.22501#bib.bib20))提出的高效GenQR方法,其中在检索之前,以零样本方式提示LLM为目标提及生成一个标准的科学名称。此步骤的目的是弥合提及表面形式与参考KB中使用的规范科学命名法之间的词汇差距,从而在更小的候选池中实现更高的召回率。与文献中讨论的其它生成任务(Shlyk et al., 2024 (https://arxiv.org/html/2605.22501#bib.bib21); Borchert et al., 2024 (https://arxiv.org/html/2605.22501#bib.bib1); Dobbins, 2024 (https://arxiv.org/html/2605.22501#bib.bib4))相比,基于标准名称生成的反馈在各种BEL任务中表现出更高的效率(消耗更少的输出令牌)和有效性(Shlyk and Hunter, 2026 (https://arxiv.org/html/2605.22501#bib.bib20))。
为了构建最终查询 \( Q_{\mathrm{GenQR}} \),我们采用基于向量的融合策略,该策略使用Rocchio集成方案,在嵌入后结合LLM生成的反馈和原始提及跨度,如公式1所示。超参数 \( \alpha \) 控制提及向量 \( \vec{m} \) 相对于生成反馈向量 \( \vec{F} \) 的重要性。\( \alpha \) 的最优值通过经验确定,默认为0.6。
\[
\begin{equation}
\vec{\mathrm{Q}_{\mathrm{GenQR}}} = \alpha \cdot \vec{m} + (1 - \alpha) \cdot \vec{F} \tag{1}
\end{equation}
\]
### 2.2. 基于指令微调的生成式重排序
BeLink流水线的第二个模块实现了一个生成式重排序器,它利用生成式LLM的指令遵循能力来产生最终的链接决策。在我们的实现中,重排序任务被表述为一个受约束的多选题选择问题,语言模型经过指令微调,从检索模块提供的候选集中选择与目标提及 \( m \) 匹配的概念。
与使用成对分类框架独立对 \( C_m \) 中每个候选进行评分的逐点重排序方法相比,这种集合式设计实现了更高的计算效率,在一次模型调用中评估整个候选集。为了构建我们的生成式重排序器,我们采用开源 `Qwen3` 模型系列(Yang et al., 2025 (https://arxiv.org/html/2605.22501#bib.bib30))中的一个强大基础模型作为骨干,并使用监督的指令遵循范式来训练重排序器模型。
模型的输入根据下面显示的模板进行格式化,包含两个主要部分:一个指令(`...`)和一个选项集(`...`)。指令组件指定任务,并向模型提供目标提及 \( m \) 以及包含 \( m \) 的源句子 \( T \),旨在为提及提供上下文。选项组件将模型输出限制为预定义的候选概念集,只允许一个正确答案。每个选项对应于 \( C_m \) 中的一个候选概念,由其一个同义词指定。请注意,虽然检索是在同义词上执行的,但重排序器是在概念级别上操作的。因此,在构建选项集时,会将检索到的同义词按概念分组,并且每个概念只有一个名称被包含在选项中。在训练期间,我们为每个概念随机抽样一个同义词,以提高鲁棒性并防止模型依赖于基于检索的顺序。在推理时,我们为 top-k 检索结果中的每个概念选择得分最高的同义词。选项使用格式 `{字母:候选名称}` 在单独的行上呈现。列表末尾使用相同格式附加一个“以上都不是”的选项,使重排序器能够处理在前一阶段未检索到相关候选的NIL情况。为了提供更大的灵活性,重排序器被训练来处理不同大小的选项列表。为了提高计算效率和加快推理时间,模型输出被限制为单个令牌,对应于所选选项的字母。下面的列表展示了重排序器使用的完整聊天模板。
```
用户:
Given the context {T}, select the correct biomedical concept corresponding to {m}. Answer using one of the provided options.
:
A: {candidate_1}
B: {candidate_2}
...
None of the above.
助手:
Answer:
```
表1. Acc@1/NIL敏感Acc@1与推理速度。与第一阶段检索结果(“+”)及最佳方法(加粗)相比的显著改进。
| | Diseases | Chemicals | Genes | Species | | | | | | |
| :--------- | :------- | :-------- | :---- | :------ | :------- | :------- | :------ | :------ | :-: |
| | NCBI-Dis | BC5CDR(D) | BC5CDR(C) | NLM-Chem | GNormPlus | NLM-Gene | Linnaeus | S800 | 速度(Q/s) |
| 基线 | 70.0 | 73.8 | 90.3 | 74.4 | 59.5 | 27.3 | 77.2 | 65.4 | - |
| BiomedBERT-base | 71.9/66.1 | 75.0/71.2 | 92.0/90.7 | 74.0/67.9 | 78.3+/70.0 | 41.7+/32.0 | 86.6+/77.2 | 72.8+/68.6 | 6.7 |
| BiomedBERT-parallel | 71.9/67.1 | 75.3/70.2 | 91.6/90.5 | 74.2/69.0 | 78.0+/73.4 | 44.1+/36.3 | 89.9+/85.0 | 75.7+/71.8 | 67.3 |
| GPT-4o-as-reranker | 71.0/71.0 | 73.6/73.5 | 92.5/92.5 | 77.3+/77.3 | 81.4+/81.4 | 47.0+/47.0 | 89.4+/89.4 | 71.8+/71.8 | 1.3 |
| Qwen3-reranker-8B | 74.8+/57.0 | 75.3/61.3 | 93.3+/91.2 | 77.6+/72.3 | 80.5+/73.1 | 49.9+/43.8 | 89.4+/83.8 | 70.4+/66.5 | 4.3 |
| BeLink-reranker-8B | 73.4+/71.9 | 76.6+/75.2 | 93.5+/93.1 | 77.4+/76.5 | 81.5+/79.9 | 51.6+/49.9 | 90.0+/89.4 | 73.9+/73.2 | 16.5 |
| BeLink-reranker-4B | 72.9+/71.4 | 77.0+/75.6 | 93.5+/92.9 | 76.7+/75.1 | 80.4+/78.9 | 47.6+/47.5 | 87.2+/86.6 | 74.2+/72.8 | 16.5 |
## 3. 实验设置
我们的实验旨在回答以下研究问题:
**RQ1.** BeLink方法与BEL领域最先进的重排序方法相比如何?
**RQ2.** 指令微调如何影响模型的泛化能力?
以下章节介绍基准数据集(第3.1节),详述BeLink配置(第3.2节),讨论对比方法(第3.3节)以及评估协议(第3.4节)。
### 3.1. 数据集与知识库
我们使用了8个公开的BEL基准数据集,涵盖4个生物医学领域。
**GNormPlus**(Wei et al., 2015 (https://arxiv.org/html/2605.22501#bib.bib27))和**NLM-Gene**(Islamaj et al., 2021 (https://arxiv.org/html/2605.22501#bib.bib12))是两个标注了跨物种基因提及的语料库,并链接到**NCBI Gene**(Brown et al., 2015 (https://arxiv.org/html/2605.22501#bib.bib2))KB,该KB记录了基因名称及其宿主物种。
**NCBI-Disease**(Doğan et al., 2014相似文章
思考再链接:多语言实体链接中的稀有性、推理与检索
本文介绍了一种多语言多模态实体链接框架,通过结合推理和检索,提高了对稀有实体的准确性,并在MERLIN基准测试中取得了显著提升。
生物医学命名实体识别与实体链接基准测试究竟衡量什么?一个语料库中心的诊断框架
本文提出了一种以语料库为中心的诊断框架,用于分析生物医学NER和EL基准测试,揭示了九个语料库之间的显著差异,并论证了标准统计量不足以描述评估需求。
OntologyAligner: 本体对齐检索与层次引导的大型语言模型重排序用于生物医学本体归一化
OntologyAligner 提出一个三阶段框架,结合本体对齐检索和LLM重排序用于生物医学本体归一化,在HPO任务上实现了最先进的性能,并引入了PhenoNormBench基准。
面向检索增强生成的源感知重排序:一种可靠性先验方法
本文介绍了一种面向RAG的源感知重排序方法,该方法引入了基于领域信息的源可靠性先验,在一个由120份文档组成的健康领域语料库上将Precision@5从0.48提升至0.72,并减少了对抗性文档的检索。
5ting在SemEval-2026任务8中的表现:基于LLM重排序和忠实性控制的强大端到端多轮RAG
本文介绍了5ting系统,这是一个用于多轮检索增强生成(RAG)的系统,融合了BGE-M3密集检索、FAISS索引、基于LLM的重排序以及证据约束生成。该系统在SemEval-2026任务8中取得了出色成绩,检索nDCG@5达到0.4719,端到端调和得分为0.5597。