ANCHOR-RE:一种用于有依据的生物医学关系抽取的智能体神经符号框架
摘要
ANCHOR-RE是一种智能体神经符号框架,它将本体引导推理和外部知识锚定集成到LLM推理中,用于生物医学关系抽取,无需微调即可在多个基准上提升F1分数。
arXiv:2608.03154v1 公告类型:新
摘要:生物医学关系抽取(BioRE)从生物医学文献中提取结构化知识,用于知识库构建和假设生成等应用。传统符号系统(如SemRep)具有高精确率但召回率有限,而大语言模型(LLM)提供更强的上下文推理能力,但仍容易产生假阳性预测。我们开发了ANCHOR-RE,一个将本体引导推理、外部知识锚定和数据驱动的验证规则集成到LLM推理中的框架。我们使用专有和开放权重LLM在三个BioRE基准(SemRepGS、DDI和ChemProt)上对其进行了评估。为了评估基准数据集之外的泛化能力,同时减少LLM预训练污染带来的潜在评估偏差,我们使用2026年发表的100篇生物医学文章进行了时间评估。在专有骨干模型下,ANCHOR-RE优于直接LLM提示,在SemRepGS上将micro-F1从0.654提高到0.676,在DDI上从0.769提高到0.872,在ChemProt上从0.939提高到0.941。在DDI和ChemProt上,它还优于先前报道的仅推理方法,并在不进行参数更新的情况下接近了微调或指令调优系统。在开放权重LLM上也观察到了类似的性能提升,表明这些收益并不仅限于专有骨干模型。在截止后数据集上,对500个随机抽样预测进行人工评估,精确率达到69%,在未见过的生物医学文献上保持了稳定的精确率。神经符号推理可以提高基于LLM的BioRE的可靠性,而无需微调。跨多个基准、模型系列和截止后文献的结果支持ANCHOR-RE作为一种实用的无训练生物医学文献挖掘方法。
查看缓存全文
缓存时间: 2026/08/05 07:44
# ANCHOR-RE:一种用于接地生物医学关系抽取的智能神经符号框架
###### 摘要
**目的。**生物医学关系抽取(BioRE)从生物医学文献中提取结构化知识,用于知识库构建和假设生成等应用。在现实场景中,BioRE系统必须从大量候选实体对中区分出真实关系,而大多数候选实体对并不具有任何关联。传统的符号系统(如SemRep)具有高精度和可解释性,但在语言变异和复杂话语结构下召回率有限。相比之下,大规模语言模型(LLM)具备强大的上下文推理能力,但可能产生假阳性的关系预测。本研究旨在开发一种智能神经符号框架,将符号生物医学知识与LLM推理相结合,以提高BioRE的可靠性。
**方法。**我们开发了ANCHOR-RE,一个将本体引导推理、外部知识接地和数据驱动的验证规则集成到LLM推理中的框架。我们使用专有和开放权重LLM在三个BioRE基准(SemRepGS、DDI和ChemProt)上对其进行了评估。为了在基准数据集之外评估泛化能力,同时减少LLM预训练污染可能带来的评估偏差,我们使用2026年发表的100篇生物医学文章进行了时间维度评估。
**结果。**使用专有骨干模型时,ANCHOR-RE优于直接LLM提示,在SemRepGS上将微F₁从0.654提升至0.676,在DDI上从0.769提升至0.872,在ChemProt上从0.939提升至0.941。在DDI和ChemProt上,它还优于先前报道的仅推理方法,并在无需参数更新的情况下接近微调或指令调优系统。使用开放权重LLM观察到的类似性能提升表明,这些收益并不仅限于专有骨干模型。在截止日期后的数据集上,对500个随机抽样预测的人工评估产生了69%的精确率,在未见过的生物医学文献上保持一致的精確率。
**结论。**神经符号推理可以在无需微调的情况下提高基于LLM的BioRE的可靠性。跨多个基准、模型家族和截止日期后文献的结果支持ANCHOR-RE作为一种实用的免训练生物医学文献挖掘方法。数据和代码可在https://github.com/COMBINI-Hub/Multi_Agent_Relation_Extraction获取。
###### 关键词:生物医学关系抽取,大规模语言模型,神经符号AI,生物医学文献,SemRep
††期刊:JBI
\affiliation\[inst1\]organization=School of Information Sciences, University of Illinois Urbana-Champaign, addressline=501 E Daniel St\., city=Champaign, postcode=61820, state=IL, country=USA
\affiliation\[inst2\]organization=Division of Computational Health Sciences, Department of Surgery, University of Minnesota, addressline=516 Delaware St SE, city=Minneapolis, postcode=55455, state=MN, country=USA
## 1 引言
生物医学关系抽取(BioRE)自动识别生物医学实体之间的语义关系,将非结构化的生物医学文献转化为结构化知识,用于下游应用,如生物医学知识图谱构建(Zhang等,[2021](https://arxiv.org/html/2608.03154#bib.bib72);Xu等,[2025](https://arxiv.org/html/2608.03154#bib.bib69))、基于文献的发现(Henry和McInnes,[2017](https://arxiv.org/html/2608.03154#bib.bib68))和临床决策支持(Eguia等,[2024](https://arxiv.org/html/2608.03154#bib.bib70))。以往的BioRE方法大致可分为基于规则的系统和基于监督Transformer的模型,各有其独特的优势和局限性。基于规则的系统(如SemRep)利用手工构建的词汇触发器和精心设计的语义类型约束实现高精度并提供可解释的预测(Kilicoglu等,[2020](https://arxiv.org/html/2608.03154#bib.bib25)),但在跨多样化的语言表达和复杂话语结构的泛化方面存在困难。相比之下,基于Transformer的模型能学习丰富的上下文表示,并在基准数据集上取得具有竞争力的性能(Jullien等,[2024](https://arxiv.org/html/2608.03154#bib.bib148))。然而,这些模型通常依赖使用大规模标注语料进行任务特定的微调,使得适应新的生物医学领域成本高昂,并限制了在标注数据稀缺场景中的适用性(Meesawad等,[2025](https://arxiv.org/html/2608.03154#bib.bib237);Delmas等,2024([2024](https://arxiv.org/html/2608.03154#bib.bib238))。
生成式大规模语言模型(LLM)已在广泛的生物医学NLP任务中展现出强大的零样本和少样本能力。然而,即使是最先进的模型仍然容易出现幻觉和事实不一致,限制了它们在高风险生物医学应用中的可靠性(Frasca等,[2024](https://arxiv.org/html/2608.03154#bib.bib179))。在BioRE中,这些失败通常表现为系统性过度预测,即实体共现被错误地推断为有意义的关系(Yang等,[2025](https://arxiv.org/html/2608.03154#bib.bib245))。这一挑战在现实场景中尤为突出,因为大多数候选实体对并不对应任何有效关系。这些局限性促使研究者探索推理时方法,将符号知识与LLM推理的互补优势结合起来,而无需额外的模型训练。
ReOnto(Jain等,[2023](https://arxiv.org/html/2608.03154#bib.bib151))将本体衍生的关系路径融入BioBERT表示,在文本证据薄弱或模糊时提供明确的关系线索以改善预测。类似地,Olasunkanmi等([2025](https://arxiv.org/html/2608.03154#bib.bib169))通过在上下文推理之前限制候选谓词,将本体约束集成到基于LLM的框架中。尽管这些方法表现良好,但它们通常需要任务特定的模型训练或专门的多阶段推理流程。在推理时将符号约束注入而无需额外模型训练的轻量级方法仍未被充分探索。
为解决这一空白,我们提出了ANCHOR-RE,一个将神经假设生成与符号引导和验证分离的神经符号智能框架。它由两个模块组成:一个**决策器(Decider)**,利用来自外部知识库(KBs)的结构化证据生成候选关系假设;以及一个**验证器(Verifier)**,利用从训练语料中习得的错误模式来评估这些预测。实体语义类型约束进一步基于主语-宾语语义类型兼容性限制候选关系,从而减少生物学上不合理的预测。我们使用专有和开放权重模型在覆盖多种关系模式的三个BioRE基准上评估了ANCHOR-RE。为进一步评估标准基准设置之外的鲁棒性,我们还在底层LLM知识截止日期之后发表的生物医学文章上进行了污染控制的时间维度评估。我们通过消融研究评估每个框架组件的贡献,并进一步考察其在减少幻觉性假阳性预测方面的有效性。实验结果表明,在推理时融入符号引导能够持续改进基于LLM的直接提示基线。
本研究的主要贡献如下:
- 我们提出了ANCHOR-RE,一个整合知识库证据、语义类型约束和推理时验证的神经符号框架,以改进基于LLM的生物医学关系抽取。
- 我们引入了一个验证模块(Verifier),利用习得的错误模式作为软约束,在推理时减少BioRE的假阳性预测。
- 我们通过在三个BioRE基准上的综合评估、污染控制的时间维度评估以及使用专有和开放权重LLM骨干的实验,证明了ANCHOR-RE的鲁棒性和泛化能力。
**问题。**BioRE是从生物医学文献中挖掘结构化知识的基本任务,支持知识图谱构建、基于文献的发现和临床决策支持等下游应用。然而,当前基于LLM的方法仍然容易出现幻觉,且常常产生生物学上不支持的假阳性预测,限制了它们在现实生物医学应用中的可靠性。
**已有认知。**最近的神经符号方法将结构化生物医学知识融入神经模型以提升BioRE性能。然而,这些方法通常需要任务特定的模型训练或复杂的多阶段推理流程,限制了它们在不同BioRE场景中的灵活性和可扩展性。
**本文贡献。**我们提出了ANCHOR-RE,一个免训练框架,整合知识库证据、语义类型约束和推理时验证来改进基于LLM的BioRE。在三个基准数据集上的实验和污染控制的时间维度评估表明,在无需额外模型训练的情况下,该框架提高了可靠性、减少了幻觉性假阳性预测,并具备良好的泛化能力。
**受益人群。**开发生物医学文本挖掘系统、知识图谱以及利用文献中结构化知识的AI驱动应用的研究人员和从业者。
表1:重要性声明。
## 2 相关工作
### 2.1 用于生物医学关系抽取的LLM
生成式LLM(例如GPT、Qwen、LLaMA)已在BioRE中展现出强大的零样本和少样本能力,大幅减少了对任务特定标注语料的依赖,同时在多个BioRE基准上取得了具有竞争力的性能,并且在某些设置下接近或超越了监督方法(Brokman等,[2025](https://arxiv.org/html/2608.03154#bib.bib104);Gade等,2025([2025](https://arxiv.org/html/2608.03154#bib.bib176));Li等,[2023](https://arxiv.org/html/2608.03154#bib.bib150))。最近的仅推理方法通过提示工程和检索增强进一步改进了BioRE。Liu等人提出了一种自提示框架,自动生成多样化的合成示例,随后将其用作零样本关系抽取的上下文演示(Liu等,[2024](https://arxiv.org/html/2608.03154#bib.bib265))。检索增强生成(RAG)方法通过在推理时融入外部生物医学证据来改善接地性。例如,BiomedRAG检索生物医学证据并训练一个相关性评分器来排序和过滤候选段落,确保只有最有效的信息被提供给LLM进行推理和信息提取(Li等,[2025](https://arxiv.org/html/2608.03154#bib.bib256))。
尽管取得了这些进展,大多数仅推理的BioRE方法主要依赖提示工程或检索到的非结构化文本,因此在执行显式生物医学语义约束或验证关系预测方面提供的机制有限。
### 2.2 神经符号生物医学关系抽取
为提高基于LLM的BioRE的可靠性,最近的神经符号方法将结构化生物医学知识(如本体、语义类型约束和符号规则)融入推理过程。Quan等人([2025](https://arxiv.org/html/2608.03154#bib.bib172))引入了一个符号验证模块,用于过滤违反本体约束的预测。Zhao等人([2026](https://arxiv.org/html/2608.03154#bib.bib149))将实体同义词和上下位词知识融入提示,提供正反两方面的文本证据以引导推理。Li等人([2024](https://arxiv.org/html/2608.03154#bib.bib167))提出了一个召回-检索-推理框架,利用本体知识为候选实体对生成检索查询,然后用于检索上下文演示以进行关系抽取。
尽管取得了这些进展,最近的基准研究表明,随着关系模式变得更大且在语义上更复杂,LLM性能会下降,这使得BioRE在现实开放生物医学环境中特别具有挑战性(Sänger和Leser,[2025](https://arxiv.org/html/2608.03154#bib.bib247))。此外,LLM仍然容易产生过度自信且无证据支持的关系预测(de Oliveira等,[2025](https://arxiv.org/html/2608.03154#bib.bib239))。我们的工作研究了一种仅推理框架,将多种形式的符号引导(包括知识库证据、语义类型约束和习得的验证规则)直接融入LLM推理,以提高关系预测的可靠性。
## 3 方法
### 3.1 任务形式化
BioRE的目标是预测给定句子中一对指定实体之间的关系标签¹¹。形式上,给定输入句子\(s\)和目标实体对\((e_1,e_2)\)及其语义类型,目标是预测关系标签\(\hat{r}\in\mathcal{R}\),其中\(\mathcal{R}\)表示预定义的关系集合,包括表示不存在有效关系的`norel`标签。
我们的基线采用标准的零样本LLM分类设置。基线提示仅包含任务指令、数据集特定的关系定义、输入句子和目标实体对(见[A](https://arxiv.org/html/2608.03154#A1))。ANCHOR-RE通过向LLM推理中注入三种互补的符号引导来源来扩展此基线:从训练语料中检索的上下文演示、从外部生物医学知识库检索的结构化证据,以及从系统性假阳性预测中离线习得的验证规则。
### 3.2 ANCHOR-RE概述
[图1](https://arxiv.org/html/2608.03154#S3.F1)提供了ANCHOR-RE的概述,它由离线准备阶段和推理阶段组成。离线阶段构建支持后续推理的两种资源:(1)包含标注训练示例嵌入的向量数据库,用于检索上下文演示;(2)一个**错误模式知识库(Error Pattern Knowledge Bank)**,用于捕获重复出现的假阳性模式及相应的验证规则。为构建后者,我们首先对训练语料进行零样本推理,以识别系统性的假阳性错误。然后使用一个额外的基于LLM的推理模块(错误模式学习器)对这些错误进行分析,以推导可复用的错误模式和验证规则。此准备过程对每个数据集和骨干LLM执行一次,且不需要模型参数更新或微调。
在推理时,ANCHOR-RE首先使用**决策器(Decider)**生成候选关系预测,该模块利用输入句子、实体对、检索到的演示和来自外部知识库的结构化证据。然后由验证模块(**验证器,Verifier**)检查候选预测,该模块将其与错误模式知识库中的错误模式和规则进行比对,并产生最终的关系标签。形式上,整体预测过程定义为:
\(\hat{r}=g\left(f_\theta(s,e_1,e_2;\mathcal{D}_{\mathrm{ret}},\mathcal{K}_{\mathrm{ext}}),\mathcal{K}_{\mathrm{err}}\right)\),相似文章
介绍本体锚点:一种为人工智能提供您关注事项地图的机制
本文介绍了本体锚点(Ontology Anchor),这是一种推理时的支撑组件,帮助人工智能在长线程中持续理解操作者的优先事项和推理结构,从而解决上下文漂移问题。
ReaORE:大型推理模型驱动的推理引导渐进式开放关系抽取
提出了ReaORE,一个基于推理引导的开放关系抽取框架,通过从粗到细的推理逐步过滤和预测关系,在两个数据集上优于现有基线。
ChatHealthAI: 将电子健康记录表示与大型语言模型对齐以实现基于临床的推理
ChatHealthAI 是一个多模态推理框架,它将结构化 EHR 表示与冻结的 LLM 对齐,从而在保持预测性能的同时实现基于临床的推理。
基于约束锚定的推理轨迹
提出CART,一种神经符号框架,将自然语言推理步骤与符号约束断言交织在一起,以在链式思维轨迹中早期检测并纠正多模态LLMs的错误。将雪球率从65%降低到14%,并在多个基准上提高了准确性。
看得越多就知道得越多?面向多源视觉推理的单锚优势归一化
本文提出MARS,一种单锚多源推理框架,利用动态锚定量化信息增益,并在基于可验证奖励的强化学习过程中调节模态交互,在GRPO和DAPO上分别实现了3.2%和4.9%的性能提升,涵盖多个数据集。