EMBL AI Librarian:面向AI代理的生命科学知识层

arXiv cs.CL 论文

摘要

论文介绍了EMBL AI Librarian,这是一个知识层,允许生命科学AI代理使用自然语言查询Europe PMC并直接获得证据。它在多个基准测试中提升了检索和下游任务性能,并公开了代码。

arXiv:2607.28229v1 公告类型:新 摘要:互联网正越来越多地被AI代理而非人类访问。每个代理都需要知识,尤其是在生命科学领域,代理化流程正在快速增长。文献获取是这一需求的关键部分,欧洲PMC等资源拥有超过4000万条索引记录,被广泛用于满足这一需求。然而,这些资源并非为AI代理而建:它们接受关键词和复杂语法,并返回整篇论文,因此每个代理必须学习语法、执行多次搜索、阅读全文才能找到所需的证据。我们引入了EMBL AI Librarian,一个为AI代理升级欧洲PMC接口的知识层:代理用自然语言提问,并收到能回答问题的证据。一个单一的LLM编排整个知识检索过程:它规划互补的子查询,由实时欧洲PMC搜索引擎执行,然后阅读选中的论文并定位相关证据。我们在四个基准上评估了Librarian:文献综合、声明验证、开放域问答,以及下游生物学任务(如协议问题和序列操作)。在ScholarQABench上,Librarian比近期发布的最强基线在Citation F1上提高了超过16个点。作为现有声明验证管道的检索层使用时,它提高了与专家共识的一致性;在开放形式的LitQA2基准上,GPT-5.4代理在基于Librarian时比使用网络搜索的得分高出约8个点。总体而言,我们的结果表明,为生命科学代理配备Librarian知识层可以提升一系列任务的性能。我们在https://github.com/petroni-lab/librarian公开发布了代码。
查看原文
查看缓存全文

缓存时间: 2026/07/31 10:04

# EMBL AI Librarian:面向AI代理的生命科学知识层

来源: https://arxiv.org/abs/2607.28229

作者:Luigi Sigillo (https://arxiv.org/search/cs?searchtype=author&query=Sigillo,+L),Matteo Silvestri (https://arxiv.org/search/cs?searchtype=author&query=Silvestri,+M),Francesco Tabaro (https://arxiv.org/search/cs?searchtype=author&query=Tabaro,+F),Rajat Bhatnagar (https://arxiv.org/search/cs?searchtype=author&query=Bhatnagar,+R),Syed Irtaza Mubashar (https://arxiv.org/search/cs?searchtype=author&query=Mubashar,+S+I),Matt Jeffryes (https://arxiv.org/search/cs?searchtype=author&query=Jeffryes,+M),Daljit Nijjer (https://arxiv.org/search/cs?searchtype=author&query=Nijjer,+D),Vittorio Perera (https://arxiv.org/search/cs?searchtype=author&query=Perera,+V),Ola Spjuth (https://arxiv.org/search/cs?searchtype=author&query=Spjuth,+O),Julio Saez-Rodriguez (https://arxiv.org/search/cs?searchtype=author&query=Saez-Rodriguez,+J),Melissa Harrison (https://arxiv.org/search/cs?searchtype=author&query=Harrison,+M),Fabio Petroni (https://arxiv.org/search/cs?searchtype=author&query=Petroni,+F)

查看 PDF (https://arxiv.org/pdf/2607.28229)

> 摘要:互联网正越来越多地由AI代理而非人类访问。每个代理都需要知识,尤其是在生命科学领域,基于代理的流水线正在快速增长。对文献的获取是这一需求的关键组成部分,拥有超过4000万条索引记录的Europe PMC等资源被广泛用于满足这一需求。然而,这些资源并非为AI代理而建:它们接受关键词和复杂语法,返回整篇论文,因此每个代理都必须学习其语法,多次搜索,并阅读全文才能找到所需的证据。我们推出了EMBL AI Librarian,这是一个知识层,为AI代理升级了Europe PMC的接口:代理以自然语言提问,即可收到回答问题的证据。单一的LLM编排整个知识检索过程:它规划由实时Europe PMC搜索引擎执行的互补子查询,然后阅读选定的论文并定位相关证据。我们在四个基准测试上评估了Librarian:文献综合、声明验证、开放域问答,以及诸如实验方案问题和序列操作等下游生物学任务。在ScholarQABench上,与近期发表的强基线相比,Librarian将Citation F1提高了超过$16$分。当用作现有声明验证流水线的检索层时,它提高了与专家共识的一致性;在开放式LitQA2基准上,GPT-5.4代理在以Librarian为知识源时,得分比使用网页搜索高约$8$分。总体而言,我们的结果表明,为生命科学代理配备Librarian知识层可提升其在多种任务上的表现。我们在此https URL公开了代码 (https://github.com/petroni-lab/librarian)

## 提交历史

来自: Luigi Sigillo \[查看电子邮件 (https://arxiv.org/show-email/b477de96/2607.28229)\] **\[v1\]** 2026年7月30日星期四 14:00:27 UTC \(817 KB\)

相似文章

"Excuse me, may I say something..." CoLabScience,一个用于生物医学发现和大语言模型-专家协作的主动型AI助手

arXiv cs.CL

CoLabScience介绍了一个用于生物医学研究的主动型大语言模型助手,它使用PULI(正无标签学习干预)这一新颖的强化学习框架,在科学讨论中自主进行干预,决定何时以及如何提供上下文感知的见解。该工作还包括BSDD,一个新的基准数据集,由基于PubMed文章的模拟研究对话和干预点组成。

介绍 LifeSciBench

OpenAI Blog

OpenAI 推出 LifeSciBench,这是一个包含 750 个专家编写任务的基准测试,用于评估 AI 系统在现实生命科学研究工作流中的表现,包括证据处理、分析和科学推理。