EMBL AI Librarian:面向AI代理的生命科学知识层
摘要
论文介绍了EMBL AI Librarian,这是一个知识层,允许生命科学AI代理使用自然语言查询Europe PMC并直接获得证据。它在多个基准测试中提升了检索和下游任务性能,并公开了代码。
arXiv:2607.28229v1 公告类型:新
摘要:互联网正越来越多地被AI代理而非人类访问。每个代理都需要知识,尤其是在生命科学领域,代理化流程正在快速增长。文献获取是这一需求的关键部分,欧洲PMC等资源拥有超过4000万条索引记录,被广泛用于满足这一需求。然而,这些资源并非为AI代理而建:它们接受关键词和复杂语法,并返回整篇论文,因此每个代理必须学习语法、执行多次搜索、阅读全文才能找到所需的证据。我们引入了EMBL AI Librarian,一个为AI代理升级欧洲PMC接口的知识层:代理用自然语言提问,并收到能回答问题的证据。一个单一的LLM编排整个知识检索过程:它规划互补的子查询,由实时欧洲PMC搜索引擎执行,然后阅读选中的论文并定位相关证据。我们在四个基准上评估了Librarian:文献综合、声明验证、开放域问答,以及下游生物学任务(如协议问题和序列操作)。在ScholarQABench上,Librarian比近期发布的最强基线在Citation F1上提高了超过16个点。作为现有声明验证管道的检索层使用时,它提高了与专家共识的一致性;在开放形式的LitQA2基准上,GPT-5.4代理在基于Librarian时比使用网络搜索的得分高出约8个点。总体而言,我们的结果表明,为生命科学代理配备Librarian知识层可以提升一系列任务的性能。我们在https://github.com/petroni-lab/librarian公开发布了代码。
查看缓存全文
缓存时间: 2026/07/31 10:04
# EMBL AI Librarian:面向AI代理的生命科学知识层 来源: https://arxiv.org/abs/2607.28229 作者:Luigi Sigillo (https://arxiv.org/search/cs?searchtype=author&query=Sigillo,+L),Matteo Silvestri (https://arxiv.org/search/cs?searchtype=author&query=Silvestri,+M),Francesco Tabaro (https://arxiv.org/search/cs?searchtype=author&query=Tabaro,+F),Rajat Bhatnagar (https://arxiv.org/search/cs?searchtype=author&query=Bhatnagar,+R),Syed Irtaza Mubashar (https://arxiv.org/search/cs?searchtype=author&query=Mubashar,+S+I),Matt Jeffryes (https://arxiv.org/search/cs?searchtype=author&query=Jeffryes,+M),Daljit Nijjer (https://arxiv.org/search/cs?searchtype=author&query=Nijjer,+D),Vittorio Perera (https://arxiv.org/search/cs?searchtype=author&query=Perera,+V),Ola Spjuth (https://arxiv.org/search/cs?searchtype=author&query=Spjuth,+O),Julio Saez-Rodriguez (https://arxiv.org/search/cs?searchtype=author&query=Saez-Rodriguez,+J),Melissa Harrison (https://arxiv.org/search/cs?searchtype=author&query=Harrison,+M),Fabio Petroni (https://arxiv.org/search/cs?searchtype=author&query=Petroni,+F) 查看 PDF (https://arxiv.org/pdf/2607.28229) > 摘要:互联网正越来越多地由AI代理而非人类访问。每个代理都需要知识,尤其是在生命科学领域,基于代理的流水线正在快速增长。对文献的获取是这一需求的关键组成部分,拥有超过4000万条索引记录的Europe PMC等资源被广泛用于满足这一需求。然而,这些资源并非为AI代理而建:它们接受关键词和复杂语法,返回整篇论文,因此每个代理都必须学习其语法,多次搜索,并阅读全文才能找到所需的证据。我们推出了EMBL AI Librarian,这是一个知识层,为AI代理升级了Europe PMC的接口:代理以自然语言提问,即可收到回答问题的证据。单一的LLM编排整个知识检索过程:它规划由实时Europe PMC搜索引擎执行的互补子查询,然后阅读选定的论文并定位相关证据。我们在四个基准测试上评估了Librarian:文献综合、声明验证、开放域问答,以及诸如实验方案问题和序列操作等下游生物学任务。在ScholarQABench上,与近期发表的强基线相比,Librarian将Citation F1提高了超过$16$分。当用作现有声明验证流水线的检索层时,它提高了与专家共识的一致性;在开放式LitQA2基准上,GPT-5.4代理在以Librarian为知识源时,得分比使用网页搜索高约$8$分。总体而言,我们的结果表明,为生命科学代理配备Librarian知识层可提升其在多种任务上的表现。我们在此https URL公开了代码 (https://github.com/petroni-lab/librarian) ## 提交历史 来自: Luigi Sigillo \[查看电子邮件 (https://arxiv.org/show-email/b477de96/2607.28229)\] **\[v1\]** 2026年7月30日星期四 14:00:27 UTC \(817 KB\)
相似文章
"Excuse me, may I say something..." CoLabScience,一个用于生物医学发现和大语言模型-专家协作的主动型AI助手
CoLabScience介绍了一个用于生物医学研究的主动型大语言模型助手,它使用PULI(正无标签学习干预)这一新颖的强化学习框架,在科学讨论中自主进行干预,决定何时以及如何提供上下文感知的见解。该工作还包括BSDD,一个新的基准数据集,由基于PubMed文章的模拟研究对话和干预点组成。
介绍 LifeSciBench
OpenAI 推出 LifeSciBench,这是一个包含 750 个专家编写任务的基准测试,用于评估 AI 系统在现实生命科学研究工作流中的表现,包括证据处理、分析和科学推理。
@tom_doerr: AIPOCH 整理了一个包含超过550个医学研究智能体技能的库,支持证据洞察、方案设计等工作流程…
AIPOCH 发布了包含超过550个医学研究智能体技能的精选库,用于支持证据洞察、方案设计、数据分析和学术写作,并且兼容 Claude Code 和 Codex 等多个 AI 智能体平台。
基准测试生物学 AI 智能体:ML@B 与 LatchBio 的合作
加州大学伯克利分校机器学习团队(ML@B)与 LatchBio 合作,对其 AI 智能体在空间转录组工作流程中的性能进行了基准测试,评估其自动化复杂生物信息学任务的能力。
PersonalAI 2.0: 通过规划机制增强知识图谱遍历与检索,面向个性化LLM智能体
PersonalAI 2.0 引入了一个框架,通过集成外部知识图谱与动态多阶段查询处理及自适应规划机制,增强了基于LLM的系统,在多个基准测试中实现了幻觉率降低和精度提升。