从投票到智能体协作:面向答案类型的BioASQ 14b大语言模型流水线
摘要
本文针对BioASQ 14b Task B生物医学问答挑战,提出了一种问题类型特定的大语言模型框架。该框架对是非题、事实题和列表题分别采用不同的推理策略(片段打乱、思维链、多智能体协作),取得了具有竞争力的结果,包括在第四批次的事实题子任务中获得第一名。
arXiv:2607.06452v1 公告类型:新
摘要:生物医学问答不仅需要从科学文献中准确提取信息,还需要跨多文档可靠地整合证据。本研究提出了一种针对BioASQ 14b Task B的问题类型特定大语言模型框架,旨在提高生物医学问答中的答案鲁棒性和证据基础。该框架不采用对所有问题统一的提示策略,而是根据是非题、事实题和列表题的不同推理与评估需求,选择不同的推理流程。对于是非题,采用片段打乱和自我反思来降低对证据顺序的敏感性并提高决策稳定性;对于事实题,结合完整片段输入与基于思维链的上下文学习,以支持准确的生物医学实体识别;对于列表题,采用多智能体架构,由多个智能体协作完成证据提取、候选生成、答案验证和最终聚合。在BioASQ 13b上的初步实验用于确定每种问题类型的有效推理策略,随后在官方BioASQ 14b Task B挑战中评估了最终的框架。在官方评估中,我们的框架在多个批次中表现出色,并在第四批次的事实题子任务中获得第一名。这些结果证明了结合问题类型特定推理、集成预测和基于智能体的验证对于可靠的生物医学问答的有效性。
查看缓存全文
缓存时间: 2026/07/08 04:42
# 从投票到代理协作:面向BioASQ 14b的答案类型感知大语言模型管道 来源:https://arxiv.org/html/2607.06452 \\copyrightclause 版权所有 © 本文作者。根据知识共享署名4.0国际许可协议(CC BY 4.0)允许使用。 \\conference CLEF 2026 工作笔记,2026年9月21-24日,德国耶拿 \[orcid=0009-0009-7096-6410, [email protected], \]\\fnmark\[1\] \[orcid=0009-0008-3165-6973, [email protected], \]\\fnmark\[1\] \[orcid=0009-0005-6216-3096, [email protected], \]\\fnmark\[1\] \[orcid=0009-0005-8354-666X, [email protected], \]\\fnmark\[1\] \[orcid=0009-0003-1675-8414, [email protected], \]\\fnmark\[1\] \[[email protected], \]\\cormark\[1\] \\fntext \[1\]这些作者对本文贡献相同。\\cortext\[1\]通讯作者。 Eunha Lee¹, Wonjune Jang¹, Sohyun Chung¹, Junha Jung¹, Jaewoo Kang²† ¹计算机科学与工程系,高丽大学,首尔02841,韩国 ²数学系,明知大学,龙仁17058,韩国 ³AIGEN Sciences,首尔04778,韩国 (2026) ###### 摘要 生物医学问答不仅需要从科学文献中准确提取信息,还需要跨多个文档可靠地整合证据。本研究提出了一个针对BioASQ 14b任务B的、面向问题类型的大语言模型(LLM)框架,旨在提升生物医学问答中的答案鲁棒性和证据依据。该框架不采用单一提示策略,而是根据是/否、事实型和列表型问题的不同推理和评估要求,选择不同的推理流程。对于是/否问题,使用片段打乱和自反思来降低对证据顺序的敏感性,提高决策稳定性。对于事实型问题,将完整片段输入与基于思维链的上下文学习相结合,以支持准确的生物医学实体识别。对于列表型问题,采用多代理架构,其中证据提取、候选生成、答案验证和最终聚合以协作方式进行。在BioASQ 13b上的初步实验用于确定每种问题类型的有效推理策略,所得框架随后在官方的BioASQ 14b任务B挑战中进行评估。在官方评估中,我们的框架在多个批次中展示了竞争性的性能,并在第4批次的事实型子任务中获得第一名。这些结果证明了结合问题类型特定推理、集成预测和基于代理的验证对于可靠生物医学问答的有效性。 ###### 关键词: BioASQ 14b\\sep LLM\\sep 多代理系统\\sep 思维链\\sep 提示工程\\sep ## 1 引言 生物医学文献的规模日益增长,使得研究人员和医疗专业人员越来越难以针对专业问题识别出精确可靠的答案。重要证据往往分布在多篇文章中,使用不同的术语表达,或在部分互补且有时相互矛盾的背景下报道。因此,生物医学问答系统不能仅依赖文档检索。它们必须结合上下文阅读证据,连接分布在多个片段中的发现,并返回足够简洁以供评估、同时又源于原始文献的答案。BioASQ挑战一直通过评估系统在生物医学语义索引和问答任务上的表现,作为推动此类能力发展的重要基准[Tsatsaronis2015BioASQ, nentidis2026bioasq14]。特别是,BioASQ任务B要求系统从生物医学文献证据片段中生成精确和理想的答案,使其成为在大语言模型(LLM)中评估基于证据推理的合适测试平台[nentidis2026bioasq14, Krithara2023BioASQQA]。 BioASQ任务B包含几种答案格式,其中是/否、事实型和列表型问题提出了不同的推理挑战。是/否问题需要基于可能分散或矛盾的证据做出稳定的二元决策。事实型问题需要准确识别特定的生物医学实体,如药物、基因、疾病或分子靶点,其中术语的微小变化会直接影响精确匹配评估。列表型问题在覆盖率和验证方面更具挑战性,因为系统必须检索出多个正确实体,同时避免无依据或重复的预测。尽管这三种类型都基于相同的片段集合,但它们在推理要求和评估标准上存在显著差异[Krithara2023BioASQQA]。这表明,单一的推理策略可能无法对所有问题类型同等有效。 最近的LLM在医学问答和推理方面展现出强大能力,特别是在提供相关上下文证据的检索增强设置中[lievin2024medical, singhal2025toward, zhang2025leveraging, jung2026breaking]。然而,它们在生物医学问答中的应用仍受到若干实际问题的制约。首先,模型输出可能对检索片段的顺序和组成敏感,即使基础证据未变,也会产生不稳定的预测[kim2025prompting, liu2023lostmiddlelanguagemodels, zhang2025leveraging]。其次,当多个片段包含重叠或矛盾信息时,LLM可能无法识别哪些证据应主导最终答案[Zong_2025, lewis2021retrievalaugmentedgenerationknowledgeintensivenlp]。第三,面向实体的问答需要仔细的输出归一化和证据依据,因为可能生成看似合理但无依据的生物医学术语[Merker2024MiBiAB, nentidis2025overviewbioasq2025thirteenth]。最后,幻觉答案在可靠性可追溯性至关重要的生物医学领域尤为成问题[zhu-etal-2025-trust, asgari2025framework]。先前关于检索增强生物医学LLM的工作表明,领域特定的检索和自反思可以提高答案可靠性和证据使用[jeong2024improvingmedicalreasoningretrieval, ateia2024bioragentretrievalaugmentedgenerationshowcasing]。这些局限性促使我们采取明确考虑证据组织、答案验证和问题特定特征的推理流程。 在这项工作中,我们提出了一个为BioASQ 14b任务B开发的、基于类型的LLM集成和代理问答框架。我们的框架不采用统一的推理流程,而是根据问题类型分配专门的策略。这些策略通过在BioASQ 13b数据上的初步实验选定,并随后在官方的BioASQ 14b评估中部署。先前的研究已独立证明了LLM集成和代理问答框架的鲁棒性[panou2024farming, roh2026clag],但我们的贡献在于统一这两种方法。对于是/否问题,我们应用片段打乱与自反思[shinn2023reflexionlanguageagentsverbal]相结合,以降低对证据顺序的敏感性并提高二元决策的一致性。对于事实型问题,我们将完整片段输入与基于思维链的上下文学习[wei2023chainofthoughtpromptingelicitsreasoning, wang2023selfconsistencyimproveschainthought]相结合,以支持精确识别生物医学实体。对于列表型问题,我们采用多代理协作架构,其中证据提取、候选生成、验证和最终答案聚合在独立但协调的阶段中执行[tang2024medagentslargelanguagemodels, ateia2024bioragentretrievalaugmentedgenerationshowcasing]。类似的面向代理架构最近已在BioASQ的生物医学问答中得到探索[angulo2025aqams]。 为了进一步提高鲁棒性,我们将选定的类型特定策略应用于多个LLM,并使用适合任务的集成程序整合它们的输出。该设计旨在减轻特定模型的偏差,同时保留每种答案格式的独特要求。在官方的BioASQ 14b任务B评估中, `ku_dmis` 在评估的批次和问题类型中展示了竞争性性能。值得注意的是,根据MRR[BioASQ14bResults],它在第4批次的事实型子任务中排名第一。这些结果支持了结合问题类型特定推理、集成预测和显式验证机制对于基于LLM的生物医学问答的可靠性。 ## 2 任务设置 BioASQ倡议旨在推进生物医学问题自动问答系统的研究。BioASQ 14b使用由生物医学专家准备的英文生物医学问题和基准数据。在14b任务B阶段,组织者提供与A阶段发布相同的问题,以及金标准相关文章和片段。系统可以针对任何问题类型返回理想的段落答案,并对是/否、事实型和列表型问题返回精确答案[BioASQ14bGuidelines]。2026年测试集分四个批次发布,在每批金标准片段可用后,B阶段答案需提交[BioASQ14bGuidelines]。 **是/否**。给定提供的片段,系统必须确定适当答案是“是”还是“否”。一个代表性例子是:“肿瘤细胞能否被重编程为免疫细胞?”在许多情况下,得出正确的是/否决策需要从多个片段中提取和聚合信息,而不是依赖于单个段落。性能使用**准确率**或**宏平均F1分数**来衡量,其中“是”和“否”作为独立类别处理。对于是/否问题,我们遵循了BioASQ6中引入的官方BioASQ精确答案评估协议[malakasiotis2020evaluation]。F1分数分别针对“是”和“否”类别计算,得到F1y和F1n。对于F1y,“是”被视为正类,而对于F1n,“否”被视为正类。官方分数是宏平均F1分数: maF1 = (F1y + F1n) / 2 该分数对两个答案类别的表现赋予同等重要性。 **事实型**。这类问题要求给出简洁的回答,传达所询问的特定事实内容。例如:“人类暴露的最常见遗传毒性因素是什么?”系统需要返回一个最多包含5个实体名称的列表,按置信度降序排列。金标准答案表示为一个嵌套列表,每个内部列表将相同正确答案的同义或等价表达分组在一起。 事实型问题使用**严格准确率(SAcc)**、**宽泛准确率(LAcc)** 和**平均倒数排名(MRR)** 进行评估。SAcc仅在金标准实体名称或其同义词之一作为系统返回列表的第一项出现时认为答案正确;而LAcc在金标准实体或同义词在返回列表的任何位置出现时即认为正确。尽管SAcc和LAcc为完整性而报告,但事实型精确答案的官方指标是MRR[malakasiotis2020evaluation]。MRR评估返回列表中第一个正确答案的排名位置,当金标准答案或其同义词越靠近顶部时分数越高。在下面的定义中,对于每个事实型问题qi,搜索包含金标准实体名称的最顶层位置。如果最顶层位置是第j个,则r(i) = j。 MRR = (1/n) * ∑_{i=1}^{n} 1/r(i) 其中n是事实型问题的数量。 **列表型**。列表型问题要求系统返回多个正确的实体名称。一个代表性例子是:“列出与受体EGFR相互作用的信号分子(配体)?”与事实型问题期望单个最佳答案或少量别名排名列表不同,列表型问题评估系统是否检索到尽可能多的不同金标准实体。每个金标准实体可能包含同义词,如果系统返回金标准实体的同义词,则算作正确匹配。同一实体的重复提及仅计数一次。对于每个列表型问题,将系统返回的列表与金标准列表进行比较,使用精确率、召回率和F1分数。返回答案的顺序不影响分数;只考虑预测集和黄金集之间的重叠。分数在所有列表型问题上平均,列表型问题的官方BioASQ评估指标是**平均F1分数**[malakasiotis2020evaluation]。 ## 3 系统概述 请参见图1图1:BioASQ 14b精确答案生成管道的整体架构。图1总结了整体架构。系统首先根据BioASQ问题类型对每个问题路由。每个分支接收问题文本和金标准片段。我们没有使用单一的通用提示;相反,每个分支使用针对其预期答案空间定制的提示模式和聚合策略。最后阶段在提交前验证输出格式,对二元问题强制使用是/否标签,对事实型问题强制使用最多五个条目的排名列表,对列表型问题强制使用列表式实体输出。 该系统的运行基于推理时驱动和提示驱动。多个LLM被用作互补的生物医学推理器,它们的输出被聚合以减少对单个模型提示解释的敏感性。主要的聚合逻辑因问题类型而异:是/否问题采用多数投票,事实型答案采用共识过滤,列表型答案采用代理式证据验证。 ## 4 方法 在BioASQ-14b挑战期间,提交批次的官方测试结果未公开。因此,我们将BioASQ-13b测试集作为开发基准,用于比较候选提示策略、模型骨干、片段处理方法以及基于代理的变体。表1、表2和表3分别报告了这些针对是/否、事实型和列表型问题的初步实验。基于这些开发结果,我们为每种问题类型选择了最稳健的策略,并将系统应用于官方的BioASQ-14b评估。 ### 4.1 是/否问题 是/否子系统旨在从矛盾证据中产生稳定的二元决策。如表1所示,多种方法在BioASQ-13b开发基准上取得了强劲性能。先前的基线指在BioASQ-13b是/否子任务中达到最先进性能的系统[kim2025prompting]。我们在此基线上扩展了自反思、重复推理和验证代理,以增强是/否预测的鲁棒性。 基于这些发现,最终的是/否子系统采用四种LLM配置的集成:GPT-5 Thinking、GPT-5 Pro[openai\_gpt5]、GPT-4o[openai\_gpt4o] 和 Gemini 3.0 Thinking[google\_gemini3]。GPT-4o被包含是因为它与GPT-5系列模型保持竞争力,并且偶尔在
相似文章
让LLMs相互评判:用于医学问答的多智能体同行评审推理
本文介绍了一种多智能体同行评审推理方法,其中多个LLM独立生成思维链推理,然后相互评估输出以选择最佳答案。该方法在医学问答基准测试中优于单模型推理和多数投票。
AgentFinVQA: 一种可部署的多代理管道,用于可审计的金融图表问答
AgentFinVQA是一个多代理管道,用于金融图表问答,它将查询分解为规划、OCR、图例确认、视觉检查和验证步骤,并将每一步记录在可追溯的模型评估包中。与零样本基线相比,它实现了显著的准确性提升,同时支持本地部署和可审计性。
面向QANTA 2026的基于置信度校准与增量推理的任务特定多模态问答智能体
本文提出了一种面向QANTA 2026共享挑战的任务特定双智能体架构,用于多模态问答。该架构使用GPT-4.1-mini处理需要置信度校准的抢答题,并使用GPT-4.1处理需要结构化推理的附加题。该系统在整体排行榜上取得了最高分,展示了高效推理策略的有效性。
基准测试生物学 AI 智能体:ML@B 与 LatchBio 的合作
加州大学伯克利分校机器学习团队(ML@B)与 LatchBio 合作,对其 AI 智能体在空间转录组工作流程中的性能进行了基准测试,评估其自动化复杂生物信息学任务的能力。
AISE-Bench:面向学术知识图谱信息检索的全流程精选基准
本文介绍了AISE-Bench,一个包含1,133个问答对的精选基准,用于评估LLM智能体在学术知识图谱上的多步API规划和基于源的可信摘要。该基准显示,即使是最强的模型也仅达到中等性能,凸显了步骤正确性和可追踪推理方面的挑战。