SSE-Bio: 一种用于多跳生物医学推理的结构化自进化代理与代理检索策略

arXiv cs.CL 论文

摘要

SSE-Bio 提出了一种具有可训练检索策略的结构化自进化代理,以改善多跳生物医学推理,并展示了相较于基线的显著性能提升。

arXiv:2608.22132v1 公告类型:新 摘要:生物医学多跳问答(QA)要求模型在疾病、药物、蛋白质和表型等中间实体之间连接证据。现有代理通常依赖于静态检索工作流或粗粒度的提示重写,这在推理过程需要更新时可能导致指令漂移。我们提出SSE-Bio,一种用于多跳生物医学推理的结构化自进化代理,具有代理检索策略。SSE-Bio不是全局重写代理指令,而是维护结构化状态,通过可训练的代理策略选择性检索知识三元组和先验模板,并通过细粒度的模板编辑改进其推理记忆。为了优化检索决策,我们引入了一种基于群体相对策略优化的代理训练策略,其中代理通过决策对比组在替代检索选择中得到改进。在三个生物医学多跳QA基准上的实验表明,SSE-Bio持续优于现有基线,在BioHopR上比最强的自进化基线提高了6.56个绝对点。
查看原文
查看缓存全文

缓存时间: 2026/08/25 04:26

# SSE-Bio:用于多跳生物医学推理的结构化自演化智能体与代理检索策略  
来源:https://arxiv.org/html/2608.22132  
Zhaohan Meng  
所属机构:格拉斯哥大学计算科学学院  
所属机构:哈佛医学院,布莱根妇女医院,哈佛大学  
Zaiqiao Meng  
所属机构:格拉斯哥大学计算科学学院  
所属机构:剑桥大学语言技术实验室  
Hao Xu  
所属机构:哈佛医学院,布莱根妇女医院,哈佛大学  
Ke Yuan  
所属机构:格拉斯哥大学癌症科学学院  
所属机构:英国癌症研究中心苏格兰研究所  
z\.meng\.3@research\.gla\.ac\.uk  
Iadh Ounis  
所属机构:格拉斯哥大学计算科学学院  

###### 摘要  
生物医学多跳问答(QA)要求模型能够连接证据链,跨越疾病、药物、蛋白质和表型等中间实体。现有的智能体通常依赖静态检索工作流或粗粒度的提示重写,这在推理过程需要更新时可能导致指令漂移。我们提出了SSE-Bio,一个具有代理检索策略的结构化自演化智能体,用于多跳生物医学推理。SSE-Bio并非全局重写智能体指令,而是维护一个结构化状态,通过一个可训练的代理策略有选择地检索知识三元组和先前模板,并通过细粒度模板编辑来改进其推理记忆。为了优化检索决策,我们引入了基于分组相对策略优化(GRPO)的代理训练策略,该代理通过决策对比组来改进检索选择。在三个生物医学多跳QA基准上的实验表明,SSE-Bio始终优于现有基线,在BioHopR上比最强的自演化基线提高了6.56个百分点。SSE-Bio的源代码已公开发布于:https://github.com/ZhaohanM/SSE-Bio。

## 1 引言  
生物医学多跳问答(QA)任务对于基于证据的生物医学发现(例如疾病理解和药物重定位)至关重要[35](https://arxiv.org/html/2608.22132#bib.bib4)。它需要模型通过跨多个实体(如疾病、药物和蛋白质)进行推理来回答问题,这些实体通过复杂的生物医学关系相连接[30](https://arxiv.org/html/2608.22132#bib.bib10); [19](https://arxiv.org/html/2608.22132#bib.bib20); [31](https://arxiv.org/html/2608.22132#bib.bib5)。例如,一个以疾病为导向的生物医学问题可能需要一个系统首先识别与该疾病相关的桥接蛋白质,然后推断与该蛋白质相关的药物。这具有挑战性,因为生物医学证据高度专业化且具有关系结构,因此在解决中间桥接实体时的错误可能会误导后续的推理链,而在多答案设置中,系统必须避免在仅找到部分有效答案后过早停止[16](https://arxiv.org/html/2608.22132#bib.bib30); [4](https://arxiv.org/html/2608.22132#bib.bib27); [20](https://arxiv.org/html/2608.22132#bib.bib24)。  

最近的检索增强生成(RAG)模型通过将外部知识融入推理过程,提高了多跳生物医学QA的性能[10](https://arxiv.org/html/2608.22132#bib.bib31); [2](https://arxiv.org/html/2608.22132#bib.bib21); [24](https://arxiv.org/html/2608.22132#bib.bib7)。然而,若没有对推理路径的显式验证和反馈,它们可能无法解决中间的桥接实体,导致推理链漂移,并可能在多答案场景中返回不完整的答案。交互式多智能体系统通过支持逐步规划、执行和反馈,使这一过程更加灵活,而自演化智能体则进一步引入了长期记忆,以适应跨问题的推理策略[27](https://arxiv.org/html/2608.22132#bib.bib2); [8](https://arxiv.org/html/2608.22132#bib.bib16)。然而,这些代理系统仍然面临两个局限。首先,它们通常依赖静态的检索工作流,而非显式学习的检索控制,这可能导致性能不佳[11](https://arxiv.org/html/2608.22132#bib.bib35)。其次,它们的记忆更新通常是粗粒度的,通常通过提示级别的重写进行,因此局部失败可能改变整个推理框架[13](https://arxiv.org/html/2608.22132#bib.bib14); [6](https://arxiv.org/html/2608.22132#bib.bib15)。这些局限性促使我们寻求一个更可控的框架,该框架能将显式检索控制与细粒度记忆演化结合起来。  

为了解决这些局限性,我们提出了SSE-Bio,一个用于生物医学多跳QA的结构化自演化智能体与代理检索策略。如图1[1](https://arxiv.org/html/2608.22132#S1.F1)所示,SSE-Bio在一个统一的代理框架中将结构化推理记忆与显式检索管理相结合。在推理过程中,Manager将结构化状态转换为针对查询的计划,Dev智能体利用检索到的三元组执行该计划,而Critic提供结构化反馈以进行迭代优化。Manager维护两种形式的记忆:一种是捕获当前推理状态并作为智能体短期记忆的结构化状态,另一种是从先前成功案例中提炼出的可复用模板的长期记忆。关键的是,SSE-Bio并非通过全局重写来演化记忆,而是通过细粒度编辑来更新模板,从而实现局部且可审计的记忆演化,旨在缓解因无约束模板重写而导致的幻觉和指令漂移风险。此外,SSE-Bio引入了一个可训练的Proxy模型来显式管理检索,它在每个推理步骤决定是否应检索知识三元组和/或先前模板。知识三元组在生物医学领域是有益的,因为它们将复杂的生物医学信息组织成清晰的结构,为Manager在多跳验证期间提供结构化的桥接实体和关系路径。通过这种方式,SSE-Bio既支持推理记忆随时间的动态演化,也支持从当前推理状态进行自适应、选择性的检索,而不是依赖静态的检索管道或粗粒度的智能体重写。  

为了优化Proxy的检索行为,我们采用了两阶段训练策略。我们首先使用监督微调(SFT)来初始化Proxy,使用指示在给定结构化推理状态下是否需要检索知识三元组和/或先前模板的检索决策标签。这些标签通过比较替代检索分支并选择能导致更好下游推理结果的决策来构建。然后,我们使用分组相对策略优化(GRPO)[25](https://arxiv.org/html/2608.22132#bib.bib36)进一步优化Proxy。具体来说,我们引入了决策对比轨迹生成,将来自同一结构化推理状态的替代检索行动扩展为对比的展开分支。优化由答案基础奖励驱动,该奖励结合了最终答案正确性和证据支持的推理行为,使得GRPO倾向于选择既有效又有充分依据的检索决策。  

我们在三个生物医学推理基准(BioHopR、MedHop和“人类最后的考试:生物医学”)上评估了SSE-Bio,结果表明它始终优于强大的基线。我们的贡献总结如下:  
- 我们提出了SSE-Bio,一个用于多跳生物医学推理的结构化自演化智能体,它在一个单一的代理框架内统一了短期结构化状态跟踪、长期模板记忆和显式检索管理。  
- 我们引入了一种细粒度模板演化机制,通过从成功轨迹局部更新检索到的模板,减少了现有自演化智能体中使用的全模板重写所带来的不必要更改。  
- 我们为Proxy设计了一种基于GRPO的优化策略,该策略将决策对比轨迹生成与答案基础奖励信号相结合,在匹配的推理背景下比较检索分支,并通过有依据的监督来改进检索决策。  

参见图注  
图1:  
左图:Manager维护一个结构化状态和模板记忆。基于当前状态,Proxy决定是否检索知识三元组和/或先前模板。然后,Manager为Dev智能体制定一个计划,而Critic返回结构化反馈以进行迭代优化。  
右图:决策对比轨迹生成从同一状态探索替代检索行动,GRPO仅使用结合了正确性和证据支持的答案基础奖励来更新Proxy。

## 2 相关工作  
#### 生物医学RAG模型。  
它们通过将外部知识融入推理过程来改进生物医学QA[29](https://arxiv.org/html/2608.22132#bib.bib3); [5](https://arxiv.org/html/2608.22132#bib.bib22)。特别是,i-MedRAG[36](https://arxiv.org/html/2608.22132#bib.bib17)通过检索医学证据来支持答案生成,从而增强了生物医学QA。类似地,MedGraphRAG[34](https://arxiv.org/html/2608.22132#bib.bib19)将医学知识组织成图结构,以便检索能更好地反映生物医学关系。基于这一方向,KRAGEN[17](https://arxiv.org/html/2608.22132#bib.bib18)将知识图谱与检索增强推理相结合,用于生物医学问题求解。最近,AMG-RAG[24](https://arxiv.org/html/2608.22132#bib.bib7)通过代理式医学图检索进一步扩展了这一方向,以实现基于证据的推理。这些方法共同表明,外部知识可以改善生物医学多跳QA,但它们仍然缺乏对演化推理路径的显式验证和反馈,使其容易受到错误桥接实体解析和多答案设置中不完整答案的影响。  

#### 生物医学多智能体系统。  
它们通过专门的智能体角色实现逐步规划、执行和反馈,从而改善复杂的生物医学推理[1](https://arxiv.org/html/2608.22132#bib.bib26); [4](https://arxiv.org/html/2608.22132#bib.bib27)。MDAgents[14](https://arxiv.org/html/2608.22132#bib.bib28)通过协作的专家智能体改进医学推理。KGARevion[28](https://arxiv.org/html/2608.22132#bib.bib23)引入了一个基于知识图谱的智能体,用于知识密集型生物医学QA。Biomni[11](https://arxiv.org/html/2608.22132#bib.bib35)通过更广泛的生物医学工具使用进一步扩展了这一方向。除了这种多智能体协调之外,自演化系统旨在通过从先前轨迹中积累经验来改进跨问题的推理。STELLA[13](https://arxiv.org/html/2608.22132#bib.bib14)是一个自演化生物医学智能体,它通过不断演化的模板库和动态工具集随时间推移而改进。尽管它表明长期适应可以改善生物医学推理,但它在何时以及检索何种证据方面提供的控制有限,并且其自演化通过从新成功案例中重写模板来更新模板。相比之下,SSE-Bio明确地将状态感知的检索控制与结构化长期记忆相结合,后者通过细粒度的局部编辑进行演化,使得证据使用和记忆演化都更具约束性和可控性。

## 3 方法  
我们在第3.1节[1](https://arxiv.org/html/2608.22132#S3.SS1)中将SSE-Bio表述为一个迭代代理过程,然后在第3.2节[2](https://arxiv.org/html/2608.22132#S3.SS2)介绍其结构化记忆,在第3.3节[3](https://arxiv.org/html/2608.22132#S3.SS3)介绍代理检索策略,并在第3.4节[4](https://arxiv.org/html/2608.22132#S3.SS4)介绍Proxy策略训练。  

### 3.1 代理表述  
我们将SSE-Bio中的生物医学多跳推理表述为一个涉及四个组件的迭代代理过程:Manager、Proxy、Dev智能体和Critic。给定一个生物医学问题q,智能体的目标是解决中间实体、验证推理链并生成答案。在推理轮次t,Manager维护一个结构化状态\(u_t\)作为当前问题的短期记忆。根据\(u_t\),Proxy选择一个检索行动\(a_t\),该行动决定在当前步骤是否应引入外部知识。检索到的证据返回给Manager,Manager将其与\(u_t\)结合,为Dev智能体构建一个针对查询的特定计划\(\pi_t\)。SSE-Bio还维护一个从先前成功轨迹中提炼出的可复用模板的长期记忆\(\mathcal{E}\)。Dev智能体执行当前计划,产生一个推理轨迹\(\tau_t\)和答案\(\hat{y}_t\)。Critic(无法访问黄金答案)评估轨迹和答案是否连贯且有充分依据,并返回结构化反馈\(f_t\)进行优化。如果当前推理失败,Manager更新\(u_t\)并重新规划下一轮。如果成功,SSE-Bio通过细粒度模板编辑或新模板提炼来更新\(\mathcal{E}\)。因此,SSE-Bio通过每个问题内部的短期结构化状态跟踪和跨问题的长期记忆演化而不断进化。  

### 3.2 结构化记忆  
#### 短期记忆。  
在每个推理步骤,Manager维护一个结构化状态\(u_t\)作为当前问题的短期记忆。具体来说,任务类型表示当前问题的关系模式,信息缺口指定下一步推理所需的缺失证据,反馈记录Critic对当前轨迹的结构化评论,检索状态总结已经检索到的外部证据。这种状态紧凑地表示当前的推理状态,并使检索决策、规划和优化都基于同一显式结构,而不是分散在自由形式的中间文本中。结构化状态跨轮次更新以反映推理进展和Critic返回的结构化反馈。示例见图3[3](https://arxiv.org/html/2608.22132#A1.F3)。  

#### 长期记忆演化。  
除了当前问题之外,SSE-Bio还维护一个从先前成功案例中提炼出的可复用模板的长期记忆。每个模板通过一组固定字段存储可复用的推理经验:任务类型标识模板适用的模式,推理流程记录可复用的高级解决方案程序,验证标准指定返回答案前必须检查的条件,工具使用策略指定可用于支持推理过程的外部工具,失败警告突出显示应避免的常见错误。这些模板被作为新问题的规划先验进行检索。如果轨迹与检索到的模板一致,Manager执行细粒度模板编辑,仅更新需要优化的局部字段。否则,SSE-Bio执行新模板提炼,向记忆中添加一个新的可复用模板。这种设计实现了可控的记忆演化,并限制了在粗粒度重写下可能导致指令漂移的广泛模板更改类型。示例见图4[4](https://arxiv.org/html/2608.22132#A1.F4)。  

### 3.3 代理检索策略  
Proxy负责显式控制在每个推理轮次是否应引入外部知识。在推理轮次t,Proxy选择一个检索行动:\(a_t \sim \pi_\theta\)

相似文章