SAGEAgent: 用于多模态生存预测中成本感知模态获取的自进化智能体

arXiv cs.AI 论文

摘要

SAGEAgent 是一种基于LLM的临床智能体,它依次决定为癌症患者获取哪些诊断模态,以平衡预测准确性与临床侵入性,在将获取负担降低55%的同时,保持具有竞争力的生存预测性能。

arXiv:2607.09521v1 Announce Type: new Abstract: 每位癌症患者是否真的都需要完整的诊断检查来获得准确的生存预测?在多模态临床肿瘤学中,诊断模态遵循临床规定的逐步升级负担的顺序——从入院时收集的人口统计学信息到需要专业组织分析的基因组分析。当前的多模态生存方法要么假设所有模态都可用,要么被动处理缺失数据,但没有任何方法主动推理对于特定患者,在此有序工作流中获取下一个模态是否合理。我们将此问题形式化为一个序列决策问题,并提出了SAGEAgent(由经验引导的序贯获取),这是一种基于LLM的自进化临床智能体,它决定为每位患者获取哪些诊断模态,平衡预测准确性与临床侵入性。SAGEAgent通过临床工具(将数值预测转化为文本)、情景记忆(检索类似过往病例)和语义记忆(从经验中积累可复用的决策模式)来推理每位患者不断变化的诊断状态。在结合TCGA-LGG、TCGA-GBM和BraTS的胶质瘤队列上进行的实验,涉及四种诊断模态,表明SAGEAgent在保持具有竞争力的生存预测准确性的同时,将平均获取负担降低了55%。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:54

# SAGEAgent:一种用于多模态生存预测中成本感知模态获取的自我进化智能体
来源:https://arxiv.org/html/2607.09521
11institutetext:范德比尔特大学,美国田纳西州纳什维尔 37235
22institutetext:范德比尔特大学医学中心,美国田纳西州纳什维尔 37232
22email:yuankai\.huo@vanderbilt\.edu
崔灿,卢正宜,朱俊超,姚天元,郭俊林,熊巨明,朱燕帆,杨月晨,Bennett A\. Landman,霍元凯

###### 摘要

是否每位癌症患者真的都需要完整的诊断检查才能进行准确的生存预测?在多模态临床肿瘤学中,诊断方式遵循临床规定的渐进负担顺序——从入院时收集的人口统计学信息到需要专业组织分析的基因组分析。当前的多模态生存方法要么假定所有模态都可用,要么被动处理缺失数据,但没有一种方法能主动推理在该有序工作流程下,为特定患者获取下一模态是否合理。我们将此问题形式化为一个序列决策问题,并提出了SAGEAgent(Sequential Acquisition Guided by Experience,即经验指导的序列获取),一个自我进化、基于LLM的临床智能体,它能为每位患者决定获取哪些诊断模态,以平衡预测准确性与临床侵入性。SAGEAgent通过临床工具(将数值预测转化为文本)、情节记忆(检索相似既往病例)和语义记忆(从经验中积累可重复使用的决策规则)来推理每位患者不断演变的诊断状态。在结合TCGA-LGG、TCGA-GBM和BraTS四个诊断模态的胶质瘤队列上的实验表明,SAGEAgent实现了有竞争力的生存预测准确性,同时将平均获取负担降低了55%。代码已公开:https://github.com/Chongyu1117/SAGEAgent

## 1 引言

请参阅说明图1:模态获取策略概述。(a)现有方法:静态融合对所有模态一视同仁,强化学习学习自适应策略但无解释,基于LLM的方法在独立测试(无临床顺序)上进行推理。(b)SAGEAgent遵循临床获取顺序,在每一阶段根据临床工具、学习到的规则以及相似既往病例来决定是获取还是停止。患者A提前停止(节省83%负担);患者B则完成所有模态。

肿瘤学中的准确生存预测越来越依赖于整合多种诊断模态[3 (https://arxiv.org/html/2607.09521#bib.bib4),15 (https://arxiv.org/html/2607.09521#bib.bib3)],范围从常规的人口统计学和放射学到侵入性活检和分子分析[16 (https://arxiv.org/html/2607.09521#bib.bib23)]。这些模态遵循严格的临床顺序:影像学先于活检,而活检又为基因组分析提供标本。以往的多模态融合方法[5 (https://arxiv.org/html/2607.09521#bib.bib48),4 (https://arxiv.org/html/2607.09521#bib.bib24),8 (https://arxiv.org/html/2607.09521#bib.bib54)]通过固定策略组合所有可用模态,或在测试时处理缺失数据,但将预测视为静态问题——模型根据观察到的任何数据输出风险评分,而不推理对于该特定患者而言,下一步诊断是否值得。

序列测试获取已从两个方向进行研究。强化学习(RL)方法[2 (https://arxiv.org/html/2607.09521#bib.bib22),20 (https://arxiv.org/html/2607.09521#bib.bib21)]训练成本感知的获取策略,但会产生黑箱决策,限制了临床信任。基于大语言模型(LLM)的方法[13 (https://arxiv.org/html/2607.09521#bib.bib20),18 (https://arxiv.org/html/2607.09521#bib.bib19),1 (https://arxiv.org/html/2607.09521#bib.bib18)]提供透明的推理,但操作于独立的诊断测试,未能考虑临床模态获取中固有的序列依赖关系。这两种方法都没有模拟临床规定的顺序(比较见图1 (https://arxiv.org/html/2607.09521#S1.F1)(a))。

我们提出了SAGEAgent(Sequential Acquisition Guided by Experience),一个无需训练、自我进化、基于LLM的框架,用于多模态生存预测中的成本感知序列模态获取(图1 (https://arxiv.org/html/2607.09521#S1.F1)(b))。在临床顺序(人口统计学→放射学→病理学→基因组学)的每一阶段,SAGEAgent利用三个信号源决定是获取还是停止:将数值预测转化为文本的临床工具、检索相似既往病例的情节记忆,以及通过周期性自我反思积累决策规则的语义记忆——所有这些都不需要梯度更新。在结合TCGA-LGG[19 (https://arxiv.org/html/2607.09521#bib.bib16)]、TCGA-GBM[21 (https://arxiv.org/html/2607.09521#bib.bib17)]和BraTS[17 (https://arxiv.org/html/2607.09521#bib.bib15)]的胶质瘤队列上,采用嵌套5×5交叉验证,SAGEAgent在将获取负担比完全检查降低55%的同时,实现了有竞争力的生存预测准确性,并为每位患者的获取路径提供了透明推理。

我们的贡献有三点:

1.  在学习框架层面,我们提出了SAGEAgent,一个新颖的框架,将多模态生存预测中的成本感知模态获取形式化为一个序列决策问题,同时明确尊重诊断程序的临床顺序。
2.  在训练策略层面,我们引入了一种双记忆自我进化机制,能够从经验中自主发现决策规则,消除了对基于梯度的更新或手工设计先验的需求。
3.  在可解释性层面,我们在SAGEAgent中提供了完全可审计的推理路径,其中每个获取决策都基于显式的思维链推理,从而将成本感知的模态获取与临床透明度联系起来。

请参阅说明图2:SAGEAgent架构与推理。SAGEAgent流程:在每个阶段,冻结的预测器输出患者嵌入、风险评分和校准的不确定性。三个信号源为冻结的LLM提供信息:临床工具将数值输出转化为文本,情节记忆检索相似患者和既往决策,语义记忆提供学习到的决策规则。思维链推理:放射学后的真实推理轨迹,高亮显示了每个步骤对应的来源组件。智能体综合所有三个信号并决定停止,跳过侵入性病理学。自我进化:事件累积结果标签;反思模块分析哪些规则导致了良好或不良结果,并相应地更新语义记忆,形成一个无需梯度更新的闭环。

## 2 方法

### 2.1 问题形式化

考虑一个患者有N个诊断模态{m_1,...,m_N},按临床规定的获取顺序排列:m_1 → m_2 → … → m_N。对于胶质瘤,该顺序是人口统计学→放射学→病理学→基因组学,反映了真实的临床依赖关系[16 (https://arxiv.org/html/2607.09521#bib.bib23)]。每个模态m_i带有临床负担b(m_i)∈[0,1],通过多准则决策分析(MCDA)[11 (https://arxiv.org/html/2607.09521#bib.bib7)]量化,考虑货币成本、周转时间、患者侵入性和基础设施要求(详见第3.1节 (https://arxiv.org/html/2607.09521#S3.SS1))。在决策阶段t∈{1,...,N-1},智能体已获取前t个模态。决策是二元的:获取m_{t+1}(产生负担b(m_{t+1})),或停止并预测。目标是最大化预测准确性,同时最小化总获取负担B_t = Σ_{i=1}^t b(m_i)。图2 (https://arxiv.org/html/2607.09521#S1.F2)提供了所提出框架的概述。

### 2.2 具有校准不确定性的多模态预测器

生存预测器。预测骨干是一个基于Transformer的多模态编码器,通过可学习的掩码令牌处理缺失模态[9 (https://arxiv.org/html/2607.09521#bib.bib14),8 (https://arxiv.org/html/2607.09521#bib.bib54)]。它将患者的可用模态映射到一个融合嵌入e_t∈R^d,从中一个Cox比例风险头[7 (https://arxiv.org/html/2607.09521#bib.bib13)]产生标量风险评分r_t。预测器使用模态丢弃进行训练,并在智能体运行期间冻结。架构和训练细节见第3.2节 (https://arxiv.org/html/2607.09521#S3.SS2)。

校准的不确定性头。在冻结的预测器之上,我们训练一个轻量级不确定性头,用于估计如果获取更多模态,当前预测是否会改变。给定嵌入e_t和获取掩码a_t,它输出一个校准的概率:

u_t = σ(f_φ([e_t, a_t]))   (1)

其中f_φ是一个轻量级MLP,σ是sigmoid函数。当当前风险评分与全模态风险评分之间的绝对差值超过阈值τ时,训练标签为1,否则为0。训练数据是通过在完整模态患者上枚举临床顺序前缀掩码生成的。得到的u_t∈[0,1]是患者特异性和掩码特异性的,为智能体提供了一个关于额外数据是否可能重要的校准信号。

### 2.3 SAGEAgent:基于LLM的获取智能体

SAGEAgent构建在一个冻结的LLM上,该LLM不接收梯度更新。在每个阶段,它收集诊断信号,检索相关经验,并输出一个二元决策(获取或预测)以及思维链解释。其行为仅通过两个记忆系统改进,遵循认知科学中的情节-语义区分[24 (https://arxiv.org/html/2607.09521#bib.bib12)]。

临床决策工具。两个工具将冻结预测器的数值输出转化为文本。不确定性工具报告来自公式1的u_t,并根据训练分布的五分位数阈值给出分类级别(极低到极高)。生存预测器工具报告风险评分r_t及其相对于训练队列的位置(低于/大约/高于平均水平)。两个工具均以自然语言句子形式呈现输出,使得所有推理都在文本空间中进行。

情节记忆。情节记忆通过两种互补的检索机制提供基于案例的推理。病例检索从FAISS索引的[10 (https://arxiv.org/html/2607.09521#bib.bib8)]训练患者数据库中抽取,通过l2归一化嵌入上的余弦相似度返回k个最近邻及其事件状态(存活或死亡)和生存时间。这提供了一个静态的临床参考:哪些训练患者与当前患者相似,以及他们存活了多久。事件回忆从智能体自身的过去决策中检索。当智能体获取m_{t+1}时,它获得一个阶段奖励R_stage = -b(m_{t+1}) + max(0, u_t - u_{t+1}),该奖励惩罚成本并奖励不确定性降低。当智能体在阶段t停止时,一个终端奖励R_term = (1 - u_t) - B_t倾向于在低不确定性下尽早停止。检索是阶段匹配的,并按余弦相似度sim(e_t, e_j)与最小-最大归一化事件奖励r̃_j∈[0,1]之和重新排序,返回前k个事件,包括采取的行动及其结果。

语义记忆与自我进化。语义记忆存储通过周期性自我反思发现的可解释决策规则。每条规则按获取阶段t和行动方向d∈{停止, 获取}进行索引。每个事件之后,我们记录智能体是否遵循或违反了每条相关规则。每N_r个事件(一个反思周期),事件按总奖励排序,前四分之一和后四分之一的事件分别标记为好和差。规则有效性是遵循该规则的事件中导致好结果的比例。反思模块接收有效性报告并提出新规则,并验证这些规则的方向清晰性和新颖性。持续导致不良结果的规则被弃用,形成一个闭环,其中规则被发现、验证,然后被强化或移除。

## 3 实验与结果

### 3.1 数据集与评估协议

数据集与划分。我们在一个包含962名患者的胶质瘤队列上进行评估(803名来自TCGA-LGG/GBM[19 (https://arxiv.org/html/2607.09521#bib.bib16),21 (https://arxiv.org/html/2607.09521#bib.bib17)]和159名来自BraTS[17 (https://arxiv.org/html/2607.09521#bib.bib15)]),涵盖按临床顺序排列的四个诊断模态:人口统计学、放射学、病理学和基因组学,每个模态由预训练提取器编码为32维特征向量[8 (https://arxiv.org/html/2607.09521#bib.bib54)]。在962名患者中,170名拥有所有四个模态,构成评估集。我们采用嵌套的5×5交叉验证。外层循环将170名患者分为5折(136/34),用于智能体训练和评估。每个内部5折在136名患者加上通过模态丢弃增强的792名部分模态患者上训练预测器,产生25个独立管线。每位患者的决策通过多数投票(≥3/5内部模型)聚合。我们报告5个外层折的平均值±标准差。

临床负担。我们通过MCDA[11 (https://arxiv.org/html/2607.09521#bib.bib7)]量化模态成本,考虑货币成本、周转时间、侵入性和基础设施要求。归一化后,每个模态的负担为:人口统计学0.03、放射学0.14、病理学0.53、基因组学0.30,完全检查的总负担B=1.0。

指标。我们报告C-index[14 (https://arxiv.org/html/2607.09521#bib.bib10)]、平均负担和超体积HV = (c - 0.5) × (1.0 - b),该指标将准确性与成本的权衡表示为单个标量。

表1:胶质瘤生存队列上的核心结果(170名完整模态患者)。顶部 (a) 按升序排列的C-index。基于RL的方法形成一个约0.73的低簇,而其余六种方法的C-index高于0.8。顶部 (b) C-index(实心)和负担(阴影)针对六种C-index>0.8的方法。底部:每种方法的细分。= 170名患者,= 5名患者,颜色在这些值之间线性变化。† = SAGEAgent使用的预测器骨干。
![[无标题图片]](https://arxiv.org/html/2607.09521v1/fig_results.png)

| 类别 | 方法 | C-index↑ | 负担↓(节省%) | 人口统计学 | 放射学 | 病理学 | 基因组学 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| 静态 | 拼接融合 | 0.812±.040 | 1.000 (0%) | | | | |
| | MCAT[6 (https://arxiv.org/html/2607.09521#bib.bib6)] | 0.817±.046 | 1.000 (0%) | | | | |
| | MMD[8 (https://arxiv.org/html/2607.09521#bib.bib54)] | 0.822±.032 | 1.000 (0%) | | | | |
| | 自注意力融合† | 0.825±.050 | 1.000 (0%) | | | | |
| 基于RL | Bernardino et al.[2 (https://arxiv.org/html/2607.09521#bib.bib22)] | 0.742±.058 | 0.125 (88%) | | | | |
| | 获取 | PRECISE-AS[20 (https://arxiv.org

相似文章

SAGE:基于智能体引导的随机提示优化

arXiv cs.CL

介绍了SPO,一种用于自动提示优化的随机搜索框架,包含三种策略,其中包括SAGE,一种智能体引导的多智能体流水线。在基准测试上进行了评估,并部署在心理健康聊天机器人上,通过持续优化显示出在留存率方面的改进。