TumorBoard:基于证据的多智能体决策支持系统,用于纵向神经肿瘤学

arXiv cs.AI 论文

摘要

TumorBoard 是一个用于纵向神经肿瘤学的多智能体决策支持系统,它利用共享的纵向病例状态和可审计的声明-证据账本。在包含360个病例的基准测试中,它优于基线模型,并且安全治理机制减少了有害推荐。

arXiv:2608.03190v1 公告类型:新 摘要:神经肿瘤学决策需要协调解读系列MRI、病理学、分子标志物、治疗史、体能状态以及不断更新的指南。我们提出了TumorBoard,一个围绕共享纵向病例状态和可审计的声明-证据账本构建的多智能体决策支持系统。放射学、神经病理学、分子诊断、指南和治疗计划等专科智能体产生带有来源的原子性声明。对抗性评论者揭示矛盾,安全治理机制根据证据充分性和时间有效性来发布、限定或推迟推荐。在匹配token预算的360例隐藏基准测试中,TumorBoard实现了动作F1为0.772,证据蕴含为0.914。它比最强的类型化委员会基线高出3.1个百分点(95%置信区间:1.6至4.7,校正p=0.0012),推荐到证据的覆盖率达到0.927。在证据删除情况下,系统推迟了84.2%的不安全病例,并将有害推荐限制在5.8%。安全治理机制在误推迟成本为4.3个百分点的情况下,将有害发布减少了7.8个百分点。对账本、评论者和治理机制的消融研究产生了预期的失败模式,确立了结构化协调是所测得的智能体优势的来源。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:39

# 1 引言

来源:https://arxiv.org/html/2608.03190

TumorBoard:面向纵向神经肿瘤学的基于证据的多智能体决策支持系统

Yantong Liu1,∗, Zheyu Zhang1, Runpeng Liu1, Muxitang2, Seong-Yoon Shin1,∗, and Hyun-Ae Lee1,∗

1群山国立大学计算机信息工程系,韩国群山 54150  
2清华大学车辆与移动学院,中国北京 100084  
∗通讯作者:[email protected] (https://arxiv.org/html/2608.03190v1/mailto:[email protected])

摘要。神经肿瘤学决策需要对系列MRI、病理学、分子标志物、治疗史、体能状态以及不断更新的指南进行协调解读。我们提出了TumorBoard,一个围绕共享纵向病例状态和可审计的声明-证据账本构建的多智能体决策支持系统。负责放射学、神经病理学、分子诊断、指南和治疗规划的专科智能体生成带有来源的原子声明;对抗性审查器显式指出矛盾;安全治理器根据证据充分性和时间有效性放行、限定或延迟推荐。在匹配token预算的360例隐藏基准测试中,TumorBoard实现了行动F1为0.772,证据蕴含为0.914。它比最强的类型化委员会基线高出3.1个百分点(95% CI 1.6至4.7,校正后p=0.0012),同时推荐-证据覆盖率达到0.927。在证据删除条件下,该系统延迟了84.2%的不安全病例,并将有害推荐限制在5.8%。安全治理器以4.3个百分点的错误延迟代价换取了有害放行降低7.8个百分点。账本、审查器和治理器的消融实验产生了预期的失败模式,证实结构化协调是所测多智能体优势的来源。

语言智能体将推理与外部动作、工具调用、记忆和迭代批判相结合[1 (https://arxiv.org/html/2608.03190#bib.bib1),2 (https://arxiv.org/html/2608.03190#bib.bib2),3 (https://arxiv.org/html/2608.03190#bib.bib3)]。多智能体框架通过对话协调、角色专业化和显式工作流结构扩展了这一模式[4 (https://arxiv.org/html/2608.03190#bib.bib4),5 (https://arxiv.org/html/2608.03190#bib.bib5),6 (https://arxiv.org/html/2608.03190#bib.bib6),7 (https://arxiv.org/html/2608.03190#bib.bib7)]。临床智能体提案认为,真实任务需要证据获取、时间综合和可问责的行动边界[8 (https://arxiv.org/html/2608.03190#bib.bib8)]。这些能力与多学科神经肿瘤学的结构相匹配,在该领域中,没有任何单一信息来源能够解决病例。

临床机会伴随着一个严峻的评估陷阱。更大的提示词、更多的token或重复采样可能使多智能体系统看起来优于单一模型。流畅的共识也可能掩盖循环一致。因此,TumorBoard将协调视为一个实验变量。每个系统变体都使用相同的主干模型、检索语料库、病例信息和总推理预算。唯一被操纵的因素是通信协议。

医学语言模型展现出强大的知识和摘要性能,而系统评估则暴露了在证据使用、校准和高风险推荐方面的错误[9 (https://arxiv.org/html/2608.03190#bib.bib9),10 (https://arxiv.org/html/2608.03190#bib.bib10),11 (https://arxiv.org/html/2608.03190#bib.bib11),12 (https://arxiv.org/html/2608.03190#bib.bib12),13 (https://arxiv.org/html/2608.03190#bib.bib13),14 (https://arxiv.org/html/2608.03190#bib.bib14),15 (https://arxiv.org/html/2608.03190#bib.bib15),16 (https://arxiv.org/html/2608.03190#bib.bib16),17 (https://arxiv.org/html/2608.03190#bib.bib17)]。检索增强的临床模型改善了获取最新知识的途径[18 (https://arxiv.org/html/2608.03190#bib.bib18),19 (https://arxiv.org/html/2608.03190#bib.bib19),20 (https://arxiv.org/html/2608.03190#bib.bib20),21 (https://arxiv.org/html/2608.03190#bib.bib21)]。报告和治理工作进一步要求透明的评估、人工审查、公平性分析和显式不确定性沟通[22 (https://arxiv.org/html/2608.03190#bib.bib22),23 (https://arxiv.org/html/2608.03190#bib.bib23),24 (https://arxiv.org/html/2608.03190#bib.bib24),25 (https://arxiv.org/html/2608.03190#bib.bib25),26 (https://arxiv.org/html/2608.03190#bib.bib26),27 (https://arxiv.org/html/2608.03190#bib.bib27),28 (https://arxiv.org/html/2608.03190#bib.bib28),29 (https://arxiv.org/html/2608.03190#bib.bib29)]。神经肿瘤学指南和反应标准构成了合适的试验场,因为决策依赖于分子分型、纵向影像、既往治疗和版本化证据[30 (https://arxiv.org/html/2608.03190#bib.bib30),31 (https://arxiv.org/html/2608.03190#bib.bib31),32 (https://arxiv.org/html/2608.03190#bib.bib32),33 (https://arxiv.org/html/2608.03190#bib.bib33),34 (https://arxiv.org/html/2608.03190#bib.bib34),35 (https://arxiv.org/html/2608.03190#bib.bib35),36 (https://arxiv.org/html/2608.03190#bib.bib36),37 (https://arxiv.org/html/2608.03190#bib.bib37),38 (https://arxiv.org/html/2608.03190#bib.bib38)]。

TumorBoard引入了四种机制。时间线整理器将异构记录转换为事件图。专科智能体读取任务受限视图并提交原子声明。声明-证据账本记录支持、矛盾、时间范围和来源版本。安全治理器在主席智能体综合最终响应之前应用前置条件和风险规则。这种设计使每个推理依赖关系都可接受审计。

参见图注 图1:纵向TumorBoard工作流程。异构患者记录进入时间线整理器、共享病例状态、专科委员会、安全治理器和保留来源的输出。
主要科学风险是伪协作。多个智能体可能重复陈述同一模型信念,放大早期错误,并在未增加独立证据的情况下消耗额外token。TumorBoard直接应对这种攻击。角色具有不相交的信息职责,消息遵循类型化模式,共识是基于带有来源链接的声明而非散文计算的。评估在匹配总推理预算的情况下比较各变体,并衡量无支持的共识。只有当多智能体增益在控制模型、检索语料库、上下文和生成token后仍然存在时,才予以认定。

神经肿瘤学提供了一个严格的纵向环境。一个推荐可能对新诊断的疾病是正确的,但在进展后是错误的;可能在一种分子分型下正确,在重新分型后过时;或者虽然在技术上得到支持,但由于体能状态和既往毒性发生变化而不安全。因此,系统将时间有效性和前置条件表示为图结构。最终输出是一个决策记录,保留已知内容、冲突内容、仍然缺失的内容以及需要人工升级的内容。

## 2 相关工作

### 2.1 语言智能体与多智能体协调

ReAct、Toolformer和Reflexion确立了动作、工具使用和自我批判原语[1 (https://arxiv.org/html/2608.03190#bib.bib1),2 (https://arxiv.org/html/2608.03190#bib.bib2),3 (https://arxiv.org/html/2608.03190#bib.bib3)]。AutoGen、CAMEL、MetaGPT和AgentBench提供了编排模式和评估经验[4 (https://arxiv.org/html/2608.03190#bib.bib4),5 (https://arxiv.org/html/2608.03190#bib.bib5),6 (https://arxiv.org/html/2608.03190#bib.bib6),7 (https://arxiv.org/html/2608.03190#bib.bib7)]。TumorBoard用类型化协议取代了自由形式的对话。消息包含声明、证据指针、置信度、前置条件、矛盾目标和请求的动作。这种限制将协调失败转变为可观察的图缺陷。

### 2.2 医学大型语言模型

临床知识基准和面向临床医生的研究显示出快速进展[9 (https://arxiv.org/html/2608.03190#bib.bib9),10 (https://arxiv.org/html/2608.03190#bib.bib10),11 (https://arxiv.org/html/2608.03190#bib.bib11),12 (https://arxiv.org/html/2608.03190#bib.bib12),13 (https://arxiv.org/html/2608.03190#bib.bib13),14 (https://arxiv.org/html/2608.03190#bib.bib14),15 (https://arxiv.org/html/2608.03190#bib.bib15),16 (https://arxiv.org/html/2608.03190#bib.bib16),17 (https://arxiv.org/html/2608.03190#bib.bib17)]。证据摘要和检索系统推动了基于来源生成的使用[18 (https://arxiv.org/html/2608.03190#bib.bib18),19 (https://arxiv.org/html/2608.03190#bib.bib19),20 (https://arxiv.org/html/2608.03190#bib.bib20),21 (https://arxiv.org/html/2608.03190#bib.bib21)]。TumorBoard聚焦于纵向决策构建。一个病例可能包含时间上不兼容的事实,例如术前病理、治疗后强化、后来的分子重新分型以及过时的治疗推荐。共享状态表示有效区间和取代边。

### 2.3 神经肿瘤学决策结构

弥漫性胶质瘤管理依赖于WHO综合诊断、EANO和SNO-EANO指南、CNS肿瘤学实践建议以及RANO反应评估[30 (https://arxiv.org/html/2608.03190#bib.bib30),31 (https://arxiv.org/html/2608.03190#bib.bib31),32 (https://arxiv.org/html/2608.03190#bib.bib32),33 (https://arxiv.org/html/2608.03190#bib.bib33),34 (https://arxiv.org/html/2608.03190#bib.bib34),35 (https://arxiv.org/html/2608.03190#bib.bib35)]。这些文件提供了版本化的决策约束。TumorBoard将其决策条款存储为可检索的证据单元,同时保留文档身份、发布日期、章节和推荐强度。

通用智能体框架提供了有用的原语,但临床协调需要更强的边界。工具调用必须返回版本化证据。记忆必须区分源事件和派生结论。批判必须指出声明及其被违反的前置条件。终止必须取决于未解决的风险而不是对话一致性。TumorBoard在一个可以逐字段进行消融的协议中实现这些要求。

医学检索系统改善了事实获取,但当检索到的段落冲突或超出患者状态时,仍允许无支持的综合。指南推荐是带有群体、疾病状态、既往治疗和证据强度限定条件的条件规则。指南智能体保留这些限定条件,并将其附加到每个推荐边。然后安全治理器在放行前检查患者状态是否满足边的先决条件。

## 3 任务定义

给定按事件时间排序的患者记录D = {d_1, ..., d_T},系统必须生成一份结构化肿瘤委员会记录,包含当前疾病状态、未解决的问题、鉴别解释、推荐的下一步行动、禁忌症、证据引用、置信度和延迟触发条件。答案根据专家裁决和原始文档进行评估。

协调协议P定义了智能体角色、可见状态字段、消息模式、通信边、停止条件和风险规则。实验问题是,在固定模型M、检索语料库K和推理预算B下,P是否提高效用U。效用包括决策准确性、证据蕴含、矛盾解决、安全延迟、延迟时间和token成本。

金标准是经裁决的行动图,而不是单一参考段落。节点编码当前疾病状态、所需检查、可接受的治疗选项、监测行动、禁忌症和延迟决定。有向边编码前置条件、替代方案、排除条件和时间顺序。这种表示法承认临床有效的替代方案,并惩罚遗漏决定性前置条件的推荐。文本生成在映射回图之后进行评分,使流畅性与决策正确性分离。

## 4 TumorBoard架构

### 4.1 时间线整理器与共享病例状态

整理器提取事件,包括事件时间、文档记录时间、来源、确定性和取代链接。它对药物、手术、影像、病理和分子实体进行规范化。时间一致性检查器标记不可能的顺序和未解决的日期歧义。共享状态包含不可变的原始证据指针以及一个派生层。智能体可以提出派生事实,但不能修改源证据。

### 4.2 专科智能体

放射学智能体比较系列检查,并区分进展、治疗效应、假性进展和不确定性。神经病理学智能体解释形态学和综合诊断。分子智能体检查IDH、1p/19q、ATRX、TP53、TERT、EGFR、7/10号染色体和MGMT证据。指南智能体根据年龄、体能状态、疾病状态、既往治疗和来源版本检索适用条款。治疗规划器将接受的证据转换为带有前置条件和监测计划的排序选项。

参见图注 图2:专科通信网络。每个提案进入声明-证据账本,矛盾在主席解决之前始终保持显式。

### 4.3 类型化通信与声明-证据账本

每条消息遵循一个模式:claim_id、claim_text、claim_type、evidence_ids、temporal_scope、confidence、prerequisites、conflicts、proposed_action。账本是一个有向图。支持边将证据连接到声明。冲突边连接互不兼容的声明。取代边编码更新的病理或指南版本。依赖边将推荐连接到所需发现。循环支持被拒绝,因为声明不能作为自身上游的证据。

### 4.4 对抗性审查器

审查器接收病例状态和声明确认图,而不是其他智能体的隐藏推理。它搜索缺失证据、过时推荐、类别错误、禁忌症和过度自信语言。然后它提出有针对性的挑战。专科智能体必须用新证据回应、降低置信度、修改声明,或请求人工审查。当图没有未解决的高风险矛盾或迭代预算耗尽时,辩论终止。

### 4.5 安全治理器和主席

治理器根据前置条件完备性、证据蕴含、指南时效性、矛盾状态和风险等级评估每条推荐。放行状态为支持、限定、延迟和阻止。主席总结已接受的声明,保留分歧,并生成面向行动的报告。它不能覆盖被阻止状态。人工升级是一类输出,并带有明确原因。

参见图注 图3:声明-证据账本和安全闸门。原子声明在放行前经过检索、蕴含、冲突解决和风险检查。

时间线整理器解决重复事件,并区分事件时间与文档记录时间。病理修正取代早期诊断,但不删除历史记录。放射学比较继承所引用的检查日期。药物暴露包括开始时间、停止时间、可用时的累积剂量以及已记录的毒性。模糊日期产生区间值事件和不确定性标志。下游智能体同时看到规范化状态和不可变证据指针。

专科智能体的提示词紧凑且角色受限。放射学智能体不能发布治疗建议。治疗规划器不能重新解释病理切片。指南智

相似文章

基于数字孪生模拟的治疗响应优化临床决策支持AI系统

arXiv cs.AI

本文提出了一种在线自适应的临床决策支持AI系统,该系统整合了治疗效果估计、数字孪生模拟和强化学习,以在安全、临床医生监督的方式下推荐治疗方案,并在合成模拟器和TCGA卵巢癌数据集上进行了验证。