用于乳腺癌治疗推荐的自主系统

arXiv cs.CL 论文

摘要

评估了利用72个临床案例生成乳腺癌治疗推荐的自主LLM系统,发现最佳系统(采用D&C+SA流程的Claude Opus 4.8)的全局得分为0.594,但由于持续存在的错误,尚不足以用于无监督临床使用。

arXiv:2607.12051v1 Announce Type: new 摘要:大型语言模型(LLMs)正越来越多地被探索用于临床决策支持,但它们在复杂肿瘤治疗规划中的可靠性仍不明确。我们利用72个真实临床案例(涵盖I至IV期)以及通过非对称信息评分标准生成(AIRG)生成的1,147个案例特定评分标准,评估了用于生成乳腺癌治疗推荐的自主LLM系统。在AIRG过程中,评分标准生成器可以获取真实临床决策,而评估模型无法获取。我们比较了七种流程,包括单LLM基线、工具增强系统以及具备事实核查和自主子智能体生成能力的多智能体架构。性能最佳配置是采用D&C+SA流程的Claude Opus 4.8,其全局得分为0.594 ± 0.025。工具使用和智能体自主性的提升效果不一,在某些设置中提高了性能,但在其他设置中则降低了性能。性能因临床领域和疾病分期而异,肿瘤学家主导的错误分析揭示了持续存在的临床相关失败,包括不正确或缺失的建议、有缺陷的论证、引用错误、过时的断言以及过度自信。这些发现表明,自主LLM系统能够生成临床相关乳腺癌推荐,但仍不足以用于无监督临床使用。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:21

# 面向乳腺癌治疗建议的智能体系统
来源:https://arxiv.org/html/2607.12051
Vinicius Anjos de AlmeidaVinicius Anjos de Almeida 任职于 Spesia, Alameda Dom Pedro II, 574, 80420\-060, Curitiba, Paraná, 巴西,同时任职于 Faculdade de Medicina, Universidade de São Paulo, Av\. Dr\. Arnaldo, 455, 01246\-903, São Paulo, São Paulo, 巴西(通讯作者,电子邮箱:vinicius\.almeida@spesia\.com\.br)。
Nícolas Henrique BorgesLeonardo VicenziLeonardo Vicenzi 任职于 Spesia,同时也任职于 Laboratory of Artificial Intelligence Applied to Bioinformatics, SEPT, Universidade Federal do Paraná (UFPR), Rua Alcides Vieira Arcoverde, 1225, 81520\-260, Curitiba, Paraná, 巴西(电子邮箱:leonardo\.vicenzi@spesia\.com\.br)。
Helena KociolekHelena Kociolek 任职于 Spesia, Pontifícia Universidade Católica do Paraná (PUCPR), R\. Imac\. Conceição, 1155, 80215\-901, Curitiba, Paraná, 巴西,以及 Universidade Federal do Paraná (UFPR), Rua Alcides Vieira Arcoverde, 1225, 81520\-260, Curitiba, Paraná, 巴西(电子邮箱:helenakociolek@hotmail\.com)。
Sarah Miriã de Castro RochaSarah Miriã de Castro Rocha 任职于 Spesia,同时也任职于 Pontifícia Universidade Católica do Paraná (PUCPR)(电子邮箱:sarah\.miria@pucpr\.edu\.br)。
Frederico Nassif GomesFrederico Nassif Gomes 任职于 Spesia,同时也任职于 Pontifícia Universidade Católica do Paraná (PUCPR)(电子邮箱:frednassifgomes@gmail\.com)。
Júlia Cristina Ferreira RibeiroJúlia Cristina Ferreira Ribeiro 任职于 Spesia,同时也任职于 Pontifícia Universidade Católica do Paraná (PUCPR)(电子邮箱:f\.cristina1@pucpr\.edu\.br)。
Lucas Emanuel Silva e Oliveira Lucas Emanuel Silva e Oliveira 任职于 Spesia,同时也任职于 Pontifícia Universidade Católica do Paraná (PUCPR)(电子邮箱:lucas\.oliveira@spesia\.com\.br)。

###### 摘要

大型语言模型(LLMs)在临床决策支持中的应用日益受到关注,但其在复杂肿瘤治疗规划中的可靠性仍不明确。我们利用72个真实临床病例(涵盖I至IV期)以及通过非对称信息评分指标生成(AIRG)生成的1,147个病例特异性评分指标,对用于乳腺癌治疗建议生成的智能体LLM系统进行了评估。评分指标生成器能够获取评估模型无法获取的真实临床决策。比较了七种处理流程,包括单LLM基线、工具增强型系统以及具有事实核查和自主子智能体生成功能的多智能体架构。表现最佳的配置是采用D&C+SA流程的Claude Opus 4.8,其总体得分为0.594 ± 0.025。工具使用和智能体自主性提升的效果存在差异,在某些设定下提升了性能,但在其他设定下却导致性能下降。性能因临床领域和疾病分期而异,由肿瘤学家主导的错误分析揭示了持续存在的临床相关失败模式,包括错误或遗漏的建议、有缺陷的理由、引用错误、过时的声明以及过度自信。这些发现表明,智能体LLM系统能够生成临床相关的乳腺癌建议,但仍不足以用于无监督的临床使用。

## 1 引言

大型语言模型(LLMs)在生物医学和临床任务中取得了快速进步,在医学执照考试和其他标准化基准测试中表现优异[43 (https://arxiv.org/html/2607.12051#bib.bib23),39 (https://arxiv.org/html/2607.12051#bib.bib20),5 (https://arxiv.org/html/2607.12051#bib.bib26)]。通用LLMs和专门的临床AI系统都显示出在辅助医疗从业者获取医学知识方面具有巨大潜力[48 (https://arxiv.org/html/2607.12051#bib.bib21),12 (https://arxiv.org/html/2607.12051#bib.bib52)]。这些结果激发了人们对将LLM作为临床决策支持工具的日益增长的兴趣,特别是在临床医生需要综合来自指南、临床记录、科学文献和患者特定因素的异质性信息的领域中。

乳腺癌治疗是评估基于LLM的决策支持的一个重要临床场景。治疗规划可能涉及全身治疗、手术、放疗、基因检测、补充检查以及顺序决策,这些决策因分期、肿瘤生物学、患者状况、既往治疗、当地资源可用性和不断更新的指南而异。在许多机构中,复杂病例会在多学科肿瘤委员会中进行讨论,建议由肿瘤内科医生、外科医生、放射肿瘤科医生、放射科医生、病理科医生、遗传学家和其他专家的综合专业知识共同形成。这使得乳腺癌治疗建议生成成为一项具有挑战性且具有临床意义的任务,用于评估LLM系统是否能够支持细微的治疗决策制定。

先前的研究已经探索了LLM在乳腺癌诊疗中的应用,包括肿瘤委员会中的临床决策支持[44 (https://arxiv.org/html/2607.12051#bib.bib27),31 (https://arxiv.org/html/2607.12051#bib.bib30),17 (https://arxiv.org/html/2607.12051#bib.bib32),23 (https://arxiv.org/html/2607.12051#bib.bib34),45 (https://arxiv.org/html/2607.12051#bib.bib41)]、手术计划[7 (https://arxiv.org/html/2607.12051#bib.bib38)]、基于指南的问答[40 (https://arxiv.org/html/2607.12051#bib.bib28),20 (https://arxiv.org/html/2607.12051#bib.bib31)]以及信息提取流程[42 (https://arxiv.org/html/2607.12051#bib.bib33)]。类似的应用也在其他癌种中得到了研究,包括结肠癌[25 (https://arxiv.org/html/2607.12051#bib.bib35)]、前列腺癌[47 (https://arxiv.org/html/2607.12051#bib.bib42)]、头颈癌[27 (https://arxiv.org/html/2607.12051#bib.bib36),41 (https://arxiv.org/html/2607.12051#bib.bib48)]和肺癌[52 (https://arxiv.org/html/2607.12051#bib.bib37)]。尽管这些研究表明LLM可能产生临床上有用的输出,但它们也揭示了重要的局限性。先前在乳腺癌肿瘤委员会环境中的研究报道了与专家建议的不完全一致、有害或不适当的决策、对治疗顺序理解不足、整合手术史方面的困难,以及在特定治疗场景中与肿瘤科医生的一致性仅为中等水平[44 (https://arxiv.org/html/2607.12051#bib.bib27),31 (https://arxiv.org/html/2607.12051#bib.bib30),17 (https://arxiv.org/html/2607.12051#bib.bib32),18 (https://arxiv.org/html/2607.12051#bib.bib44),23 (https://arxiv.org/html/2607.12051#bib.bib34),45 (https://arxiv.org/html/2607.12051#bib.bib41),1 (https://arxiv.org/html/2607.12051#bib.bib45)]。

大多数先前的评估集中于单模型提示或直接比较LLM生成的建议与专家决策。关于智能体系统、工具使用和多智能体架构是否能提高肿瘤学治疗建议质量,我们知之甚少。Liu等人[30 (https://arxiv.org/html/2607.12051#bib.bib46)]开发了EvoMDT,该系统由多模态本体归一化知识库、五智能体工作流以及每次任务后的自我改进循环组成,在此循环中,系统根据其自身对输出的反馈来优化提示。该系统在多个问答基准测试以及来自405名真实肺癌、乳腺癌或肝癌或淋巴瘤患者的回顾性数据上进行了评估。每个病例都包含患者状况的结构化摘要和专家治疗计划,作为评估的参考标准。EvoMDT实现了与医生相当的回答质量,特别是在安全性和完整性方面,并且在淋巴瘤病例中表现出稳定的性能。与临床医生相比,它在响应时间方面也提供了优势。其他尝试包括将GPT-4与多模态精准肿瘤学工具[13 (https://arxiv.org/html/2607.12051#bib.bib47)]、通用医学计算工具[15 (https://arxiv.org/html/2607.12051#bib.bib49)]、风险预测工具[29 (https://arxiv.org/html/2607.12051#bib.bib50)]以及特定领域检索流程[14 (https://arxiv.org/html/2607.12051#bib.bib51)]相结合。据我们所知,当模型配备不同的工具组合和不同程度的自主性时,其行为仍然研究不足。

原则上,访问网络搜索、PubMed搜索和全文检索等工具可能使LLM能够检索到最新的证据和指南。类似地,多智能体架构可以将复杂的临床任务分解为更易管理的子任务,例如全身治疗、手术、放疗和补充检查。然而,这些方法也引入了新的失败模式。模型必须知道何时搜索、如何构建有用的查询、如何评估来源的相关性、如何将检索到的证据与患者特定信息整合,以及如何避免过度自信或缺乏依据的结论。因此,工具使用和智能体分解的益处无法假设,必须通过实证评估。

第二个挑战是评估。临床治疗建议很难使用精确匹配标签或简单的全局判断进行评分,因为正确的答案通常是部分的、依赖于上下文的且是多维的。基于评分指标的评估通过将回答质量分解为多个标准提供了一种灵活的替代方案,允许模型因令人满意的临床建议而获得分数,同时因不安全、缺乏依据或不适当的内容而受到惩罚。这种方法已在最近的医学LLM基准测试(如HealthBench和HealthBench Professional)中使用[3 (https://arxiv.org/html/2607.12051#bib.bib11),21 (https://arxiv.org/html/2607.12051#bib.bib12)]。然而,由专家撰写的评分指标成本高昂,尤其是在肿瘤学等专业领域。

本研究旨在回答四个研究问题:
问题1:当前前沿LLM能从真实临床病例中生成乳腺癌治疗建议的准确度有多高?
问题2:外部工具、多智能体分解、事实核查和智能体自主性提升如何影响建议质量,这些影响在不同模型间是否有差异?
问题3:系统性能在乳腺癌不同分期和临床领域(包括全身治疗、手术、放疗和补充检查)之间如何变化?
问题4:在表现最佳的智能体系统生成的建议中,仍然存在哪些临床相关的失败模式?

我们使用真实临床病例和基于病例特异性评分指标的评分,评估了用于乳腺癌治疗建议生成的智能体系统。我们做出四项主要贡献。首先,我们使用一个包含72例I至IV期乳腺癌病例的精选数据集和1,147个基于真实肿瘤科医生决策的病例特异性评分指标,对七种治疗建议生成流程进行了基准测试,包括单LLM基线、工具增强型系统以及具有递增智能体自主性的多智能体架构。其次,我们引入了AIRG作为一种实用工作流,用于在专家意见稀缺或成本高昂的专业临床领域中生成评估评分指标。第三,我们对一种表现最佳的模型-流程组合生成的回答进行了详细的肿瘤学家主导的错误分析,以描述临床相关的失败模式。第四,我们公开了实验的源代码,以支持可重复性和未来在临床导向的医学AI系统评估方面的工作。

## 2 方法

#### 数据收集。

原始数据收集自巴西库里蒂巴的一家私立肿瘤诊所。抽样病例为2023年至2025年间在该机构就诊的组织学证实为浸润性乳腺癌的患者。病例从电子健康记录(EHR)数据库中抽取,如果在仔细审查临床记录后,这些病例包含足够的临床、病理、生物标志物、分期和治疗信息,并且负责该病例的肿瘤科医生做出的临床决策已明确陈述,则纳入研究。

在某些病例中,临床决策包括机构多学科肿瘤委员会(MTB)的建议,这些建议也被视为病例的参考标准。MTB是一种标准的、多学科决策制定过程,全球多家卫生机构采用,并在适用时可能涉及临床肿瘤科医生、乳腺外科医生、放射肿瘤科医生、放射科医生、病理科医生、遗传学家以及其他参与癌症诊疗的专家。MTB会议专门针对复杂病例,这些病例中缺乏明确的指南或可靠的科学证据,或者可用资源不理想,必须做出临床决策。

经过抽样和EHR审查后,共选择了72例病例构建评估数据集。这些病例包括18名患者,分别代表乳腺癌I、II、III和IV期。

一个由一名持证医师监督的五名医学生组成的团队审查了每个病例的临床记录,并创建了结构化病例摘要,包括人口统计学数据、诊断、组织病理学诊断、生物标志物和患者体能状态评分。每份摘要之后是该患者治疗做出的一组临床决策,包括全身治疗、外科治疗、放疗和所要求的补充检查。

#### AI模型工具包。

LLM通常配备工具以扩展其在不同任务中的效用。在本研究中,使用了两种以模型上下文协议(MCP)服务器形式实现的工具:由Parallel.ai[38 (https://arxiv.org/html/2607.12051#bib.bib4)]提供支持的网络搜索;以及通过官方PubMed公共API[35 (https://arxiv.org/html/2607.12051#bib.bib3)]提供的PubMed搜索。MCP[34 (https://arxiv.org/html/2607.12051#bib.bib2)]是一个由Linux基金会[28 (https://arxiv.org/html/2607.12051#bib.bib1)]托管的开源项目,允许AI应用程序以一致的方式连接到外部数据源、工具和工作流。

多家公司为智能体系统提供网络搜索工具,包括OpenAI[36 (https://arxiv.org/html/2607.12051#bib.bib6)]、Google[16 (https://arxiv.org/html/2607.12051#bib.bib7)]、Exa.ai[10 (https://arxiv.org/html/2607.12051#bib.bib8)]、Tavily[46 (https://arxiv.org/html/2607.12051#bib.bib9)]和Parallel.ai[38 (https://arxiv.org/html/2607.12051#bib.bib4)]。本研究选择Parallel.ai搜索工具,是因为它在多个已发布的基准测试中的表现及其成本效益[37 (https://arxiv.org/html/2607.12051#bib.bib5)]。比较不同的网络搜索工具超出了本研究的范围。

美国国家生物技术信息中心提供一个公开API[35 (https://arxiv.org/html/2607.12051#bib.bib3)],允许自动化系统搜索PubMed数据库、检索文章信息和摘要,并且对于开放获取出版物,检索完整手稿。该API服务通过一个开源实现[49 (https://arxiv.org/html/2607.12051#bib.bib10)]转换为MCP服务器,并为本研究进行了定制。

#### 评分指标生成。

本研究中使用评分指标的直接灵感来自OpenAI开发的HealthBench[3 (https://arxiv.org/html/2607.12051#bib.bib11)]和HealthBench Professional[21 (https://arxiv.org/html/2607.12051#bib.bib12)]基准测试。评分指标由一个标准和相关联的分数组成。标准定义了被评估文本的一个可能存在或不存在的属性。分数是一个从-10到+10的值,表示该属性在当前任务的文本回答中可取或不取的程度。理想情况下,

相似文章

基于数字孪生模拟的治疗响应优化临床决策支持AI系统

arXiv cs.AI

本文提出了一种在线自适应的临床决策支持AI系统,该系统整合了治疗效果估计、数字孪生模拟和强化学习,以在安全、临床医生监督的方式下推荐治疗方案,并在合成模拟器和TCGA卵巢癌数据集上进行了验证。

大语言模型在代理式临床推理中的信息寻求失败

arXiv cs.AI

本文为血液肿瘤学中的临床推理开发了一个代理式评估框架,发现大语言模型的主要失败原因在于系统性的信息寻求缺陷,而非知识不足,其错误模式类似于新手临床医生的认知偏差。