基于H&E的AI引导的空间蛋白质组学揭示三阴性乳腺癌的复发风险生态位

arXiv cs.AI 论文

摘要

一篇研究论文将基于H&E的深度学习复发风险热图与质谱空间蛋白质组学相结合,以识别三阴性乳腺癌中与复发相关的瘤内分子生态位,实现了强大的预测性能,并揭示了不同的有丝分裂程序与免疫程序。

arXiv:2608.03145v1 公告类型:新 摘要:深度学习模型可以从H&E染色的切片预测癌症复发,但这些预测背后的局部分子状态在很大程度上仍不清楚。在此,我们在三阴性乳腺癌(TNBC)中开发了一种结果引导的空间病理学框架,将AI生成的复发风险热图与基于质谱的空间蛋白质组学相结合。在156名患者的队列中,基于分布的高评分斑块聚合在独立测试队列中实现了AUC 0.77和C-index 0.77。整体蛋白质组学将高图像衍生风险与细胞周期和基因组维持程序相关联,将低风险与免疫激活相关联。高和低风险斑块共存于同一肿瘤区域内,并表现出不同的核和结构特征,揭示了超越组织区域身份的瘤内异质性。然后,我们使用热图作为坐标级指导,从两名复发患者中物理分离并分析了46个AI定义的肿瘤区域。空间蛋白质组学分析显示了两名患者中一致的分子对比:有丝分裂程序在高风险区域富集,而免疫和抗原呈递程序在低风险区域富集。由这些空间对比衍生的13种蛋白质组合在扩展队列中显示出随着分数增加而无复发生存期变差的趋势,而相应的基于转录本的组合在独立的METABRIC TNBC队列中分层了无复发生存期。将蛋白质组合与H&E衍生的风险评分相结合,将袋外C-index从0.679提高到0.739,并增强了3年和5年的时间依赖性区分。总之,这些发现定义了结局训练AI模型的新角色,即作为空间明确的实验指南,将预后形态学与局部分子状态联系起来,并推动TNBC中基于生物学、多尺度的生物标志物发现。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:39

# 基于H&E引导的AI空间蛋白质组学揭示三阴性乳腺癌复发风险微环境

来源:https://arxiv.org/abs/2608.03145

作者:Yesung Cho (https://arxiv.org/search/cs?searchtype=author&query=Cho,+Y), Ji Hwan Park (https://arxiv.org/search/cs?searchtype=author&query=Park,+J+H), Chanil Kim (https://arxiv.org/search/cs?searchtype=author&query=Kim,+C), Hyewon Kim (https://arxiv.org/search/cs?searchtype=author&query=Kim,+H), Honglan Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+H), Yumin Lee (https://arxiv.org/search/cs?searchtype=author&query=Lee,+Y), Geongyu Lee (https://arxiv.org/search/cs?searchtype=author&query=Lee,+G), Sujeong Hong (https://arxiv.org/search/cs?searchtype=author&query=Hong,+S), Seong Min Park (https://arxiv.org/search/cs?searchtype=author&query=Park,+S+M), Yoonyoung Lee (https://arxiv.org/search/cs?searchtype=author&query=Lee,+Y), Hee Sool Rho (https://arxiv.org/search/cs?searchtype=author&query=Rho,+H+S), Sumin Lee (https://arxiv.org/search/cs?searchtype=author&query=Lee,+S), Amos Chungwon Lee (https://arxiv.org/search/cs?searchtype=author&query=Lee,+A+C), Changhwan Lee (https://arxiv.org/search/cs?searchtype=author&query=Lee,+C), Hwanyoung Shim (https://arxiv.org/search/cs?searchtype=author&query=Shim,+H), Hyunwook Kim (https://arxiv.org/search/cs?searchtype=author&query=Kim,+H), Hyeji Shin (https://arxiv.org/search/cs?searchtype=author&query=Shin,+H), Sanha Park (https://arxiv.org/search/cs?searchtype=author&query=Park,+S), Jihoon Yu (https://arxiv.org/search/cs?searchtype=author&query=Yu,+J), Yoon Hee Shin (https://arxiv.org/search/cs?searchtype=author&query=Shin,+Y+H), Sooheon Kim (https://arxiv.org/search/cs?searchtype=author&query=Kim,+S), Hyunjin Park (https://arxiv.org/search/cs?searchtype=author&query=Park,+H), Seung Min Park (https://arxiv.org/search/cs?searchtype=author&query=Park,+S+M), Sangwan Kim (https://arxiv.org/search/cs?searchtype=author&query=Kim,+S), Yujung Kim (https://arxiv.org/search/cs?searchtype=author&query=Kim,+Y), Sung\-Im Do (https://arxiv.org/search/cs?searchtype=author&query=Do,+S), Eun\-Young Kim (https://arxiv.org/search/cs?searchtype=author&query=Kim,+E), Dongmyung Shin (https://arxiv.org/search/cs?searchtype=author&query=Shin,+D), Jongbae Park (https://arxiv.org/search/cs?searchtype=author&query=Park,+J), In\-Gu Do (https://arxiv.org/search/cs?searchtype=author&query=Do,+I)

查看PDF (https://arxiv.org/pdf/2608.03145)

> 摘要:深度学习模型可以基于H&E染色切片预测癌症复发,但这些预测背后所对应的局部分子状态在很大程度上仍不清楚。在本研究中,我们开发了一种在三阴性乳腺癌(TNBC)中基于预后信息的空间病理学框架,将AI生成的复发风险热图与基于质谱的空间蛋白质组学相结合。在156名患者的队列中,基于分布的高风险区域聚合在独立测试队列中达到了0.77的AUC和0.77的C-index。整体蛋白质组学分析显示,图像-derived高风险与细胞周期和基因组维持程序相关,而低风险与免疫激活相关。高风险和低风险区域在同一肿瘤区室中共存,并表现出不同的细胞核和结构特征,揭示了超出组织区室身份的瘤内异质性。随后,我们利用热图作为坐标级指导,从两名复发患者中物理分离并分析了46个AI定义的肿瘤区域。空间蛋白质组学分析显示了两名患者间一致的分子对比:有丝分裂程序在高风险区域富集,而免疫和抗原呈递程序在低风险区域富集。由这些空间差异衍生的13种蛋白质组合在扩展队列中显示出得分越高、无复发生存越差的趋势,而相应的转录本组合则在独立的METABRIC TNBC队列中对无复发生存进行了分层。将蛋白质组合与H&E-derived风险评分相结合,将袋外C-index从0.679提升至0.739,并增强了3年和5年的时间依赖性区分能力。综上所述,这些发现为以预后为训练目标的AI模型定义了新的角色,使其成为空间明确的实验指南,将预后形态学与局部分子状态联系起来,并推动了三阴性乳腺癌中基于生物学基础的多尺度生物标志物发现。

## 提交历史

来自:Geongyu Lee \[查看邮件 (https://arxiv.org/show-email/86d57c67/2608.03145)\] **\[v1\]** 2026年8月4日星期二 05:19:35 UTC \(1,330 KB\)

相似文章

用于乳腺癌复发预测的多模态机器学习

arXiv cs.LG

本文探讨了整合多模态临床数据(包括治疗记录、病理报告和临床医生笔记)的方法,通过基于规则的提取和机器学习,与单模态方法相比,提高乳腺癌复发预测的准确性。

基于多组学的乳腺癌预测机器学习模型基准测试

arXiv cs.LG

本文使用来自 TCGA-BRCA 的多组学数据,系统地基准测试了用于 ER 状态预测的经典机器学习模型(Random Forest、XGBoost 等),发现 RNA 表达提供了最强的预测信号,并且在整合的多组学设置中,Random Forest 达到了 90.3% 的平衡准确率。

CaresAI在SMM4H-HeaRD 2026:预测TNM分期

arXiv cs.CL

本文介绍了CaresAI在SMM4H-HeaRD 2026共享任务上的方法,该任务利用多种嵌入和分类器从病理报告中预测TNM分期,取得了强劲结果,但也指出了泛化问题。