从丢失的溯源中学习:用于癌症登记肿瘤组分类的多实例学习
摘要
本文提出了一种基于注意力的多实例学习(ABMIL)框架,利用癌症登记处的患者级别标签来训练用于肿瘤组分类的深度学习分类器,无需每份报告的注释,在BC癌症登记处的任务上实现了0.83的宏F1。
arXiv:2607.03481v1 Announce Type: new
摘要:利用深度学习实现癌症登记现代化,为自动化劳动密集型任务(如病理报告编码)开辟了新机遇。然而,进展受到缺乏报告级别的人工标注训练数据的限制。癌症登记处在日常运营中会产生大量专家分配的标签,但这些标签存在于患者级别,且未与生成它们的个体病理报告关联,从而限制了其在模型训练中的直接使用。我们开发了一个高效框架,利用这些运营生成的标签来训练深度学习分类器,无需每份报告的人工标注,并在BC癌症登记处的肿瘤组分类任务中进行了验证。我们使用基于注意力的多实例学习(ABMIL)来恢复患者级别标签与其所依据的报告之间的丢失联系,利用模型对每份报告的注意力,将大规模噪声标注的语料库蒸馏为紧凑、高质量的每报告训练数据集。在蒸馏数据集上微调的分类器达到了0.83的宏F1,在大多数肿瘤组上优于已有基线。通过将常规运营标签转化为高质量训练数据,且无需额外标注或大规模计算基础设施,ABMIL为自动化癌症登记工作流程提供了一条实用且可及的道路。
查看缓存全文
缓存时间: 2026/07/07 04:37
# 多示例学习在癌症登记肿瘤组分类中的应用
来源:https://arxiv.org/html/2607.03481
Leonard RuoccoJonathan Simkin不列颠哥伦比亚癌症登记处,省卫生服务管理局,温哥华,加拿大不列颠哥伦比亚大学,温哥华,加拿大Lovedeep Gondora不列颠哥伦比亚大学,温哥华,加拿大Gregory Arbour数据科学研究所,不列颠哥伦比亚大学,温哥华,加拿大Raymond Ng数据科学研究所,不列颠哥伦比亚大学,温哥华,加拿大
###### 摘要
利用深度学习推动癌症登记现代化,为自动化病理报告编码等劳动密集型任务带来了新的机遇。然而,进展受到报告级人工标注训练数据稀缺的限制。癌症登记机构在日常运行中会产生大量专家分配的标签,但这些标签存在于患者级别,并未与作为其依据的个体病理报告相关联,从而限制了其在模型训练中的直接使用。我们开发了一个高效框架,利用这些运行生成的标签训练深度学习分类器,而无需进行每份报告的人工标注,并针对不列颠哥伦比亚癌症登记处的肿瘤组分类进行了展示。我们使用基于注意力的多示例学习(ABMIL)来恢复患者级标签与其所依据报告之间丢失的关联,利用模型对每份报告的注意力,将大规模、带噪声的语料库提炼成紧凑、高质量的报告级训练数据集。在提炼数据集上微调的分类器取得了0.83的宏F1值,在大多数肿瘤组中超越了既定基线。通过将常规运行标签转化为高质量训练数据,而无需额外标注或大规模计算基础设施,ABMIL提供了一条实用且易行的途径,用于自动化癌症登记工作流程。
## 1 引言
基于人群的癌症登记处(PBCRs)在癌症监测中发挥着基础性作用,为公共卫生政策、资源分配和流行病学研究提供依据[18 (https://arxiv.org/html/2607.03481#bib.bib1),1 (https://arxiv.org/html/2607.03481#bib.bib2)]。任何PBCR的核心操作任务之一是分配肿瘤组——一种用于将病例导向相应肿瘤特异性编码工作流程并填充监测数据库的癌症类型编码分类[18 (https://arxiv.org/html/2607.03481#bib.bib1)]。在不列颠哥伦比亚癌症登记处(BCCR),加拿大最大的省级癌症登记处之一,这项任务涉及将收到的病理报告分类为多种标准化肿瘤组之一,涵盖全部恶性肿瘤谱系。收到的报告数量巨大:BCCR每年接收约10万份可报告病理报告,而分配肿瘤组分类所需的人工劳动构成了显著且日益增长的负担[17 (https://arxiv.org/html/2607.03481#bib.bib3),15 (https://arxiv.org/html/2607.03481#bib.bib4)],尤其体现在经过认证的肿瘤数据专家(ODS)身上,他们是经过培训的健康信息管理专业人士,负责将癌症病例编码录入登记数据库。
自然语言处理(NLP)为自动化病理报告分类提供了一条原则性路径[13 (https://arxiv.org/html/2607.03481#bib.bib17)]。病理报告是半结构化的自由文本文件,具有一致的临床词汇和相对受限的语言变化,因此非常适合监督式文本分类[11 (https://arxiv.org/html/2607.03481#bib.bib10)]。近年来,深度学习方法已取代传统的基于规则和统计机器学习(ML)方法,成为临床NLP任务的主流[16 (https://arxiv.org/html/2607.03481#bib.bib25)],其中基于Transformer的模型现代表最先进技术[23 (https://arxiv.org/html/2607.03481#bib.bib23)]。这些方法的核心是将文本表示为稠密嵌入向量,以捕捉语义内容和词语之间的上下文关系[5 (https://arxiv.org/html/2607.03481#bib.bib24)]。
开发用于癌症登记自动化的NLP系统所面临的核心挑战是,缺乏以适合监督式ML的格式进行了个体文档级别标注的病理报告。构建此类数据集需要大量的主题专家参与;因为ODS必须审查并标注每份报告。这一资源瓶颈在临床NLP文献中一直被指出是监督式模型开发和扩展的主要障碍[4 (https://arxiv.org/html/2607.03481#bib.bib8),21 (https://arxiv.org/html/2607.03481#bib.bib9)]。
一个自然的替代方案是利用ODS在日常工作流程中已经作为常规产出生成的大量标签。在正常的登记运行中,ODS会审查收到的病理报告,提取相关临床信息,并将肿瘤组分配记录在登记数据库中。障碍在于结构性的:登记标签记录在肿瘤级别,是审查一份或多份病理报告以及其他临床文档后的综合输出。然而,给定标签与其所依据的具体报告之间的关联并未被记录。
文献中的标准方法是筛选出只有单份报告的患者数据[4 (https://arxiv.org/html/2607.03481#bib.bib8)],或者将患者级标签传播给与该患者相关的每份病理报告,并将由此产生的(报告,标签)对视为独立标注的训练样本[3 (https://arxiv.org/html/2607.03481#bib.bib7),8 (https://arxiv.org/html/2607.03481#bib.bib6)]。筛选出单份报告案例可以避免标签噪声,但丢弃了大量可用数据,并使样本偏向于非代表性患者。标签传播避免了数据损失,但存在错误指定:它将肿瘤组标签分配给患者的所有报告,而不管其临床相关性如何,包括检查活检、偶然发现以及来自与登记肿瘤无关的解剖部位的报告。由此产生的训练信号退化已得到充分记录[7 (https://arxiv.org/html/2607.03481#bib.bib11)],对于少数肿瘤组尤其有害,因为其中的干净样本已经稀缺。
另一种提出的解决方案是将所有报告拼接成单个文本块,并依靠模型在其中识别相关信号[19 (https://arxiv.org/html/2607.03481#bib.bib12)]。这引入了一个实际限制:由于拼接文本的长度,需要长上下文窗口,对于大数据集可能很快超出计算约束。此外,将报告合并为单个序列会取消文件作为离散单元的地位。考虑到患者包中的许多报告与登记的诊断在临床上不相关,任何在完整拼接序列上运行的方法都无法有选择地排除它们。保留报告作为可隔离单元为数据集精炼打开了大门:在训练前或训练过程中识别并丢弃低相关性报告,这可以显著减少语料库规模与计算负担,同时不牺牲诊断信号。
我们认为所有这些挑战都可以由一个成熟且统一的框架共同解决:基于注意力的多示例学习(ABMIL)。在ABMIL框架[12 (https://arxiv.org/html/2607.03481#bib.bib13)]中,训练标签分配在“包”级别,包由多个“实例”组成,而非分配在个体实例级别。如果包中至少有一个实例为正,则包被标记为正;模型学习识别哪些实例负责包级标签,而无需实例级标注。该框架已在计算病理学中得到类比应用,其中组织病理学图像被视为由玻片或报告导出标签监督的补丁包[2 (https://arxiv.org/html/2607.03481#bib.bib26),14 (https://arxiv.org/html/2607.03481#bib.bib16)];在这里,我们将同样的原理应用于文本,将患者视为由登记标签监督的病理报告包。与标签传播不同,模型不会因任何个体报告未能预测包标签而受到惩罚。监督仅在聚合的包表示级别应用,使模型能够自由地降低不相关报告的权重而无需梯度惩罚。这恰好符合BCCR的设置:每个具有单个登记肿瘤的患者健康号码(PHN)构成一个包,与该PHN相关的病理报告即实例,而BCCR记录的肿瘤组即为包标签。模型从未被要求从任何个体报告预测标签;它仅被要求聚合患者全部报告中的证据,并在肿瘤级别预测肿瘤组。
除了作为独立模型使用外,ABMIL框架还提供了第二条对PBCRs具有实际价值的操作路径。这些每份报告的相关性分数可用于过滤整个与登记相关的语料库,仅保留每个PHN得分最高的报告,作为诊断相关文档的代理。然后将肿瘤组标签传播给所有保留下来的报告,得到一个过滤后的数据集,其中每份保留的报告都携带PHN级别的肿瘤组标签。这是一个干净的一对一映射,在结构上等同于传统标注的报告级数据集,适合训练标准的监督式分类器。因此,这个两阶段管道提供了一条从运行登记数据构建大规模、高质量训练语料库的途径,而无需任何主题专家标注工作,其中相关性分数充当了自动化文档选择步骤,否则该步骤需要人工审查。在本文中,我们评估了两种路径:使用训练好的ABMIL模型进行直接分类,以及相关性指导的数据集过滤后对下游分类器进行监督式微调。据我们所知,目前尚无已发表系统将ABMIL应用于基于自由文本病理报告的癌症登记肿瘤组分类,并使用运行生成的包标签。
除了BCCR,所提出的方法具有广泛的适用性:实际上所有PBCRs都面临同样的结构性问题,即患者级标签与个体报告之间无记录关联,任何拥有运行编码数据库和关联报告存储库的登记机构原则上都可以应用该方法。由于此过滤步骤将语料库精炼为其最具诊断相关性的报告,模型训练的计算需求仍然较低——这使该方法成为在不同资源能力的机构中普及癌症登记NLP的实用框架。
## 2 数据来源
本研究使用了BCCR维护的两个运行数据库。第一个是BCCR病理报告数据库,存储了从不列颠哥伦比亚省各实验室提交给BCCR的自由文本手术病理报告。每份报告通过唯一消息标识符识别,并通过其PHN与患者关联。第二个是BCCR肿瘤数据库,包含不列颠哥伦比亚省居民中所有可报告肿瘤的临床信息,这些信息由ODS根据编码标准[6 (https://arxiv.org/html/2607.03481#bib.bib22)]完全摘录。该数据库中的肿瘤组分配使用CAIS映射——BCCR使用的一种部位编码和组织学编码到肿瘤组的映射方案——得出,作为本研究整个过程中包级监督标签的来源。通过PHN将两个数据库链接,生成一个语料库,其中每个患者既关联一组病理报告,又关联从BCCR肿瘤数据库导出的肿瘤组标签(参见表1 (https://arxiv.org/html/2607.03481#S2.T1),列出了本研究使用的肿瘤组集合以及为每个组提取的报告数量)。数据提取时段为2020-01-01至2023-12-31,共产生82,855个唯一PHN,包含359,714份病理报告。
表1:数据集中肿瘤组分布及包统计。排除了在BCCR肿瘤数据库中记录有超过一个独特肿瘤诊断的PHN。此限制对于确保明确的包级标签是必要的:具有两个不同原发肿瘤的患者可能拥有与任一诊断相关的病理报告。数据集使用患者分层分割划分为训练集和验证集,确保属于特定患者的所有报告仅出现在一个分区中,防止患者级数据跨分割泄漏[20 (https://arxiv.org/html/2607.03481#bib.bib19)]。最终分割包含90%的训练PHN和10%的验证PHN。
验证集用于跟踪训练性能指标,并让每个模型达到收敛。最终评估和方法比较是在2025年收集的一个独立数据集上进行的,包含2,057份病理报告。我们称其为ODS标注数据集。由于报告级金标签独立于登记传播过程,该数据集作为我们评估模型在运行现实条件下性能的主要基准。标签使用基于SEER的部位编码和组织学编码到肿瘤组的映射,该映射不同于用于从BCCR肿瘤数据库导出训练标签的CAIS映射。虽然两种映射大体一致,但一小部分案例在两个方案下会得到不一致的肿瘤组分配。这在测试时引入了与模型质量无关的适度标签噪声,在解释此数据集上的绝对性能指标时应予以考虑。
## 3 方法
该管道利用了ABMIL框架[12 (https://arxiv.org/html/2607.03481#bib.bib13)],其正式定义如下。给定一个包含N个报告嵌入{h1,...,hN}的包,其中每个hi∈Rd是从预训练编码器的最终隐藏层提取的单个病理报告的稠密向量表示,隐藏维度为d,模型为每个实例计算一个门控注意力权重ai,如下:
ai = exp(w^T (tanh(V hi) ⊙ σ(U hi))) / Σ_j exp(w^T (tanh(V hj) ⊙ σ(U hj))) (1)
这里V∈R^(L×d), U∈R^(L×d), w∈R^(L×1)是可学习参数,L是注意力隐藏维度。得到的注意力权重用于计算包级表示z = Σ_i a_i h_i ∈ Rd,该表示将实例嵌入聚合成一个固定大小的向量,并按每份报告相对于包标签的估计相关性进行加权。然后,这个包嵌入通过一个全连接分类头,该分类头对12个肿瘤组类别应用softmax激活。
请参见图注图1:ABMIL管道的示意图。第一条路径ABMIL-WS指弱监督分类方法,其中ABMIL用于在冻结的病理报告包嵌入上训练分类头。第二条路径称为ABMIL-DISTIL,利用从ABMIL-WS建立的注意力分数,过滤语料库以生成一个精炼数据集,然后传递给分类器进行完整的端到端微调。相似文章
基于分布的深度多实例学习在非小细胞肺癌肿瘤比例评分中的应用
介绍了一种基于分布的多实例学习框架,利用零膨胀贝塔建模,从组织病理学切片中改进非小细胞肺癌肿瘤比例评分的预测。
用于乳腺癌复发预测的多模态机器学习
本文探讨了整合多模态临床数据(包括治疗记录、病理报告和临床医生笔记)的方法,通过基于规则的提取和机器学习,与单模态方法相比,提高乳腺癌复发预测的准确性。
QG-MIL:用于医学影像领域无关多实例学习的门控Transformer聚合器
本文介绍QG-MIL,一种门控Transformer聚合器,缓解了医学影像多实例学习中的注意力集中问题,无需辅助损失即可实现领域无关的性能。
一种基于DNA甲基化的中枢神经系统肿瘤分类的新机器学习方法
本文提出了一种结合稀疏随机投影与多项逻辑回归的新型机器学习方法,用于从DNA甲基化数据中对中枢神经系统肿瘤进行分类,其准确率较现有方法提高了4-5个百分点,达到了最先进水平。
CaresAI在SMM4H-HeaRD 2026:预测TNM分期
本文介绍了CaresAI在SMM4H-HeaRD 2026共享任务上的方法,该任务利用多种嵌入和分类器从病理报告中预测TNM分期,取得了强劲结果,但也指出了泛化问题。