CaresAI在SMM4H-HeaRD 2026:预测TNM分期

arXiv cs.CL 论文

摘要

本文介绍了CaresAI在SMM4H-HeaRD 2026共享任务上的方法,该任务利用多种嵌入和分类器从病理报告中预测TNM分期,取得了强劲结果,但也指出了泛化问题。

arXiv:2607.03466v1 Announce Type: new 摘要:本研究旨在独立预测肿瘤、淋巴结和转移(TNM)分期标签,以癌症基因组图谱(TCGA)病理报告作为SMM4H-HeaRD 2026的第六个共享任务。该问题被构建为三个多标签分类任务。我们探索了经典和深度学习方法,使用词频-逆文档频率(TF-IDF)特征以及来自ClinicalBERT、BioBERT和PubMedBERT的嵌入。这些表示与逻辑回归(LR)、轻量梯度提升机(LightGBM)、前馈神经网络(FFNN)和宽残差网络(WRN)一起使用。我们的结果表明,单个嵌入在TNM标签分类上表现相似,而它们的组合提高了预测能力。在训练阶段,WRN的AUROC分数分别为0.839(T)、0.8502(N)和0.803(M),F1分数分别为0.622、0.702和0.9337。LightGBM与TF-IDF在训练阶段表现最佳,AUROC分数分别为0.9368(T)、0.9524(N)和0.8311(M),F1分数分别为0.7559(T)、0.7384(N)和0.7017(M)。此外,测试集在Codabench上的结果显示,测试集1的T、N和M类别的Macro-F1分数分别为0.978、0.957和0.879;而测试集2的T、N和M的Macro-F1分数分别为0.807、0.767和1.0。然而,在测试集的评估阶段性能下降,测试集1到测试集2的Macro-F1分数从0.938降至0.858,表明模型泛化能力有限,对类别不平衡敏感,以及处理长临床文档存在挑战。尽管本研究提供了高效的基线模型和可复现的流程,但在考虑其适用于真实临床环境之前,还需要进一步优化和验证。
查看原文
查看缓存全文

缓存时间: 2026/07/07 04:37

# CaresAI 在 SMM4H-HeaRD 2026:预测 TNM 分期

来源:https://arxiv.org/html/2607.03466
Joseph Itopa Abubakar¹, Jorge Jarme¹², Favour Igwezeke¹³, Mary Adewunmi¹⁴†
¹CaresAI, Australia
²Ateneo De Naga University, Philippines
³Faculty of Pharmaceutical Sciences, Nsukka, Enugu, Nigeria
⁴Menzies School of Health Research, Australia

[email protected], [email protected], [email protected], [email protected]

###### 摘要

肿瘤、淋巴结和转移(TNM)分期系统对癌症治疗至关重要。本研究旨在独立预测 TNM 分期标签,使用癌症基因组图谱(TCGA)病理报告作为 SMM4H-HeaRD 2026 的第六项共享任务。该问题被框架为三个多标签分类任务。我们探索了经典和深度学习方法,使用词频-逆文档频率(TF-IDF)特征以及来自 ClinicalBERT、BioBERT 和 PubMedBERT 的嵌入。这些表示与逻辑回归(LR)、轻量级梯度提升机(LightGBM)、前馈神经网络(FFNN)和宽残差网络(WRN)一起使用。我们的结果表明,单个嵌入在 TNM 标签分类上表现相似,而它们的组合提高了预测能力。WRN 在训练阶段达到了 AUROC 分数分别为 0.839(T)、0.8502(N)和 0.803(M),F1 分数分别为 0.622、0.702 和 0.9337。LightGBM 结合 TF-IDF 在训练阶段表现最佳,AUROC 分数分别为 0.9368(T)、0.9524(N)和 0.8311(M),F1 分数分别为 0.7559(T)、0.7384(N)和 0.7017(M)。此外,Codabench 测试集的结果显示,测试集 1 的 T、N、M 类别的 Macro-F1 分数分别为 0.978、0.957 和 0.879;而测试集 2 的 T、N、M 的 Macro-F1 分数分别为 0.807、0.767 和 1.0。然而,在测试集的评估阶段,性能有所下降,所有阶段的 Macro-F1 分数从测试集 1 的 0.938 下降到测试集 2 的 0.858;这表明模型泛化能力有限,对类别不平衡敏感,并且在处理冗长的临床文档方面存在挑战。尽管本研究提供了有效的基线模型和可复现的流程,但在其被认为适用于真实临床环境之前,还需要进一步的优化和验证。

关键词:TNM(肿瘤、淋巴结和转移)、宽残差网络、Transformer 模型、自然语言处理(NLP)、机器学习

CaresAI 在 SMM4H-HeaRD 2026:预测 TNM 分期

Joseph Itopa Abubakar¹, Jorge Jarme¹², Favour Igwezeke¹³, Mary Adewunmi¹⁴†
¹CaresAI, Australia
²Ateneo De Naga University, Philippines
³Faculty of Pharmaceutical Sciences, Nsukka, Enugu, Nigeria
⁴Menzies School of Health Research, Australia
[email protected], [email protected], [email protected], [email protected]

## 1 引言

癌症仍然是全球主要的死亡原因,其负担因人群、地区和类型而异[世界卫生组织 (2024)](https://arxiv.org/html/2607.03466#bib.bib30)。有效的癌症管理取决于在诊断时准确预测其进展。其中核心是癌症分期,即对肿瘤大小、解剖位置以及从原发部位扩散程度的系统评估,这直接指导治疗决策和预后结果。由美国癌症联合委员会(AJCC)和国际抗癌联盟(UICC)共同维护的 TNM 分期系统是一个全球采用的框架,为临床医生、研究人员和癌症登记机构在疾病分期分类方面提供了一种标准化的“通用语言”。该系统将癌症进展分为三个维度:原发肿瘤的大小和局部侵袭性(T)、淋巴结扩散(N)以及远处转移的存在(M)[Pan 等 (2024)](https://arxiv.org/html/2607.03466#bib.bib4)。

NLP 方法已广泛用于临床文本中的癌症相关任务,包括 TNM 分期、诊断以及从病理报告中提取预后信息[Hands 和 Kavuluru (2025)](https://arxiv.org/html/2607.03466#bib.bib10)。具体针对 TNM 分期,Kefeli (2024) 之前的工作已经表明,基于 Transformer 的模型在 TCGA 病理报告上训练后,可以对多种癌症类型的 T、N、M 标签进行分类,并具有良好的泛化能力(即模型在训练期间未见过的、来自不同患者群体的数据上表现良好),在独立的外部验证集上达到 AU-ROC 0.815–0.942 [Kefeli 等 (2024)](https://arxiv.org/html/2607.03466#bib.bib11)。TF-IDF 因其简单性和经过验证的检索性能,仍然是文本分类可靠的基线[Salton 和 Buckley (1988)](https://arxiv.org/html/2607.03466#bib.bib2),而 LightGBM 在基于特征的大规模数据集上展现了快速准确的分类能力[Ke 等 (2017)](https://arxiv.org/html/2607.03466#bib.bib3)。本研究旨在独立于 TCGA 病理报告预测 T、N、M 分期分类,作为 SMM4H-HeaRD 2026 的第六项共享任务,以支持肿瘤学中一致且准确的临床决策。此外,通过利用机器学习,提出的方法旨在减少分期的变异性,这对治疗选择、预后评估和患者管理至关重要。

## 2 系统概述

本节概述了处理 TNM 分期分类所涉及的各个阶段。

### 2.1 数据集

数据集是一个 CSV 文件,来源于 TCGA 的去标识化自由文本病理报告的原始 PDF 文件。这些报告包含多个特征,包括患者文件名、文本、T、N 和 M,其长度、结构和术语(如领域特定的缩写、数值测量和叙述性描述)各不相同[Kefeli 和 Tatonetti (2024)](https://arxiv.org/html/2607.03466#bib.bib9)。数据集在 TNM 类别上存在中等程度的不平衡。为了处理缺失或不完整的标签,我们独立处理了每个 TNM 类别。这是因为一个类别(例如 T)中看似缺失的值可能对另一个类别(如 N 或 M 分期)仍然有效或具有信息量。因此,为每个分类任务分别过滤了数据集。

在包含 6,774 条记录的训练集中,M 标签尤其偏向:M1(存在转移)仅占约 7% 的标注 M 病例,而 M0 占其余 93% [Kefeli 等 (2024)](https://arxiv.org/html/2607.03466#bib.bib11)。类似的不平衡也存在于 T 和 N 子类别中,例如 T4 和 N3 等晚期分期在整个语料库中的出现频率低于早期分期。此外,报告可能包含不相关的内容或模糊的表述,使得稳健的自然语言处理方法对于可靠预测至关重要。语料库分为训练集、验证集和测试集,TNM 标签来自 TCGA 内提供的结构化临床元数据。数据集包含几个关键特征。每条记录包括唯一的患者标识符(文件编号)、文本报告以及相应的 TNM 标签。患者文件编号是用于区分每个用例的唯一字符串,而文本字段包含为该患者撰写的病理报告。TNM 标签代表癌症分期。出于建模目的,T(肿瘤)标签最初为 1 到 4,被调整为 0 到 3。N(淋巴结)标签范围从 0 到 3,M(转移)标签是二元的,取值为 0 或 1。数据集被划分为三个子集:(A) 包含 6,774 条记录的训练集,(B) 包含 2,279 条记录的验证集,以及 (C) 包含 499 条记录的测试集。验证集包括患者标识符和报告文本,而测试集包含患者 ID 和相应的报告。在建模之前,通过移除停用词和噪声、将文本分解为标记(分词)以及将单词还原为其基本形式(词形还原)来预处理文本。在这些步骤之后,使用 TF-IDF 和基于自动编码器的嵌入技术将处理后的文本转换为数值表示。

### 2.2 方法

我们采用了一种混合方法,结合了传统和深度学习神经网络模型,涵盖从数据预处理到模型开发的全过程。

在预处理阶段,我们在训练数据上使用了传统的特征加权方法,特别是词频-逆文档频率(TF-IDF),以捕获文本中重要的词汇模式和单词。此外,TF-IDF 被用作基线方法,以便与神经网络方法(包括从预训练神经网络生成的嵌入)进行比较。随后,我们从三个预训练的生物医学语言模型中提取并平均嵌入输出,以生成密集的文本表示:ClinicalBERT [Huang 等 (2020)](https://arxiv.org/html/2607.03466#bib.bib12)、BioBERT [Lee 等 (2020)](https://arxiv.org/html/2607.03466#bib.bib13) 和 PubMedBERT [Gu 等 (2021)](https://arxiv.org/html/2607.03466#bib.bib14)。这些模型生成了密集嵌入,比 TF-IDF 更能捕捉训练数据集中更深层的语义含义。

对于建模阶段,训练集中的每个病理报告都与 TCGA 临床元数据中提供的结构化 TNM 标签相关联。这些标签不是我们设计的,而是直接从为本次共享任务提供的数据集中获取的。T(肿瘤)标签最初提供为值 1–4,出于建模目的调整为 0–3。N(淋巴结)标签范围从 0 到 3,M(转移)标签是二元的,取值为 0 或 1。

用于训练的传统机器学习模型如下:

A) 逻辑回归 - 一个用于分类任务的基线模型。它适用于连续数据和分类数据,特别适用于预测离散结果。在本研究中,所选模型作为基线和集成方法的基学习器表现良好,尤其是对于 M 类别。

B) LightGBM 和随机森林的集成方法 - LightGBM 用于高维和稀疏数据(例如 TF-IDF)以提高性能,而随机森林构建多个决策树并组合其输出。LightGBM 很好地处理了稀疏数据,并执行隐式特征选择。我们还构建了一个堆叠集成,其中随机森林和 LightGBM 作为基模型,逻辑回归作为元模型来组合它们的预测。这种设置通过利用多个模型的优势来帮助提高整体性能。

用于训练的高级模型是深度学习模型,包括前馈神经网络(FFNN)和宽残差神经网络(WRN)。FFNN 是一种基本的神经网络,信息从输入向输出单向流动。它们广泛用于分类和模式识别[Zhou 等 (2022)](https://arxiv.org/html/2607.03466#bib.bib7)。

WRN 是神经网络的扩展,具有更宽的层,允许它们捕捉更复杂的模式。它们旨在提高性能,同时保持高效的训练[Zagoruyko 和 Komodakis (2017)](https://arxiv.org/html/2607.03466#bib.bib17)。TF-IDF 特征、预训练 BERT 嵌入以及经典和深度学习分类器的组合使我们能够比较不同模型复杂度和表示学习水平下的预测能力。

## 3 结果与讨论

我们在 SMM4H-HeaRD 2026 任务 6 的验证集上取得了 0.94 的 micro-F1 分数,在官方测试集的所有阶段上取得了 0.926 的 micro-F1 分数。由于训练中未预见的类别不平衡,测试集的 micro-F1 分数可能会降低。一些标签,如 M1(存在转移),非常罕见(仅占训练数据 M 类别的约 7%)。

M(转移)预测任务是最困难的,因为该词在报告中并未明确说明,必须从上下文推断。这需要对转移有更深入的临床理解,而不仅仅是简单的关键词匹配。

以下两个表格展示了实验结果以及提交到 Codabench 平台后的两组结果。使用的训练集按 80% 用于训练、20% 用于测试进行划分。在整个实验过程中,这一划分没有改变,如表 1 所示,包括经典机器学习方法和深度学习方法。表 1 展示了使用两种数据预处理技术(TF-IDF 和自动编码器)进行的一系列实验中的最佳结果。在训练数据上使用 TF-IDF 特征,M 类别的最佳性能模型是 LightGBM,在训练阶段实现了 AUROC 0.8311 和 F1 分数 0.7017。此外,对于 N 类别,实现了 AUROC 0.9524 和 F1 分数 0.7384。最后,对于 TF-IDF 方法,T 类别实现了 AUROC 0.9368 和 F1 分数 0.7559。我们在验证集上实现了 AUROC 0.96,而组织者基线的 AUROC 分数为 0.815–0.942。

表 1:按类别和预处理方法的模型性能。键:P-T = 预处理技术;TFIDF = 词频-逆文档频率;A-E = 自动编码器;WRN = 宽循环网络;LGBM = LightGBM。

使用基于自动编码器的表示(BioBERT、ClinicalBERT 和 PubMedBERT 嵌入)获得的结果表明,在单个嵌入方法之间切换不会导致显著的性能差异。然而,组合这些表示会导致其预测能力显著提升。使用 WRN 模型,T、N 和 M 分别实现了 AUROC 分数 0.839、0.8502 和 0.803,相应的 F1 分数为 0.622、0.702 和 0.9337。最终提交到 Codabench 的模型基于表现最佳的模型和预处理方法组合,特别是 LightGBM 与 TF-IDF 特征。表 1 显示了强大的评估性能,其中宏观平均指标表明测试集 1 中 T 的 F1 分数为 0.978,N 为 0.957,M 为 0.879;而测试集 2 的评估中 T、N、M 类别分别记录了 0.807、0.767 和 1.000。

表 2:来自 Codabench 的 TNM 提取结果。该模型在测试集 2 中表现中等(表 2),宏观平均分数较低(约 0.7–1.0),表明类别间性能不均衡,而在测试集 1 中宏观平均分数保持在约 0.9。

从测试集 1 所有类别的全局来看,该模型取得了较高的 Macro-F1 分数 0.938,表明它能够准确地从可用数据中学习模式。然而,在测试集 2 中,性能下降到 Macro-F1 分数 0.858,表明对未见数据的泛化能力有限。这种差距可能由于类别不平衡(如稀有的 TNM 标签 M1)、对训练分布的过拟合以及同一医疗状况在不同报告中的变异性等因素造成。宏观平均分数较低进一步证实了该模型在少数类上表现挣扎,而这些少数类通常临床上最重要。

相似文章

用于乳腺癌复发预测的多模态机器学习

arXiv cs.LG

本文探讨了整合多模态临床数据(包括治疗记录、病理报告和临床医生笔记)的方法,通过基于规则的提取和机器学习,与单模态方法相比,提高乳腺癌复发预测的准确性。