PathReportEval:病理报告生成系统化基准
摘要
本文介绍了PathReportEval,这是一个用于全切片图像生成病理报告的标准化基准与评估框架,包含一种新的临床驱动指标——临床报告质量评分(CRQS),相比传统词汇指标,它能更准确地捕捉事实正确性。
arXiv:2607.18448v1 公告类型:新论文
摘要:基于全切片图像(WSI)的病理报告生成是一个快速发展的多模态学习问题,但由于现有研究使用异构数据集、模型设置、视觉编码器和评估协议,进展难以衡量。此外,常用的自然语言生成指标(包括BLEU、ROUGE和METEOR)主要奖励词汇相似性,通常无法检测出具有临床后果的错误,例如遗漏诊断、虚构发现或肿瘤属性不一致。
我们提出了一个用于病理报告生成的标准化基准和评估框架。该基准使用三个病理基础编码器(CONCHv1.5、UNI2-h和H-Optimus-1),在三个数据集(TCGA、HistAI和REG 2025)上评估了四种代表性方法。我们的框架标准化了预处理、特征提取、训练、解码和评估,实现了跨模型的公平比较,同时提供了一个模块化平台,用于集成新方法、数据集和编码器。
一个核心贡献是临床报告质量评分(CRQS),这是一个用于评估事实正确性的临床驱动指标。CRQS将参考报告和生成报告映射为结构化临床属性,并衡量四个互补维度:临床事实覆盖度、关键信息召回率、虚构率和临床不一致性,从而产生一个总体评分和可解释的子评分。
实验表明,传统的语言生成指标与临床正确性弱相关,并且经常高估报告质量。相比之下,CRQS揭示了词汇指标无法捕捉的模型与编码器之间的临床意义差异。该基准、公共即插即用框架和CRQS共同为病理报告生成的严格评估建立了可复现的基础。
查看缓存全文
缓存时间: 2026/07/22 08:23
# PathReportEval:病理报告生成的系统性基准测试
来源:https://arxiv.org/html/2607.18448
Suryakant Singh
生物医学信息学系
石溪大学
纽约州石溪,美国
suryakant\.singh@stonybrook\.edu
&Sejuti Majumder
生物医学信息学系
石溪大学
纽约州石溪,美国
sejuti\.majumder@stonybrook\.edu
&Beatrice Knudsen
病理学系
犹他大学
犹他州盐湖城,美国
beatrice\.knudsen@path\.utah\.edu
&Joel Saltz
生物医学信息学系
石溪大学
纽约州石溪,美国
joel\.saltz@stonybrook\.edu
&Prateek Prasanna
生物医学信息学系
石溪大学
纽约州石溪,美国
prateek\.prasanna@stonybrook\.edu
###### 摘要
从全切片图像(WSIs)生成病理报告是一个快速发展的多模态学习问题,但由于现有研究使用了异构的数据集、模型设置、视觉编码器和评估协议,很难衡量进展。此外,常用的自然语言生成指标(包括 BLEU、ROUGE 和 METEOR)主要奖励词汇层面的相似性,可能无法检测到临床上有意义的错误,例如遗漏诊断、虚构发现或不一致的肿瘤属性。我们提出了一个标准化的基准测试和评估框架,用于病理报告生成。该基准评估了三种数据集(TCGA、HistAI 和 REG 2025)上的四种代表性生成方法,使用了三种病理基础编码器:CONCHv1.5、UNI2-h 和 H-Optimus-1。我们的框架标准化了完整的实验流程,包括预处理、分词、特征提取、训练、解码和评估,从而能够在不同模型架构和视觉表示之间进行公平比较。该框架是模块化且可扩展的,允许在共享协议下加入新方法、数据集和编码器。本工作的一个核心贡献是临床报告质量评分(CRQS),这是一个基于临床的指标,用于评估生成的病理报告的事实正确性。CRQS 将参考报告和生成报告映射为结构化的临床属性,并衡量报告质量的四个互补维度:临床事实覆盖率、关键信息召回率、幻觉率和临床不一致率。这种分解既提供了总体评分,也提供了可解释的子评分,揭示了临床上重要的失败模式。我们的实验表明,传统的语言生成指标与临床正确性相关性较弱,可能会高估报告质量。相比之下,CRQS 识别出了模型和编码器之间的显著差异,而这些差异是词汇指标无法捕捉的。通过提供标准化的基准测试、公开的即插即用框架以及结构化的临床评估指标,本工作为衡量病理报告生成的进展建立了一个可重复的基础。
评估框架:https://github.com/surykntsingh/PathBench
## 1 引言
从全切片图像(WSIs)生成病理报告是一个新兴的多模态学习任务,要求模型将十亿像素级的组织病理学图像转化为具有临床意义的文本报告(Lucassen et al., 2025;Hu et al., 2025;Jin et al., 2026;Gao et al., 2025)。近期视觉-语言建模和病理基础模型的进展使这一任务越来越可行(Lu et al., 2024;Chen et al., 2024b;Bioptimus, 2025),使得系统能够整合大范围组织区域的视觉证据并生成诊断描述。然而,这一领域的进展仍然难以衡量。现有研究(Guo et al., 2024;Chen et al., 2024a;Zhang et al., 2026;Singh et al., 2026)往往使用不同的数据集、预处理流程、视觉编码器、模型实现、解码策略和评估协议,使得不同方法之间的直接比较不可靠。因此,我们常常不清楚报告的性能提升究竟是反映了模型设计的改进,还是实验设置的差异和偏差所致。
第二个挑战是评估。大多数病理报告生成研究依赖标准的自然语言生成(NLG)指标,如 BLEU(Papineni et al., 2002)、ROUGE(Lin, 2004)和 METEOR(Banerjee and Lavie, 2005)。这些指标衡量生成报告与参考报告之间的词汇重叠,但并未直接评估临床重要信息是否被保留(Yu et al., 2023;Baharoon et al., 2026)。在病理学中,这一区别至关重要:一份生成报告可能在词汇上与参考报告相似,但却遗漏了关键诊断、错误陈述了肿瘤分级或分期、虚构了淋巴结受累,或与切缘状态矛盾。这类错误不仅仅是语言上的失败,更是临床忠实性的失败。因此,评估病理报告生成需要超越表层形式相似性的指标,明确衡量临床有意义内容的正确性。
请参见标题
图 1:提出的病理报告生成基准测试和评估框架概览。该框架标准化了数据划分、特征提取、模型训练和评估,涵盖多个数据集、编码器和报告生成方法,同时整合了基于临床的 CRQS 流程,用于结构化评估报告质量。
在本工作中,我们引入了一个标准化的基准测试和评估框架,用于从 WSI 生成病理报告。我们评估了四种最先进的报告生成方法,涵盖了三个具有不同报告特征的数据集和三种代表不同基础模型家族的病理视觉编码器。通过在共享实验协议下评估所有方法,我们的基准测试能够系统地比较不同模型架构、数据集和视觉表示。为了支持可重复性和未来扩展,我们进一步提供了一个模块化的即插即用框架,标准化了预处理、分词、特征提取、训练、解码和评估。该框架设计为允许新的报告生成模型、数据集和视觉编码器以最小改动集成,同时保留共同的评估流程。
为了解决词汇评估的局限性,我们提出了 **临床报告质量评分**(CRQS),这是一种经病理学家验证的结构化指标,用于评估生成病理报告的临床忠实性。CRQS 的灵感来源于概要报告实践(例如美国病理学家学院建议的实践,College of American Pathologists, 2023a, b),其中关键的诊断和预后属性使用标准化字段记录。CRQS 不是仅将报告作为自由文本进行比较,而是将生成报告和参考报告都映射为结构化的临床属性,例如诊断、组织学类型、肿瘤分级、分期、切缘状态、淋巴结受累、生物标志物状态以及其他数据集特定的病理发现。然后,它使用四个可解释的组成部分来评估报告质量:临床事实覆盖率、关键信息召回率、幻觉率和临床不一致率。这种分解使得 CRQS 能够捕捉不同的失败模式,包括遗漏发现、缺失高影响力的诊断字段、不支持的生成事实以及与参考报告的直接矛盾。跨数据集、方法和编码器的分析表明,传统的 NLG 指标可能掩盖系统间有临床意义的差异。具有相似词汇得分的模型在恢复关键诊断信息、避免幻觉以及保持与参考临床属性一致性方面可能存在显著差异。CRQS 提供了一种与临床内容更直接对齐的补充评估信号,并支持细粒度的错误分析。
综上所述,本基准、公共框架和 CRQS 为衡量病理报告生成的进展提供了一个可重复的基础。我们的贡献有三个方面:
1. 我们引入了一个 **标准化的病理报告生成基准**,在共享实验协议下评估了跨多个数据集和病理视觉编码器的代表性方法。
2. 我们提供了一个 **模块化的即插即用基准测试框架**,标准化了预处理、特征提取、训练、解码和评估,实现了公平比较,并支持快速扩展到新模型、数据集和编码器。
3. 我们提出了 **CRQS**,一种基于临床的评估指标,使用结构化的临床属性评估生成报告,并将报告质量分解为事实覆盖率、关键信息召回率、幻觉率和临床不一致率。
图 1(https://arxiv.org/html/2607.18448#S1.F1)展示了本基准测试和评估流程的概览,强调了数据集、视觉编码器、报告生成模型和临床评估组件如何在一个单一标准化框架内组织。与该评估框架相关的所有代码均可在 https://github.com/surykntsingh/PathBench 获取。
## 2 相关工作
##### 从 WSI 生成病理报告。
自动化病理报告生成最近成为一个具有挑战性的多模态学习问题,要求模型将十亿像素的全切片图像(WSIs)转化为具有临床意义的文本(Gamper and Rajpoot, 2021;Huang et al., 2023;Lu et al., 2023)。早期方法将图像描述框架扩展到 WSI,使用多实例学习(MIL),其中补丁级别的特征被聚合以产生切片级别的报告。WSI-Caption (MI-Gen)(Chen et al., 2024a)展示了在十亿像素尺度下基于 transformer 的报告生成的可行性。后续方法引入了更结构化的建模策略:HistGen(Guo et al., 2024)使用局部-全局层次编码和跨模态上下文交互,以更好地对齐多尺度视觉证据与文本描述;而 BiGen(Zhang et al., 2026)则引入了基于检索的知识,用语义相关信息丰富视觉表示。这些工作代表了重要进展,但它们通常是在异构设置下评估的,包括不同的数据集、预处理流程、视觉编码器、解码策略和评估协议。因此,仍然难以确定观察到的性能差异是源于模型设计还是由于不一致的实验条件。
##### 视觉-语言模型和病理基础编码器。
视觉-语言学习的最新进展产生了强大的组织病理学预训练编码器,包括 CONCH(Lu et al., 2024)、UNI(Chen et al., 2024b)和 H-Optimus(Bioptimus, 2025)。这些模型提供了强大的视觉表示,并在各种病理任务上改善了性能。然而,大多数使用这类编码器的工作集中在表示学习或下游判别任务上,而不是对生成式病理报告进行系统评估。此外,报告生成不仅需要视觉识别,还需要临床忠实地选择、组织和表达诊断发现。因此,需要在一个共同基准下评估不同的视觉编码器如何影响生成报告的临床正确性。
##### 医学报告生成的评估。
评估仍然是医学报告生成的主要瓶颈。大多数现有研究依赖标准的自然语言生成指标,如 BLEU(Papineni et al., 2002)、ROUGE(Lin, 2004)和 METEOR(Banerjee and Lavie, 2005),这些指标衡量生成报告与参考报告之间的词汇重叠。虽然这些指标易于计算,但它们并不直接评估事实正确性或临床相关性。一份生成报告可以达到很高的词汇相似度,但却遗漏了关键的诊断发现、引入了不支持的临床属性,或与参考诊断相矛盾。放射学领域之前的工作探索了基于结构化实体或图的评估(Jain et al., 2021;Yu et al., 2023;Baharoon et al., 2026),而最近的病理报告生成工作引入了基于事实的指标,如 FACTent(Miura et al., 2021;Chen et al., 2024a)。这些努力超越了表层形式的相似性,但它们通常将事实视为非结构化实体,并未明确建模病理报告的结构化特性。
##### 标准化和临床驱动的基准测试需求。
基准测试对于计算病理学的进展至关重要,特别是在分类、分割、检索和生存预测方面。然而,现有的病理基准主要关注视觉预测任务,并未涉及多模态报告生成。因此,当前的报告生成方法是孤立评估的,限制了可重复性和公平比较。在本工作中,我们通过引入一个跨模型、数据集和视觉编码器的标准化基准,以及一个用于可重复评估的模块化即插即用框架,来填补这一空白。我们进一步提出了临床报告质量评分(CRQS),这是一种结构化的指标,使用与概要报告实践一致的临床有意义的字段来评估生成报告。与词汇指标或非结构化事实重叠分数不同,CRQS 将报告质量分解为临床事实覆盖率、关键信息召回率、幻觉率和临床不一致率,从而支持总体比较和可解释的错误分析。
## 3 基准测试与评估框架
表 1:用于病理报告生成的数据集特征。
这些数据集在规模、机构多样性、注释噪声和报告结构方面存在显著差异,从而能够全面评估模型的鲁棒性和泛化能力。
### 3.1 任务定义
我们研究从全切片图像(WSIs)生成病理报告。给定一个 WSI X,模型生成一个报告 \(\hat{R} = (r_1, r_2, \ldots, r_T)\),其中每个 token \(r_t\) 是相似文章
ReportQA: 基于问答的放射学报告评估
本文提出了ReportQA,一种基于问答的放射学报告评估框架,利用大语言模型回答临床相关问题,相较于现有指标,与放射科医生判断的一致性更好。
DR^{3}-Eval: 迈向真实且可复现的深度研究评估
DR³-Eval 是一个基准测试,用于评估深度研究代理在多模态、多文件报告生成中的表现,它通过真实的网络环境模拟和全面的评估框架,衡量信息召回、事实准确性、引用覆盖率、指令遵循和深度质量。
RubricsTree:跨健康记忆与医疗技能的个人健康智能体可扩展且不断演进的开放式评估
RubricsTree 提出了一种可扩展且与专家对齐的个人健康智能体评估框架,使用超过100个原子布尔规则,在Gemini、GPT和Qwen模型系列的HealthBench上实现了高达66%的相对提升。
Evaluation Cards: 一种AI评估报告的解释层
本文介绍了EvalCards,这是一种操作框架,通过将基准元数据、评估运行数据和模型元数据组合成一个统一记录,并包含可重现性、完整性、来源、风险和分数可比性的解释性信号,从而标准化AI评估报告。作者在数千个模型和基准测试中部署了一个监控工具,揭示了当前报告实践中的系统性差距。
加速合成电子健康记录生成中的可重复研究
本文介绍了一个轻量级、端到端的基准测试框架,用于可重复的合成电子健康记录(EHR)生成,将多个基线模型(MedGAN、CorGAN、PromptEHR、HALO)和一个GPT-2基线统一到单个流水线中,并配备严格的隐私-效用评估套件。