OncoTriad-QA:面向泛癌推理的患者级放射学-病理学-基因组学基准
摘要
介绍了OncoTriad-QA,一个整合放射学、病理学、基因组学和临床数据的患者级基准,用于泛癌推理;同时介绍了OncoVLM,一个参考多模态模型,在微调后性能优于现有的医学大语言模型。
arXiv:2608.02615v1 公告类型:新
摘要:癌症诊断和表征需要整合来自放射学、病理学、基因组学和临床元数据的互补证据。然而,大多数医学大语言模型(LLM)和视觉-语言模型(VLM)基准专注于单一模态或狭窄的图像-文本任务,使得跨多种证据流的患者级肿瘤学评估在很大程度上未得到检验。我们提出了OncoTriad-QA,一个用于泛癌问答的患者级放射学-病理学-基因组学基准。OncoTriad-QA包含来自32个癌症队列的9,281个TCGA患者病例的86.1万个语义问题,对齐了CT/MRI放射学、全切片组织病理学、体细胞突变、拷贝数变异、DNA甲基化、批量RNA测序和临床元数据。病例特定的标注通过一个源接地的大语言模型辅助流程构建,使用 curated 标签、诊断报告、分子谱和模态衍生证据作为主要真实来源,并辅以自动一致性检查和临床医生审核。我们还提出了OncoVLM,一个参考多模态模型,通过习得的投影器将模态原生放射学、病理学、DNA甲基化和RNA-seq证据映射到大语言模型接口中。实验表明,现有的通用和医学大语言模型在全面的泛癌问答上仍存在局限,尤其是当问题需要整合影像发现、肿瘤形态和分子证据时。在OncoTriad-QA上微调后,OncoVLM在MCQ准确率和BERTScore-F1上平均超过MedGemma-4B 10.7个百分点,并且在仅放射学、仅病理学和全部可用设置下,多项选择和开放性问题中均获得一致提升。这些结果证明了该基准在训练和评估集成式癌症问答模型方面的价值。
查看缓存全文
缓存时间: 2026/08/05 07:40
# OncoTriad-QA:面向泛癌推理的患者级放射学-病理学-基因组学基准 来源:https://arxiv.org/abs/2608.02615 查看 PDF (https://arxiv.org/pdf/2608.02615) > 摘要:癌症的诊断和特征描述需要整合来自放射学、病理学、基因组学和临床元数据的互补证据。然而,大多数医学大语言模型(LLM)和视觉-语言模型(VLM)基准仅聚焦于孤立模态或狭窄的图像-文本任务,使得跨多种证据流的患者级肿瘤学评估在很大程度上未被测试。我们推出了 OncoTriad-QA,这是一个面向泛癌问答的患者级放射学-病理学-基因组学基准。OncoTriad-QA 包含来自 32 个癌症队列的 9,281 例 TCGA 患者病例中的 86.1 万个语义问题,对齐了 CT/MRI 影像、全切片组织病理学、体细胞突变、拷贝数变异、DNA 甲基化、批量 RNA 测序和临床元数据。通过一个基于来源的 LLM 辅助流程构建病例特异性注释,该流程以精选标签、诊断报告、分子谱和模态衍生证据作为主要真值来源,并辅以自动化一致性检查和临床医生审核。我们还推出了 OncoVLM,一个参考多模态模型,通过可学习的投影器将放射学、病理学、DNA 甲基化和 RNA 测序等模态原生证据映射到 LLM 界面。实验表明,现有的通用和医学 LLM 在全面的泛癌问答上仍然表现有限,尤其是当问题需要整合影像学发现、肿瘤形态和分子证据时。在 OncoTriad-QA 上微调后,OncoVLM 在使用多选题准确率和 BERTScore-F1 指标时,平均超过 MedGemma-4B 10.7 个百分点,并且在仅放射学、仅病理学和全部可用模态设置下,在多选题和开放性问题中均取得了一致的提升。这些结果证明了该基准在训练和评估用于综合癌症问答的模型方面的价值。 ## 提交历史 来自:Ahnaf Munir [查看电子邮件](https://arxiv.org/show-email/e019c160/2608.02615) **\[v1\]** 2026年5月21日星期四 18:53:58 UTC(2,360 KB)
相似文章
ReportQA: 基于问答的放射学报告评估
本文提出了ReportQA,一种基于问答的放射学报告评估框架,利用大语言模型回答临床相关问题,相较于现有指标,与放射科医生判断的一致性更好。
TRAPS: 基于通路信息分层的治疗反应分析
本文提出了首个用于通路引导的治疗反应建模的统一基准,评估了三种生物学信息驱动的架构(BINN、GraphPath、PATH),在来自癌症基因组图谱的五个癌症队列上,对靶向治疗、放射治疗和生存结局进行多标签预测。
使用 GPT-4o 推理能力改革癌症护理
Color Health 开发了一款利用 GPT-4o 推理能力的 AI 医学助手,帮助肿瘤学家识别缺失的诊断信息并优化癌症护理工作流程。该工具使医生能够在约 5 分钟内发现 4 倍多的缺失检验和成像结果,相比之前需要数周,目前正在旧金山加州大学进行初步验证。
探测、融合与可信度:面向多模态癌症分析的基础模型表征系统评估
本文系统评估了用于多模态癌症分析的基础模型表征,在真实世界队列上对单模态与多模态融合策略进行基准测试,并通过共形预测评估可信度。
一种专门用于加速罕见病诊断的推理型大型语言模型:一项随机AI医生辅助试验
本文介绍了RaDaR,一个320亿参数的开源推理型大语言模型,基于公开和合成的罕见病病例进行训练。在诊断基准测试中,其表现优于DeepSeek-R1等更大模型,并在随机试验中将医生诊断准确率提升了21.44个百分点。