迈向肝细胞癌精准治疗:用于风险分层和治疗指导的临床推理大语言模型

arXiv cs.AI 论文

摘要

本文介绍HCC-STAR,一个临床对齐的大语言模型,用于肝细胞癌的风险分层和治疗指导,旨在通过利用电子病历改进精准治疗。

arXiv:2607.08602v1 公告类型:新 摘要:肝细胞癌(HCC)是一种常见恶性肿瘤,是癌症相关死亡的主要原因。当前指南和分期系统提供粗略的分类,但通常忽略电子病历(EMR)中的阶段内异质性和临床背景。我们提出HCC-STAR(肝细胞癌分期、治疗与预后),这是一个临床对齐的大语言模型,它读取常规EMR叙述并联合输出基于风险评分的分期、排名一致的指南推荐治疗并附有循证理由,以及个体化生存估计。我们从SEER中收集约30,000例HCC病例,并使用经过临床验证的、基于提示的扩增工作流将其扩展为EMR风格的叙述训练数据。在此语料库上,我们开发了知识对齐的推理框架,使用步骤可验证的复合奖励进行优化,超越了临床指南的文本级记忆。在中国12家医院的6,668名患者的多中心队列中,HCC-STAR在治疗推荐和风险分层方面达到了最先进水平,优于临床指南和竞争模型,包括GPT-5和Gemini-2.5 Pro。假设的总生存期分析显示,遵循HCC-STAR推荐的中位生存期为51个月,而BCLC和CNLC分别为29和32个月。在以临床医生为中心的评估中,盲法肝胆专科医生认为HCC-STAR的推理和循证理由值得信赖。当作为辅助工具时,该模型在治疗准确性上超过了住院医师和主治医师,并帮助医生更快地做出更准确的决策。这些结果支持HCC-STAR作为可靠且可验证的决策支持系统,用于HCC的风险分层和精准治疗。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:09

# 迈向肝细胞癌精准治疗:用于风险分层与治疗指导的临床推理大语言模型
来源:https://arxiv.org/abs/2607.08602
## 计算机科学 > 人工智能

**arXiv:2607.08602**(计算机科学)

作者:彭崔 (https://arxiv.org/search/cs?searchtype=author&query=Cui,+P)、王继涛 (https://arxiv.org/search/cs?searchtype=author&query=Wang,+J)、薛思妍 (https://arxiv.org/search/cs?searchtype=author&query=Xue,+S)、黄瑶 (https://arxiv.org/search/cs?searchtype=author&query=Huang,+Y)、夏浩明 (https://arxiv.org/search/cs?searchtype=author&query=Xia,+H)、李栋 (https://arxiv.org/search/cs?searchtype=author&query=Li,+D)、刘邓祥 (https://arxiv.org/search/cs?searchtype=author&query=Liu,+D)、王炜林 (https://arxiv.org/search/cs?searchtype=author&query=Wang,+W)、刘丽萍 (https://arxiv.org/search/cs?searchtype=author&query=Liu,+L)、张雷达 (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+L)、崔云甫 (https://arxiv.org/search/cs?searchtype=author&query=Cui,+Y)、彭涛 (https://arxiv.org/search/cs?searchtype=author&query=Peng,+T)、纪道林 (https://arxiv.org/search/cs?searchtype=author&query=Ji,+D)、赵海涛 (https://arxiv.org/search/cs?searchtype=author&query=Zhao,+H)、张伟 (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+W)、王晓娟 (https://arxiv.org/search/cs?searchtype=author&query=Wang,+X)、马伟杰 (https://arxiv.org/search/cs?searchtype=author&query=Ma,+W)、丁宗仁 (https://arxiv.org/search/cs?searchtype=author&query=Ding,+Z)、李金龙 (https://arxiv.org/search/cs?searchtype=author&query=Li,+J)、丁元 (https://arxiv.org/search/cs?searchtype=author&query=Ding,+Y)、赵佳婧 (https://arxiv.org/search/cs?searchtype=author&query=Zhao,+J)、陈智宇 (https://arxiv.org/search/cs?searchtype=author&query=Chen,+Z)、杨成昆 (https://arxiv.org/search/cs?searchtype=author&query=Yang,+C)、黄子越 (https://arxiv.org/search/cs?searchtype=author&query=Huang,+Z)、刘佳琪 (https://arxiv.org/search/cs?searchtype=author&query=Liu,+J)、刘福生 (https://arxiv.org/search/cs?searchtype=author&query=Liu,+F)、周洋 (https://arxiv.org/search/cs?searchtype=author&query=Zhou,+Y)、王晓娟 (https://arxiv.org/search/cs?searchtype=author&query=Wang,+X)、孙忠权 (https://arxiv.org/search/cs?searchtype=author&query=Sun,+Z)、鲍诗韵 (https://arxiv.org/search/cs?searchtype=author&query=Bao,+S)、王晓军 (https://arxiv.org/search/cs?searchtype=author&query=Wang,+X)、杨明 (https://arxiv.org/search/cs?searchtype=author&query=Yang,+M)、李光新 (https://arxiv.org/search/cs?searchtype=author&query=Li,+G)、舒彬 (https://arxiv.org/search/cs?searchtype=author&query=Shu,+B)、廖勇 (https://arxiv.org/search/cs?searchtype=author&query=Liao,+Y)、李红轩 (https://arxiv.org/search/cs?searchtype=author&query=Li,+H)、唐瑶 (https://arxiv.org/search/cs?searchtype=author&query=Tang,+Y)、杨世忠 (https://arxiv.org/search/cs?searchtype=author&query=Yang,+S)、曾永毅 (https://arxiv.org/search/cs?searchtype=author&query=Zeng,+Y)、袁玉峰 (https://arxiv.org/search/cs?searchtype=author&query=Yuan,+Y)、董银鹏 (https://arxiv.org/search/cs?searchtype=author&query=Dong,+Y)、郝继辉 (https://arxiv.org/search/cs?searchtype=author&query=Hao,+J)、朱军 (https://arxiv.org/search/cs?searchtype=author&query=Zhu,+J)、董家鸿 (https://arxiv.org/search/cs?searchtype=author&query=Dong,+J)

查看 PDF (https://arxiv.org/pdf/2607.08602)

> **摘要:** 肝细胞癌(HCC)是一种常见恶性肿瘤,也是癌症相关死亡的主要原因之一。当前的指南和分期系统提供了粗略的分类,但常常忽略了分期内的异质性以及电子病历(EMR)中的临床背景。我们提出HCC-STAR(肝细胞癌分期、治疗与预后),这是一种临床对齐的大语言模型,能够读取常规EMR叙述,并联合输出基于风险评分的分期、按指南排序的治疗方案(附有循证理由)以及个体化生存期估计。我们从SEER中收集了约30,000例HCC病例,并使用经临床验证的、基于提示增强的工作流程,将其扩展为EMR风格的叙述训练数据。在此语料库上,我们开发了一个知识对齐的推理框架,并通过步骤可验证的复合奖励进行优化,超越了临床指南的文本级记忆。在一个来自中国12家医院、包含6,668例患者的多中心队列中,HCC-STAR在治疗推荐和风险分层方面,与临床指南及包括GPT-5和Gemini-2.5 Pro在内的竞争模型相比,达到了最先进的性能。假设性总生存分析显示,遵循HCC-STAR建议的中位生存期为51个月,而遵循BCLC和CNLC建议的中位生存期分别为29个月和32个月。在以临床医生为中心的评估中,盲法的肝胆专科医生认为HCC-STAR的推理和循证依据可信。该模型在治疗准确性上超越了住院医师和主治医师,并在作为辅助工具时帮助医生更快地做出更准确的决策。这些结果支持HCC-STAR作为肝细胞癌风险分层和精准治疗的可靠、可验证的决策支持系统。

## 提交历史

来自:彭崔 [查看邮件](https://arxiv.org/show-email/dccd4cb5/2607.08602) **[v1]**2026年7月9日 星期四 15:33:08 UTC (17,722 KB)

参考文献工具

## 参考文献与引文工具

参考文献浏览器 切换

代码、数据、媒体

## 与本文相关的代码、数据和媒体

演示

## 演示

相关论文

## 推荐与搜索工具

关于arXivLabs

## arXivLabs:与社区合作者的实验项目

arXivLabs是一个框架,允许合作者直接在我们的网站上开发和分享新的arXiv功能。

与arXivLabs合作的个人和组织都接受并认可我们关于开放性、社区、卓越性和用户数据隐私的价值观。arXiv致力于这些价值观,并且只与遵守这些价值观的合作伙伴合作。

有一个能为arXiv社区增加价值的项目想法?**了解更多关于arXivLabs的信息** (https://info.arxiv.org/labs/index.html)。

相似文章

从结构化临床数据预测心血管风险的大语言模型

arXiv cs.CL

本文提出了一种混合框架,将结构化临床数据与LLM生成的叙述相结合,用于冠状动脉疾病预测,在变量提取方面实现了高保真度,并比较了机器学习模型与基于LLM的零样本和少样本分类。

在标准化病例中评估大语言模型在动态临床决策中的表现

Hugging Face Daily Papers

研究人员提出了MedSP1000,这是一个包含1638个病例的交互式基准,源自标准化患者场景,用于评估大语言模型作为动态临床代理在多轮问诊中的表现。结果显示,即使是最佳模型(GPT-5.5)也仅完成了60.4%的专家评分项,表明当前的大语言模型在临床实践中尚不够可靠。