立场:医疗AI忽视真实治疗结果
摘要
本文立场文章论证了医疗AI在训练和评估中忽视了真实治疗结果,阻碍了其改善患者护理的能力,并建议纳入实际结果数据以符合循证医学原则。
arXiv:2608.14598v1 Announce Type: new
摘要:医疗AI已迅速提升其执行导致治疗决策的诊断和预后任务的能力。但对治疗本身的理解仍训练和评估不足,依赖人类意见和综合信息(特别是生物医学出版物和临床实践指南等文本),而非治疗结果的实际基础数据。这种忽视严重限制了医疗AI的潜力,并且正如本文所论证,已在前沿模型和主要基准中造成缺陷。来自观察性数据库和随机实验等来源的真实治疗结果,应实质性地纳入训练和评估中。改善这些结果应被重新强调为所有医疗AI的下游目标。
查看缓存全文
缓存时间: 2026/08/18 09:51
# 医疗AI忽视真实治疗结果
来源:https://arxiv.org/html/2608.14598
###### 摘要
医疗AI在执行诊断和预后任务方面的能力已快速提升,而这些任务直接导向治疗决策。然而,对于治疗本身的理解,在训练和评估中仍然不足,目前主要依赖人类意见和综合信息(尤其是生物医学文献和临床实践指南等文本),而非治疗结果背后的实际基础数据。本文认为,这种忽视严重限制了医疗AI的潜力,并已导致前沿模型和主要基准测试存在缺陷。我们主张,必须将来自观察性数据库和随机对照试验等来源的真实治疗结果,实质性地纳入模型的训练和评估过程。应当重新强调,改善这些治疗结果是所有医疗AI的最终目标。
机器学习,ICML
## 1 引言
在20世纪90年代,医学领域曾着力解决阻碍高质量医疗的两大问题。第一个问题是,过多的医疗决策仅依赖个别专家的意见。循证医学主张将这些决策建立在整个医疗系统的集体经验和积累的真实数据之上(Guyatt等,1992 (https://arxiv.org/html/2608.14598#bib.bib156);Sackett等,1996 (https://arxiv.org/html/2608.14598#bib.bib155))。第二个问题是,医学研究,尤其是临床试验,变得狭隘地专注于替代性(或中间)终点指标,例如各种分析物的血清浓度(Fleming和DeMets,1996 (https://arxiv.org/html/2608.14598#bib.bib138);Temple,1999 (https://arxiv.org/html/2608.14598#bib.bib137);Yudkin等,2011 (https://arxiv.org/html/2608.14598#bib.bib136))。将重点转向更具临床相关性的治疗结果,例如降低心血管死亡率,是患者中心化医疗的关键推力。
我们认为,当前医疗AI研究也面临着类似的问题。主流趋势是专注于中间预测问题,通常涉及诊断或预后,而缺乏对下游患者结果改善的分析。语言模型未能展示对治疗效果的深刻理解,也未被训练去发展这种能力;相反,这种因果推理被外包给已有工作,而这些工作通常较为粗糙,常常掩盖了不确定性和异质性。在语言模型的训练和评估中,人类意见常被视为真实标准,即使存在更优的替代方案。这种方法论,尽管在AI的其他应用中很常见,但却使得超越任何人类专家性能的实现(或甚至识别)变得具有挑战性——换句话说,这不仅违背了循证医学的初衷,也与人工智能超级智能的新愿景相悖(Morris等,2024 (https://arxiv.org/html/2608.14598#bib.bib141))。
我们的立场是,医疗AI目前忽视了真实的治疗结果¹,从训练到评估皆是如此,这阻碍了其改善这些结果的宗旨。我们的建议是在医疗AI研究中使用更多此类数据。这一建议呼应了20世纪90年代将真实数据纳入临床实践的呼声。我们的立场不仅是关于医疗AI研究内部努力的重新校准,更是关于扩展其长期雄心。简而言之,医疗AI的长期目标应是帮助编写临床实践指南等权威性综合文献,而不仅仅是阅读和参考它们。
第̃2节 (https://arxiv.org/html/2608.14598#S2) 突出了在现代医疗AI训练中真实治疗结果的几乎缺失。
第̃3节 (https://arxiv.org/html/2608.14598#S3) 讨论了为什么在推理和评估过程中,人类意见和人类编写的综合文献(如临床指南和监管文件)作为真实标准存在根本局限。
第̃4节 (https://arxiv.org/html/2608.14598#S4) 展示了现有基准测试如何主要关注辅助性或中间预测任务。它强调了治疗是医疗系统的目的,而改进中间预测并不总是服务于这一目的。
我们在第̃5节 (https://arxiv.org/html/2608.14598#S5) 提出了具体建议。
我们的立场与医疗AI领域的许多研究实践相左,并非没有自身的困难。第̃6节 (https://arxiv.org/html/2608.14598#S6) 讨论了一些合理的替代观点。
¹ *真实的治疗结果*是指在患者接受先前治疗过程中观察到的实际结果。
| 模型 | Med-Gemini-* | Med-Gemini-{L,M} | AMIE | Med-PaLM 2 | Med-PaLM | Baichuan-M3 | OpenBioLLM | Me-LLaMA | MEDITRON | Med42-v2 | MedGemma | TxAgent | HealthGPT-Pro-8B | LLaVA-Med | BioMistral | MediPhi | Curiosity-L | Mamba-CLMBR | EHRMamba | MOTOR-T |
| :--- | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: | :---: |
| **规模** | — | — | — | 540B | 235B | 70B | 70B | 70B | 70B | 27B | 8B | 8B | 7B | 7B | 3.8B | 1B | 121M | 130M | 143M | — |
| **网页爬虫** | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| **问答训练数据** | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| **出版物** | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| **临床试验** | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| **指南** | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
| **真实患者数据** | ✓ | ✓ | ✓ | | | | | | | | | | | | | | | | | |相似文章
@rohanpaul_ai: 这项发表在《自然医学》上的研究对医疗AI发出了强烈警告。前沿医疗AI隐藏着……
《自然医学》的一项研究警告称,前沿AI模型在医疗领域看似医学上出色,但临床上尚未准备就绪,在改变问题或删除输入的应激测试中会失败。该研究强调,基准测试成功并不等同于临床准备就绪。
如何不微调你的医疗大语言模型:深入探讨Mark Kaplan的healtthruth.ai——"覆盖并重构基础训练"
本文批评了Mark Kaplan通过其平台healtthruth.ai微调医疗大语言模型的方法,指出了在医疗AI中覆盖基础训练的陷阱。
算法设计与医生责任
本文探讨了医疗保健中的责任规则如何重塑人工智能算法设计决策和医生使用情况,发现这些规则可能导致人工智能使用的差异化,而强制要求准确率平等可能对两个群体都造成损害。
研究人员刚刚在医学论文中发现28个虚假AI引用
研究人员在影响临床指南的医学论文中发现了28个AI生成的虚假引用,凸显了AI幻觉破坏科学诚信和患者护理的风险。
诉讼称梅奥诊所使用AI正在严重损害患者护理
梅奥诊所前研究主任指控该医院忽视了其AI工具(MAYA)的高错误率,并因她举报而进行报复,引发了关于AI在医疗保健中部署的严重担忧。