机器学习在医疗领域应用综述

ML at Berkeley 新闻

摘要

本博客文章对机器学习在医疗保健领域的应用进行了高层面综述,涵盖医学影像、可穿戴设备和分子生物学。文章强调了机器学习如何推动医学从治疗型向预防型转变,并在不取代医护人员的前提下优化医院工作流程。

<p><em>作者:Ana Cismaru</em></p><h5>本博客文章旨在概述机器学习在医疗保健领域的应用,重点关注医学影像、可穿戴设备和分子生物学。在后续的文章中,我将深入探讨每个主题中简单的机器学习实验案例及最新的前沿论文。</h5><h2>引言</h2><p>我们的身体不断产生海量的复杂数据,人工根本不可能处理所有这些数据。</p><a class="image-link image2" target="_blank" href="https://substackcdn.com/image/fetch/$s_!iKLP!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa9031229-e309-478f-a6ca-daa210471fbb_512x341.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!iKLP!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa9031229-e309-478f-a6ca-daa210471fbb_512x341.png 424w, https://substackcdn.com/image/fetch/$s_!iKLP!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa9031229-e309-478f-a6ca-daa210471fbb_512x341.png 848w, https://substackcdn.com/image/fetch/$s_!iKLP!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa9031229-e309-478f-a6ca-daa210471fbb_512x341.png 1272w, https://substackcdn.com/image/fetch/$s_!iKLP!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa9031229-e309-478f-a6ca-daa210471fbb_512x341.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!iKLP!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa9031229-e309-478f-a6ca-daa210471fbb_512x341.png" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/a9031229-e309-478f-a6ca-daa210471fbb_512x341.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:null,&quot;width&quot;:null,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:null,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:null,&quot;href&quot;:null,&quot;belowTheFold&quot;:false,&quot;topImage&quot;:true,&quot;internalRedirect&quot;:null,&quot;isProcessing&quot;:false,&quot;align&quot;:null,&quot;offset&quot;:false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!iKLP!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa9031229-e309-478f-a6ca-daa210471fbb_512x341.png 424w, https://substackcdn.com/image/fetch/$s_!iKLP!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa9031229-e309-478f-a6ca-daa210471fbb_512x341.png 848w, https://substackcdn.com/image/fetch/$s_!iKLP!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa9031229-e309-478f-a6ca-daa210471fbb_512x341.png 1272w, https://substackcdn.com/image/fetch/$s_!iKLP!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa9031229-e309-478f-a6ca-daa210471fbb_512x341.png 1456w" sizes="100vw" fetchpriority="high"></picture><div></div></div></a><h6><em>图 1:DNA 序列示例,你能看懂吗?</em></h6><p>幸运的是,机器学习非常适合解决这类问题。机器学习的核心在于处理大型复杂数据集并从中提取意义(无论是分类、预测、生成等)。通过将机器学习应用于医疗保健,我们可以更好地分析构成我们身体的这些大型数据集。</p><p>理解身体数据的力量可能导致我们医疗观念的范式转变。首先,我们可以从以治疗为主的医疗实践转向更注重预防的模式。如果医生利用<a href="https://www.nature.com/articles/s41598-019-49656-2">ML 模型</a>能在你 30 岁时就预警你易患阿尔茨海默病,而不是等到 60 岁时才被确诊,那该有多好?这将提供足够的时间来调整生活方式,以降低患阿尔茨海默病的风险。</p><p>该领域的更多自动化还可能意味着医疗程序等待时间的缩短,以及根据病情对患者进行优先级排序。机器学习模型不仅可以按时间顺序整理 X 光片,还能通知医生最严重的病情,使他们能够优先处理这些情况。让医生花额外的 10 分钟与没有病症的患者交谈,而忽视刚被确诊癌症的患者,显然是低效的。一家名为<a href="https://www.nines.com/blog/investing-in-better-patient-outcomes">Nines</a>的初创公司正致力于开发此类基于机器学习的工具,以改进医院工作流程。</p><p>机器学习在医学研究环境中也非常有用。通过使用人工智能解决方案,漫长且繁琐的研究实验可以转化为计算模型。这些模型可以 24/7 运行,并不一定需要研究人员主动参与。反过来,这使得研究人员能够更快速地开发更多样化的实验。</p><p>显然,机器学习将对医疗空间产生巨大影响。在接下来的段落中,我将对医疗领域的一些机器学习应用进行综述,包括医学影像、活动追踪器和分子细胞生物学。在以后的文章中,我将深入探讨每个类别并提供更详细的解释。</p><h2>前言:机器学习并非医生的替代品</h2><a class="image-link image2" target="_blank" href="https://substackcdn.com/image/fetch/$s_!rSgD!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F4efba249-52db-416b-9b03-cceb7c13c163_792x612.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!rSgD!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F4efba249-52db-416b-9b03-cceb7c13c163_792x612.png 424w, https://substackcdn.com/image/fetch/$s_!rSgD!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F4efba249-52db-416b-9b03-cceb7c13c163_792x612.png 848w, https://substackcdn.com/image/fetch/$s_!rSgD!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F4efba249-52db-416b-9b03-cceb7c13c163_792x612.png 1272w, https://substackcdn.com/image/fetch/$s_!rSgD!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F4efba249-52db-416b-9b03-cceb7c13c163_792x612.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!rSgD!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F4efba249-52db-416b-9b03-cceb7c13c163_792x612.png" data-attrs="{&quot;src&quot;:&quot;https://substack-post-media.s3.amazonaws.com/public/images/4efba249-52db-416b-9b03-cceb7c13c163_792x612.png&quot;,&quot;srcNoWatermark&quot;:null,&quot;fullscreen&quot;:null,&quot;imageSize&quot;:null,&quot;height&quot;:null,&quot;width&quot;:null,&quot;resizeWidth&quot;:null,&quot;bytes&quot;:null,&quot;alt&quot;:null,&quot;title&quot;:null,&quot;type&quot;:null,&quot;href&quot;:null,&qu
查看原文
查看缓存全文

缓存时间: 2026/05/08 08:49

# 机器学习在医疗保健领域应用综述 来源:https://mlberkeley.substack.com/p/health-ml *作者:Ana Cismaru* ##### 本博客文章旨在概述机器学习在医疗保健中的应用,重点关注医学影像、可穿戴设备和分子生物学。在未来的文章中,我将深入探讨这些主题中简单的机器学习实验示例以及最新的前沿论文。 我们的身体时刻产生着海量的复杂数据,靠人工根本无法全部处理。 [](https://substackcdn.com/image/fetch/$s_!iKLP!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa9031229-e309-478f-a6ca-daa210471fbb_512x341.png)###### *图 1:DNA 序列示例,你能看懂吗?* 幸运的是,机器学习非常适合解决这类问题。机器学习的核心在于处理庞大且复杂的数据集并从中提取意义(无论是分类、预测、生成等)。通过将机器学习应用于医疗保健,我们可以更好地分析这些构成我们身体的大型数据集。 理解身体数据的能力可能会引发我们对医学认知的范式转变。首先,我们可以从治疗型医疗实践转向更侧重于预防的模式。如果医生能使用 AI 模型 (https://www.nature.com/articles/s41598-019-49656-2) 在你 30 岁时就警告你有患阿尔茨海默病的风险,而不是等到 60 岁才被确诊,那该多好?这将给予足够的时间来调整生活方式以降低患病风险。 该领域的更多自动化也可能意味着医疗程序的等待时间缩短,并根据病情对患者进行优先级排序。机器学习模型可以通知医生最严重的病例,让他们优先处理,而不仅仅是按时间顺序浏览 X 光片。让医生花额外的 10 分钟与没有病症的患者交谈,而忽视刚被诊断出癌症的患者,这是低效的。一家名为 Nines (https://www.nines.com/blog/investing-in-better-patient-outcomes) 的初创公司正致力于创建此类由机器学习驱动的工具,以改善医院工作流程。 机器学习在医学研究环境中也极具帮助。通过使用 AI 解决方案,漫长且繁琐的研究实验可以转化为计算模型。这些模型可以 24/7 运行,并不一定依赖活跃的研究人员来执行。反过来,这使研究人员能够更快地开展更多样化的实验。 显然,机器学习在医疗领域将产生巨大的影响。在接下来的段落中,我将对机器学习在医疗保健中的一些应用进行调查,包括医学影像、活动追踪器和分子细胞生物学。在未来的文章中,我将聚焦于每个类别并提供更详细的解释。 [](https://substackcdn.com/image/fetch/$s_!rSgD!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F4efba249-52db-416b-9b03-cceb7c13c163_792x612.png)###### *图 2:医疗工作者是我们社会中不可或缺的一部分 <3* 在深入探讨之前,我想强调一点重要事项:机器学习模型并不是医疗保健工作者的替代品。它们仅仅是辅助医生和研究人员日常工作的工具。 尽管机器学习在医疗保健领域取得了巨大的突破,但仍有许多与机器学习本身相关的根本性问题。首先,几乎所有的机器学习算法都容易受到过拟合、有偏差的数据集或缺乏泛化能力的影响。这种弱点在医疗保健行业这样的高风险领域被进一步放大,因为该行业有着比典型应用严格得多的标准。 因此,关于患者或实验的结论永远不应在没有人类专家批准的情况下做出。如果你对阅读更多关于实施医疗保健机器学习的伦理挑战感兴趣,请查看这篇文章 (https://bmcmedicine.biomedcentral.com/articles/10.1186/s12916-019-1426-2)。 医学影像扫描,如 X 光、MRI 等,通常用于可视化人体器官。随着计算机视觉的出现,研究人员开始将机器学习技术(如图像分类、目标检测和分割)应用于这些扫描。在最理想的情况下,这些可靠且自动化的医学影像评估方法可以提供客观的量化,并允许自动对病例严重程度进行排序。 [](https://substackcdn.com/image/fetch/$s_!w4yq!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F9a0ee50a-0ac7-40e4-aee4-defe7d087ab9_512x202.png)###### *图 3:来自 X 光片的目标检测 + 分类(左)和分割(右)示例* 计算机视觉技术在医学影像中的一些成功应用包括检测皮肤癌 (https://www.nature.com/articles/nature21056)、诊断帕金森病 (https://www.frontiersin.org/articles/10.3389/fninf.2019.00048/full) 以及将一种扫描类型转换为另一种类型 (https://arxiv.org/pdf/1806.06397.pdf)(即:从 CT 扫描转换为 PET 扫描)。其他值得注意的例子包括分割模型 U-Net (https://arxiv.org/abs/1505.04597),它已成为该领域任何医学分割问题的标准基线,以及来自 Google DeepMind 的视网膜疾病进展 (https://deepmind.com/blog/article/Using_ai_to_predict_retinal_disease_progression) 模型。 最后,我想提一下我在 UCSF Henry Lab (https://henrylab.ucsf.edu/) 从事的研究。我的项目目标是创建一个自动脊髓灰质分割流程,以追踪多发性硬化症患者病情的进展。通过分割脊髓中的灰质,医生可以清楚地看到灰质的轮廓,并判断其形状是否随时间发生变化。 [](https://substackcdn.com/image/fetch/$s_!NsKD!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Faafd5e66-dd63-43a0-a5b7-4595a07a2ab5_220x156.png)###### *图 4:脊髓 MRI 切片及其灰质分割结果* 当然,并非所有想法都能在现实世界中奏效,这说明了将机器学习应用于临床环境的挑战。2018 年,谷歌宣布他们创建了一个可以通过视网膜图像诊断糖尿病的机器学习模型。纸面上的结果非常棒,但在实际应用中却失败得很惨。研究人员没有意识到,在现实世界中,视网膜图像的光线并不总是完美的(超过五分之一的图像因光线不足被拒绝),而且处理数据需要强大的互联网连接(并非所有测试诊所都具备)。从大局来看,这个例子说明了为医疗保健创建机器学习解决方案涉及的内容远不止算法设计。 [](https://substackcdn.com/image/fetch/$s_!UEZn!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F5b0dd05f-07a1-405f-8f64-458e1a3ab0e8_512x270.png)###### *图 5:正常视网膜与糖尿病人视网膜的区别* 如果你对医学影像感兴趣,请留意我的医学影像博客文章。与此同时,如果你想更深入地了解医学影像世界,以下是一些有用的资源: - 熟悉医学影像的不同模态(MRI、X 射线、CT、PET 等),其独特特性以及相应的 Python 库(OpenCV (https://opencv.org/)、Nibabel (https://nipy.org/nibabel/)、pyDicom (https://pydicom.github.io/pydicom/stable/index.html) 等) - 了解用于图像分类的标准计算机视觉模型(这里有一个很好的概述 (https://heartbeat.fritz.ai/the-5-computer-vision-techniques-that-will-change-how-you-see-the-world-1ee19334354b))—— 许多医学影像模型以标准 CV 模型为基础。 - 如果你想深入了解图像分割,请阅读 U-Net (https://arxiv.org/abs/1505.04597) 论文 你可能已经注意到,Apple Watch、FitBit 和其他可穿戴设备越来越普及。许多人喜欢追踪他们的活动数据,但结合机器学习后,这些可穿戴设备可以变得更加有用。活动追踪器的一个特点是它们持续收集关于你身体的数据(例如,Apple Watch 在运动时每 5 秒收集一次你的心率)。机器学习对此非常“受用”。随着它们学习你独特的身体特征,可穿戴设备将为你量身定制,并能在你的健康指标异常时发出警告。 [](https://substackcdn.com/image/fetch/$s_!qz03!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F9d0cbd78-ea40-4801-a51f-a4844f3552d3_769x462.png)###### *图 6:可穿戴数据预测莱姆病;Snyder 在检测呈阳性之前就接受了治疗* 可穿戴设备力量的一个显著例子是,斯坦福大学教授(Snyder 博士)如何通过他的生物传感器在度假期间检测出自己感染了莱姆病 (https://med.stanford.edu/news/all-news/2017/01/wearable-sensors-can-tell-when-you-are-getting-sick.html)。因此,他能够在症状变得严重之前接受治疗。凭借机器学习 + 持续数据监控的力量,医疗实践确实有可能从治疗型向预防型转变。 可穿戴技术新兴发展引发的一个有趣问题是,在隐私方面应如何保护这些数据。首先,可穿戴设备收集的数据不属于《健康保险流通与责任法案》(HIPAA)的范畴。这意味着可穿戴公司可能会将你的健康数据出售给第三方。一个关于可穿戴数据隐私出错的例子是 2011 年的一起事件 (https://techcrunch.com/2011/07/03/sexual-activity-tracked-by-fitbit-shows-up-in-google-search-results/),当时 FitBit 忘记自动将新用户的性活动数据设为隐私。这导致人们可以搜索他人的性活动——如果你懂我的意思,这真的非常糟糕。 不过,言归正传,回到有趣的机器学习内容。 通常,用于分析可穿戴数据的机器学习技术没有“标签”或地面真值答案。部分原因是健康指标因人而异且每天不同,部分原因是未标记的可穿戴数据丰富而标记的医疗状况稀缺。因此,由于数据的性质,创建模型的机器学习研究人员经常诉诸无监督(无标签)或更常见的半监督(部分标签)学习技术。 [](https://substackcdn.com/image/fetch/$s_!kkjs!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F2afdf6e3-57b5-4f6e-a4be-d6f32d86bff8_512x322.png)###### *图 7:多变时间序列可穿戴数据示例* 来自 UCSF 的一篇论文 DeepHeart (https://arxiv.org/pdf/1802.02511.pdf) 展示了使用自监督学习和 LSTM 预测心血管风险的有效性。利用 Apple Watch 的数据(心率、步数等),该模型能够可靠地检测糖尿病、睡眠呼吸暂停、高血压和高胆固醇——这些都是常见但往往未被诊断的疾病。得益于此项及类似技术,希望更多患有潜在疾病的人能够得到诊断和治疗。 要了解有关可穿戴设备机器学习的更多信息,请查看以下内容: - 熟悉多变时间序列的操作——这是大多数可穿戴设备产生的数据类型 - 了解更多关于半监督学习技术 - 如果你有 Fitbit,尝试这个教程 (https://towardsdatascience.com/using-the-fitbit-web-api-with-python-f29f119621ea) 来操作你自己的健康数据 - 如果你有 iPhone 或 Apple Watch,学习如何使用 HealthKit (https://developer.apple.com/documentation/healthkit) 提取你的健康数据 我们的基因组、蛋白质组、细胞等构成了我们的核心,但如果没有技术,它们对我们来说是无法理解的。尽管这些分子特征对于理解我们的身体至关重要,但我们仍有许多不了解的地方。分子生物学家和计算生物学家在提高我们对分子细胞生物学的理解方面取得了巨大进展。一个著名的例子是下一代测序(NGS)技术,它使研究人员能够在不到一天的时间内测序(即:读取)整个人类基因组。然而,在这些创新之上,某些实验检测可以通过使用机器学习得到提升。 我们已经看到了将计算技术应用于生物学的好处,正如通过开发 DeepVariant (https://ai.googleblog.com/2017/12/deepvariant-highly-accurate-genomes.html)、Alphafold 2 (https://deepmind.com/research/case-studies/alphafold) 或 COVID-19 治疗方法 (https://arxiv.org/pdf/2006.03735.pdf) 所展示的那样。 DeepVariant 是由 Google 和 Verily Life Sciences 开发的模型,减少了易出错下一代测序机器在基因组测序中的错误数量。这对生物学中大多数机器学习应用都非常相关,因为遗传序列中哪怕是最小的错误也可能对健康产生不利影响。 Google/Deepmind 在计算生物学领域的最新贡献是 Alphafold 2。他们的模型以极高的精度成功预测了蛋白质折叠。这反过来对药物发现领域以及那些繁琐且昂贵的科学实验的需求产生了巨大的影响。研究人员可以使用 Alphafold 模型来确定蛋白质的结构,从而显著减少实验时间,而无需使用冷冻电子显微镜。 [](https://substackcdn.com/image/fetch/$s_!ytio!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F8a57343b-3619-4457-bc04-2438e922d030_512x384.png)###### *图 8:蛋白质是如何折叠的——这个过程相当复杂,对吧?* 同样,麻省理工学院的研究人员也试图通过找出如何重新利用现有药物而不是开发新药物来缩短 COVID-19 药物的开发时间。其背后的动机是后者需要更长的时间。这篇论文有趣的是,他们的模型既考虑了疾病引起的基因表达变化,也考虑了衰老引起的变化。这对于像 COVID-19 这样对老年人和年轻人影响不同的疾病至关重要。凭借这些知识,研究人员能够识别出同时受到 COVID-19 和衰老影响的基因。然后,他们使用自动编码器搜索针对这些基因的现有药物。 尽管有这些了不起的创新,将机器学习应用于分子生物学仍面临一些挑战。首先,维度诅咒在该领域非常普遍。基因组序列超过 30 亿个碱基对,因此是高维的。因此,为了创建鲁棒的机器学习系统,模型要么需要输入大量数据,要么必须降低数据的维度。不幸的是,收集大量基因组数据很困难(ev

相似文章