医疗AI辅助的益处因用户专业水平而异

MIT News — Artificial Intelligence 论文

摘要

《自然医学》上一项由MIT主导的新研究发现,AI辅助和可解释性方法对皮肤病诊断准确率的影响因用户专业水平而异:非专家过度信任AI解释,而临床医生仅在模型预测(无解释)时表现最佳。结果凸显了考虑自动化偏见的以用户为中心的AI设计之必要性。

<p>在设计辅助疾病诊断的人工智能系统时,采用“一刀切”的方法很可能并非最佳策略。</p><p>MIT及其他机构研究人员开展的一项新研究发现,虽然AI辅助总体上提高了非专家和临床医生诊断皮肤病的准确率,但AI可解释性方法的影响因用户的知识水平而异。</p><p>可解释AI方法通过描述或验证模型的决策过程,帮助用户判断何时信任模型的预测。例如,模型可能使用热力图来突出对其诊断最重要的图像区域,或使用大语言模型(LLM)以通俗语言解释预测结果。</p><p>在这项研究中,研究人员测试了非专家和初级保健提供者在不同可解释AI系统帮助下(以及没有帮助时)进行皮肤病诊断的表现。</p><p>他们发现,非专家的诊断准确率有所提高,但这在很大程度上是因为对AI系统的遵从。非专家无论LLM的解释正确与否都会信任,而且认为模糊或通用的解释更具说服力。</p><p>相比之下,临床医生不会被错误的AI辅助所误导,并且只在获得模型预测(无相应解释)时表现最佳。</p><p>“好的AI系统可以在某些医疗场景中提高表现,但这必须与可能导致更多错误的算法遵从相平衡。我们知道,AI和可解释性方法都可能引发人类的自动化偏见,这种锚定效应是我们在设计AI系统时必须考虑的,”MIT电气工程与计算机科学系(EECS)副教授、医学工程与科学研究所成员、信息与决策系统实验室以及Abdul Latif Jameel健康机器学习诊所首席研究员Marzyeh Ghassemi表示。</p><p>“这些发现很重要,因为患者越来越多地求助于AI来帮助他们的医疗保健。我们的研究显示,当可解释AI模型给出错误输出时,医学知识最少的人最容易被误导,”共同作者、斯坦福大学生物医学数据科学和皮肤病学助理教授Roxana Daneshjou说。</p><p>研究人员表示,这些结果强调了构建以用户为中心的AI系统,以及开发鼓励批判性思考而非过度依赖模型的可解释性方法的重要性。</p><p>“越来越明显的是,我们不能仅仅假设一个好的AI就能解决所有问题。我们需要密切关注将使用AI系统的用户,因为同一个解释可以帮助专家,却可能误导初学者。往往最可能从AI中受益的人,也是最容易被它误导的人,因此我们如何呈现建议与其是否正确同样重要,”第一作者、哥伦比亚大学生物医学信息学系助理教授Orson Xu说。</p><p>与Ghassemi、Xu和Daneshjou共同撰写论文的还有许多作者,包括MIT研究生Haoran Zhang、本科生Reina Wang、Jameel诊所研究附属人员Luis Soenksen博士(’20),以及临床医生和研究人员。该研究的描述<a href="https://link.springer.com/article/10.1038/s41591-026-04553-w" target="_blank">今日发表于《自然医学》</a>。</p><p><strong>探索解释</strong></p><p>多个FDA批准的AI界面已被用于帮助临床医生识别医学图像中的皮肤状况,以简化早期诊断。除了提供图像中是否存在疾病的预测外,这些工具通常还使用多种方法之一来解释模型的决策过程。</p><p>与此同时,非专家可以使用AI驱动的搜索引擎自行进行数字诊断,这些搜索引擎根据用户提示预测皮肤病。这些系统通常使用LLM以更简单的术语解释模型的预测。</p><p>研究人员探索了这些可解释AI工具对初级保健医生和非专家在皮肤病检测中的影响和潜在益处。他们通过向用户展示医学图像以及AI的皮肤病预测来测试用户,并采用了不同的可解释AI方法。</p><p>这些方法包括:仅提供AI预测和置信水平(无解释)、提供相似图像以强化预测的方法、基于热力图突出重要图像区域的方法,以及用通俗语言解释模型推理的LLM。</p><p>非专家的任务是在有和没有可解释AI帮助的情况下,决定一张皮肤痣图像是否为癌变。临床医生则面临更具挑战性的任务:提供皮肤病的鉴别诊断。</p><p>研究人员发现,所有可解释AI方法都提高了非专家的准确率,这主要是因为工具有助于用户诊断非癌性痣。</p><p>此外,当他们采用一个旨在对抗深色皮肤偏见的公平性约束模型时,该系统显著提高了准确率,并减少了基于肤色的诊断差异。</p><p>“但非专家用户表现更好的原因是他们更依赖模型。当模型出错时,对表现的损害大于模型正确时对表现的帮助。我们只是能够针对这一场景训练出非常好的AI模型,”Ghassemi说。</p><p>这种遵从效应在LLM解释中最为显著,用户在LLM辅助下对自己错误答案的信心更强。</p><p>另一方面,临床医生对错误的AI解释具有抵抗力,并且在所有可解释性方法中,LLM对其准确率的提升最小。</p><p>“这实际上归结于每个群体如何使用解释。临床医生心中已有诊断,并会根据自身训练来核查AI,因此糟糕的解释会被发现。与此同时,非专家则可能首先利用完全相同的解释来形成意见,因此一个听起来合理且自信的理由可能把他们引向错误答案。同一个工具最终对一个用户是资产,对另一个用户却是负担,”Xu说。</p><p><strong>克服遵从效应</strong></p><p>当研究人员深入分析时,他们发现最顺从AI辅助的用户,在没有AI帮助时恰恰是任务表现最差的。</p><p>他们还发现,用户看到AI解释的时间点会影响其行为。如果在用户能够自行诊断之前先给出解释,他们往往会变得更顺从模型。</p><p>此外,当疾病表现较为隐蔽时,AI系统的表现优于人类;但如果图像中存在非典型症状或不相关特征,人类的表现则要好得多。</p><p>综合来看,这些结果表明可解释AI可能导致对模型的过度依赖,并使用户即使面对错误的AI建议也会盲目遵循。</p><p>与其使用LLM生成更详细的解释,可能更有效的做法是强制用户先给出诊断假设,然后提供基于AI的建议,以突出其他可能需要考虑的疾病。</p><p>“我们确实希望AI能够提高创造力,帮助用户提升技能或填补他们在细微表现上的空白。否则,我们就有可能引发自动化偏见,而当模型出错时,用户就无法恢复,”Ghassemi说。</p><p>这项研究部分得到了National Science Foundation、Schmidt Sciences和National Bureau of Economic的资助。</p>
查看原文
查看缓存全文

缓存时间: 2026/08/04 13:31

# 医疗AI辅助的益处因用户专业水平而异 来源:https://news.mit.edu/2026/medical-ai-assistance-benefits-vary-based-on-user-expertise-0804 在设计辅助用户进行疾病诊断的人工智能系统时,一刀切的方法很可能不是最佳策略。 麻省理工学院(MIT)及其他机构的研究人员进行的一项新研究发现,尽管AI辅助普遍提高了非专家和临床医生诊断皮肤病的准确性,但AI可解释性方法对不同知识水平用户的影响各不相同。 可解释AI方法通过描述或验证模型的决策过程,帮助用户判断何时信任模型的预测。例如,模型可能使用热图来突出显示其诊断中最重要的图像区域,或使用大语言模型(LLM)以平实的语言解释预测。 在这项研究中,研究人员测试了非专家和初级保健提供者在有或没有不同可解释AI系统帮助下的皮肤病诊断表现。 他们发现,非专家的诊断准确性确实有所提高,但这在很大程度上是由于对AI系统的遵从。非专家无论LLM解释的对错都会相信,而且当解释模糊或笼统时,他们会觉得更有说服力。 相比之下,临床医生不会被错误的AI辅助所误导,并且只在获得模型预测而没有伴随解释时表现最佳。 “良好的AI系统可以在某些医疗环境中提高表现,但这必须与可能导致更多错误的算法遵从相平衡。我们知道,AI和可解释性方法都可能引发人类的自动化偏差,这种锚定效应是我们设计AI系统时必须考虑的。”麻省理工学院电气工程与计算机科学系(EECS)副教授、医学工程与科学研究所成员、信息与决策系统实验室及Abdul Latif Jameel健康机器学习诊所首席研究员Marzyeh Ghassemi表示。 “这些发现非常重要,因为患者越来越依赖AI来帮助处理他们的医疗保健。我们的研究结果表明,当可解释AI模型给出错误输出时,医学知识最少的人最容易被误导。”斯坦福大学生物医学数据科学和皮肤病学助理教授、论文共同作者Roxana Daneshjou表示。 研究人员表示,这些结果强调了以用户为中心构建AI系统的重要性,以及开发鼓励批判性思维而非过度依赖模型的可解释性方法的重要性。 “越来越明显的是,我们不能仅仅假设一个好的AI就能解决所有问题。我们需要密切关注将使用AI系统的用户,因为同样的解释可以帮助专家,却可能误导初学者。通常,最可能从AI中受益的人,也最容易被它引入歧途,因此我们如何呈现推荐信息与推荐信息本身是否正确同样重要。”论文第一作者、哥伦比亚大学生物医学信息学系助理教授Orson Xu表示。 与Ghassemi、Xu和Daneshjou共同撰写论文的还有多位作者,包括MIT研究生Haoran Zhang、本科生Reina Wang、Jameel Clinic研究附属人员Luis Soenksen博士(’20),以及临床医生和研究人员。该研究的描述今天发表在*Nature Medicine*上(https://link.springer.com/article/10.1038/s41591-026-04553-w)。 **探索解释** 多个获得FDA批准的AI界面正被用于帮助临床医生识别医学图像中的皮肤状况,以简化早期诊断。除了提供图像中是否存在疾病的预测外,这些工具通常还会使用多种方法之一来解释模型的决策过程。 与此同时,非专家可以使用基于AI的搜索引擎自行进行数字诊断,这些搜索引擎根据用户提示预测皮肤病。这些系统通常使用LLM以更简单的术语解释模型的预测。 研究人员探索了这些可解释AI工具对初级保健医生和非专家在皮肤病检测中的影响和潜在益处。他们通过向用户展示医学图像以及AI对皮肤病的预测来测试用户,并采用了不同的可解释AI方法。 这些方法包括:没有解释的AI预测和置信水平、提供类似图像以强化其预测的方法、基于热图突出重要图像区域的方法,以及用平实语言解释模型推理的LLM。 非专家的任务是判断皮肤痣图像是否为癌性,分别在有和没有可解释AI帮助的情况下进行。临床医生则承担更具挑战性的任务,即提供皮肤病的鉴别诊断。 研究人员发现,所有可解释AI方法都提高了非专家的准确性,这主要是因为工具帮助用户诊断了非癌性痣。 此外,当他们采用一个旨在对抗深色皮肤偏见的公平性约束模型时,该系统显著提高了准确性,并减少了基于肤色的诊断差异。 “但非专家用户表现更好的原因是他们更依赖模型。当模型出错时,对性能的损害超过了模型正确时带来的帮助。我们只是能够针对这一场景训练出非常好的AI模型。”Ghassemi说。 这种遵从效应在LLM解释中最为明显,而且用户在使用LLM辅助时对自己的错误答案更有信心。 另一方面,临床医生对错误的AI解释有较强的抵抗力,而且在所有可解释性方法中,LLM对他们准确性的提升最小。 “这实际上取决于每个群体如何使用解释。临床医生心中已有诊断,并会根据自身的训练来检验AI,因此糟糕的解释会被发现。与此同时,非专家最初就可以利用完全相同的解释来形成意见,因此一个看似合理、听起来自信的理由可能会把他们拉向错误的答案。同一个工具最终成为一位用户的资产,却成为另一位用户的负担。”Xu说。 **克服遵从效应** 当研究人员进一步深入分析时,他们发现,对AI辅助最遵从的用户,在没有AI帮助的情况下,是任务中表现最差的。 他们还发现,用户看到AI解释的时机会影响他们的行为。如果在用户自己进行诊断之前先给出解释,他们往往会变得更加遵从模型。 此外,当疾病表现不显著时,AI系统的表现优于人类;但如果图像中存在非典型症状或不相关特征,人类的表现则好得多。 综合来看,这些结果表明,可解释AI可能导致用户过度依赖模型,甚至在AI推荐错误时盲目遵循。 与其使用LLM生成更详细的解释,不如先让用户给出诊断假设,再提供基于AI的建议以提示其他可能的病症供考虑,这样可能更有效。 “我们真心希望AI能够提升创造力,并提升用户的技能或填补他们在识别细微表现方面的空白。否则,我们就有可能引发自动化偏差,一旦模型出错,用户就无法纠正。”Ghassemi说。 这项研究部分得到了美国国家科学基金会、Schmidt Sciences、美国国家经济研究局和哥伦比亚大学的资助。

相似文章

@OpenAI:许多病例多年来一直未被专家分析所破解。这项研究表明,人工智能可以让专家主导的定期再分析更具可扩展性,帮助临床医生随着医学知识的进步重新审视病例,并可能为更多此前难以分析的病例找到答案。

X AI KOLs

该研究表明,人工智能可以使专家主导的旧病例定期再分析更具可扩展性,帮助临床医生随着医学知识的进步重新审视病例,挖掘值得调查的线索,并可能为更多此前难以分析的病例找到答案。

利用人工智能帮助医生诊断影响儿童的罕见遗传疾病

Reddit r/singularity

来自Boston Children's Hospital、Harvard和OpenAI的研究人员使用OpenAI o3 Deep Research reasoning模型重新分析了376例未解决的罕见疾病病例,经过专家审查和临床确认后,额外确诊了18例(确诊率4.8%)。这项发表在NEJM AI上的研究展示了人工智能辅助工作流程如何帮助专家在科学知识不断发展的情况下重新审视疑难病例。