数十年前的匿名化医疗数据可能引发当前人工智能误诊
摘要
一项研究表明,人工智能训练数据集中来自数十年前的匿名化患者记录可能导致模型误诊当前患者,因为模型会关联历史健康状态,从而增加诊断错误的风险。
暂无内容
查看缓存全文
缓存时间: 2026/09/18 13:55
# 数十年匿名医疗数据可能导致当今AI误诊
来源:https://www.unite.ai/decades-old-anonymized-medical-data-may-cause-ai-misdiagnoses-now/
根据德国与英国的一项新研究合作,数十年前就已纳入医疗数据集的匿名患者记录,可能导致在这些数据上训练出的AI系统在数年后仍能识别出**真实患者**的特征——并将2026年的患者当作仍是2012年(或其匿名患者数据首次被纳入数据集的年份)的状态来对待。
例如,这意味着一名20年前记录显示正在接受癌症治疗、随后进入长期缓解期的患者,现在可能会被AI系统**置于其旧时患癌状态的背景下**进行诊治——从逻辑上讲,这甚至会增加癌症复发的误诊概率。
反之,如果该患者在2012年的数据反映其常规体检完全健康,这种乐观的健康状况判断可能会被套用到患者的**当前年长版本**身上,从而掩盖对可能需要治疗的新疾病或问题的检测。
*新论文中展示了记忆偏差如何影响复诊患者的示意图。一个在爱丽丝早期健康心电图上训练的模型,对其后期心脏病发作仅给出15%的概率预测,而一个从未见过其历史记录的模型则给出73%的概率。*来源 (https://arxiv.org/pdf/2609.17223)
## 控制“数据迁移”
这种场景因各国和地区的各种指令而变得更加可能,这些指令建议,为此类目的使用的患者数据应理想地来源于其计划部署AI系统的国家,这“本地化”了数据集中的患者池,并显著增加了此类未被发现的匿名化还原事件的可能性。
推论可知,将可用数据量限制为单一国家数据集会增加**记忆化**(https://www.unite.ai/llms-memory-limits-when-ai-remembers-too-much/#:~:text=Balancing%20Memory%20and%20Generalization%20in%20LLMs,-To)的可能性——即模型在训练期间可能多次看到相同数据,以至于对这些过度学习的模式变得“执着”。相反,数据集越大、越多样化,在训练后就越有可能**泛化**(https://archive.is/XWMt9)到未见数据,而不是记住特定的数据点或配置。
然而,添加“外来”医疗数据可能会引入不适用于部署该训练模型的国家的国民健康趋势和特质证据;在这方面,正如新论文(https://arxiv.org/pdf/2609.17223)所承认的,一定程度的记忆化是恰当且有用的,因为它有助于模型在特定人群最可能的总体医疗特征范围内工作。
论文指出:
“当模型被前瞻性部署时,记忆化会创造一个具体且未被充分认识的风险。因为患者的记录随时间推移具有高度的自我相似性,未来的记录可能作为部分线索,触发对已记忆的历史记录的回忆,从而将模型的预测推向患者先前的健康状态。”
“这并非假设情景。医疗AI模型通常就在其训练数据来源的同一人群中部署。”
“例如,德国的全国乳腺癌筛查项目(https://www.nature.com/articles/s41591-024-03408-6)使用(https://www.thelancet.com/journals/landig/article/PIIS2589-7500(22)00070-X/fulltext)一个基于同一筛查人群120万张乳腺X光片训练的AI模型。”
“类似的部署正在进行中,包括英国(https://www.isrctn.com/ISRCTN81384017)和瑞典(https://pubmed.ncbi.nlm.nih.gov/41620232/)的全国乳腺癌筛查项目。”
“监管指南积极鼓励这种做法,例如欧盟AI法案(https://ai-act-service-desk.ec.europa.eu/en/ai-act/article-10#:~:text=4%2E-,Data,used)要求训练数据反映预期使用的地理和环境背景(第10(4)条),而类似的国际医疗AI开发指南(https://www.imdrf.org/sites/default/files/2025-02/IMDRF_AIML%20WG_GMLP_N88%20Final.pdf)则要求模型训练数据集中应充分代表预期患者群体。”
## 持久的历史不幸…?
尽管论文未探讨此问题,但从统计学上似乎合乎逻辑的是:那些一生中未(或未定期)参加医疗检查,其匿名记录周期性进入AI数据流的患者,很可能**几乎只在需要治疗时**出现在匿名患者数据中——这倾向于增加将长期治愈的疾病“投射”到同一位当前患者身上的可能性,因为记录中没有“健康”状态的平衡。
先前关于电子健康记录中**“知情存在偏差”**的研究(https://pmc.ncbi.nlm.nih.gov/articles/PMC6857502/)证实了这一点,该研究发现医疗数据集不成比例地代表了患者生病并与医疗服务互动的时期。
一项研究(https://pmc.ncbi.nlm.nih.gov/articles/PMC4062889/)发现,重病患者拥有实验室数据的天数是健康患者的5.05倍,拥有药物订单的天数是健康患者的6.85倍。
2022年,约76%的美国成年人报告(https://cdc.gov/places/measure-definitions/prevention.html)在过去一年内进行过常规体检(CDC定义为一般性体格检查,而非针对特定病症的治疗);在欧洲,2023年一项跨国调查发现(https://www.stada.com/media/health-reports/stada-health-report-2023/prevention),58%的人至少参加了一些预防性检查;但只有15%参加了所有相关的预防性预约。
## 影响程度
该研究在四个大型医疗数据集上测试了这种影响,涵盖心电图记录、胸部X光片和电子健康记录;具体是MIMIC-CXR胸部X光数据库(https://www.physionet.org/content/mimic-cxr/2.1.0/)和MIMIC-IV-ED(https://www.physionet.org/content/mimic-iv-ed/2.2/?utm_source=chatgpt.com)急诊护理记录,以及MIMIC-ECG(https://physionet.org/content/mimic-iv-ecg/1.0/)和规模更大的HEEDB(https://www.nature.com/articles/s41597-026-06861-9)心电图集合。这些数据集的规模从数万名患者到超过180万人不等。
作者指出,计算出的影响差异很大,在某些情况下,预测概率的变化超过70个百分点。
*结果显示历史患者数据如何改变后续预测。上图比较了四个数据集中这些变化的频率和大小;下图显示了这种影响如何随距离患者最后一条训练记录的时间而变化。显著影响随时间推移变得不那么常见,但在数十年后仍可检测到。*
作为对照,研究人员随机将模型分组并重复比较,但未对未来预测产生显著变化。
论文指出,这种影响可能持续数十年。尽管随着记录间隔的增加,影响通常变得更弱且更少见,但包含从1980年代到2025年收集的心电图的HEEDB数据集显示,在患者最近一条训练记录**超过25年**后,预测仍出现了显著变化。
## 诊断危害
这篇题为《医疗AI中的记忆偏差》的新论文的研究者们,接下来模拟了记忆化如何影响患者后来遇到一个基于其早期记录训练的模型时的诊断准确性。
未来的病例根据患者是否患有新疾病(缺席于其历史训练数据中),或其健康状况基本相同而进行分类。
对于新疾病,影响被证明始终是负面的:之前见过患者历史记录的模型,在四个数据集所代表的一系列诊断中表现出较低的敏感性。这包括心肌梗塞和其他心电图异常、肺部疾病以及更广泛的危急结果。
实际上,当患者的健康状况发生变化时,模型会产生更多假阴性;但当患者的健康状况**没有**变化时,模型对其早期记录的记忆使其更可能做出正确诊断。敏感性和特异性都提高了,因为患者的当前状况**与训练数据中已代表的状况相似**。
作者指出,这可能使此类系统难以准确评估:如果大多数复诊患者仍患有相同疾病,模型在这些患者身上的表现会更好,从而可能掩盖其对已患新疾病患者的较低敏感性。
### 补救措施
作为可能的保障措施,研究人员测试了训练过程中的**差分隐私**(https://www.unite.ai/what-is-differential-privacy/)(该技术限制模型保留关于任何个体训练样本的信息量)。
尽管保护个体记录减少了记忆化影响,但即使在测试的最强设置下,也未能完全消除它。在患者层面应用保护,覆盖同一人的所有记录,效果要好得多,几乎消除了这种影响。
然而,应当注意的是,如果数据集已经不可逆转地匿名化,则无法以允许此类方法的方式隔离患者的数据;此外,研究人员观察到,如果数据集训练时未启用差分隐私,**成员推断攻击**(https://arxiv.org/pdf/1610.05820.pdf)会成为风险(https://pmc.ncbi.nlm.nih.gov/articles/PMC13442007/);如果启用了差分隐私,训练所需的资源将显著增加。
## 结论
作者最后指出,尽管目前令人担忧的事件发生率相对较低,但未来可能会发生变化:
“有理由预期,归因于记忆偏差的漏诊数量将在未来增加,尽管我们未直接测试这一点。先前研究表明,模型记忆的训练数据比例随模型容量增加而增加[6, 7, 9, 10, 40]。”
“考虑到当前AI模型开发受‘缩放定律’[41]指导,该定律推动模型和数据集规模快速扩大以追求性能提升,这令人担忧。”
“随着更大的AI模型在来自更庞大患者群体的历史数据上训练,受记忆偏差影响的个体绝对数量可能会急剧上升,加剧我们在此识别的风险。”
**我将作者的行内引用转换为超链接,并在无法精确复制或无益处时进行了解释性处理。**
**首次发布于2026年9月18日,星期五**
相似文章
@OpenAI:许多病例多年来一直未被专家分析所破解。这项研究表明,人工智能可以让专家主导的定期再分析更具可扩展性,帮助临床医生随着医学知识的进步重新审视病例,并可能为更多此前难以分析的病例找到答案。
该研究表明,人工智能可以使专家主导的旧病例定期再分析更具可扩展性,帮助临床医生随着医学知识的进步重新审视病例,挖掘值得调查的线索,并可能为更多此前难以分析的病例找到答案。
医疗预约中AI记录员的错误使患者深感痛苦
在一次医疗预约中,AI记录员错误地声称患者正在服用非法药物,引发患者痛苦,并引发了对人工智能在医疗保健中准确性和患者安全性的担忧。
诉讼称梅奥诊所使用AI正在严重损害患者护理
梅奥诊所前研究主任指控该医院忽视了其AI工具(MAYA)的高错误率,并因她举报而进行报复,引发了关于AI在医疗保健中部署的严重担忧。
@rohanpaul_ai: 这项发表在《自然医学》上的研究对医疗AI发出了强烈警告。前沿医疗AI隐藏着……
《自然医学》的一项研究警告称,前沿AI模型在医疗领域看似医学上出色,但临床上尚未准备就绪,在改变问题或删除输入的应激测试中会失败。该研究强调,基准测试成功并不等同于临床准备就绪。
AI自信地给你过时的信息。原因之一及如何避免
解释为何AI模型因上下文持续存在而自信地提供过时信息,并提供实用建议,如使用干净的上下文和时间戳值。