算法设计与医生责任
摘要
本文探讨了医疗保健中的责任规则如何重塑人工智能算法设计决策和医生使用情况,发现这些规则可能导致人工智能使用的差异化,而强制要求准确率平等可能对两个群体都造成损害。
arXiv:2608.13618v1 公告类型:新
摘要:一个临床算法可能在患者群体间提供不准确率,随着人工智能(AI)在临床决策中的普及,对这种差异的担忧日益增长。为此,美国引入的一项责任规则规定,当医疗提供者依赖差异化算法导致错误临床决策时,需承担责任。我们研究了此类责任考虑如何重塑(i)AI公司的算法设计决策,该决策推动群体特定准确率,以及(ii)医生在医疗交付中使用AI的决策。AI公司为两个患者群体设计算法,提高弱势群体的准确率成本更高。医生(仍然是责任决策者)随后决定是否咨询AI,权衡临床不确定性的减少与当AI错误不成比例地影响弱势群体时的预期责任风险。我们发现责任规则可能导致AI的差异化使用:医生可能整体减少AI使用,并在责任的中等范围内较少依赖AI处理弱势患者。这种影响是非单调的。随着责任增加,医生对弱势患者使用AI的比例先下降,后上升,因为公司重新分配投资以减少差异或转向平等准确率设计。强制要求患者群体间算法准确率平等则可能无意中损害两个群体,因为统一的准确率要求扭曲了公司的投资激励和医生的均衡AI使用决策。
查看缓存全文
缓存时间: 2026/08/17 09:45
# 1 引言 来源:https://arxiv.org/html/2608.13618 **算法设计与医生责任** 栾淑洁 Shubhranshu Singh 戴庭龙\*\*\* 栾淑洁隶属于澳大利亚珀斯西澳大利亚大学UWA商学院;Shubhranshu Singh和戴庭龙隶属于美国马里兰州巴尔的摩市约翰斯·霍普金斯大学凯瑞商学院,邮编21202。合著者对本文贡献均等。 通讯地址可发送至:[email protected](SL);[email protected](SS);[email protected](TD)。 本版本日期:2026年8月12日 > **摘要** > 单一临床算法可能在不同患者群体间产生不均等的准确性,而随着人工智能(AI)在临床决策中的普及,人们对此类差异的关注日益增长。为此,美国引入的一项责任规则规定,当医疗服务提供者因依赖存在差异的算法而导致错误临床决策时,需承担相应责任。本文探讨此类责任考量如何重塑(1)AI公司旨在驱动群体特定准确性的算法设计决策,以及(2)医生在医疗过程中使用AI的决策。AI公司为两组患者设计算法,其中提升弱势群体的准确性成本更高。作为最终担责决策者的医生随后决定是否咨询AI,权衡临床不确定性的降低与AI错误不成比例地影响弱势群体时的预期责任风险。我们发现,该责任规则可能引发AI的*差异化使用*:医生可能整体上减少AI使用,并且在特定责任范围内,更少地依赖AI来服务弱势患者。这种效应呈非单调性:随着责任增加,医生对弱势患者的AI使用先减少,随后当公司将投资重新分配以减少差异或转向均等准确性设计时,使用量又会上升。因此,强制要求算法在不同患者群体间达到均等准确性,可能无意中损害双方利益,因为统一的准确性要求扭曲了公司的投资激励和医生的均衡AI使用决策。 **关键词**:临床算法;产品设计;算法差异;责任;人机交互 ## 1 引言 人工智能(AI)正在重塑专家决策,但大多数研究将AI生命周期的两个方面分开探讨。一类研究关注企业在技术和监管约束下如何设计算法(如Diao等人2023 (https://arxiv.org/html/2608.13618#bib.bib17)、Israeli 2018 (https://arxiv.org/html/2608.13618#bib.bib31)、Iyer与Ke 2024 (https://arxiv.org/html/2608.13618#bib.bib32));另一类则关注人类专家如何采纳、信任或策略性地使用算法建议(如Dai与Singh 2025 (https://arxiv.org/html/2608.13618#bib.bib15)、Dietvorst等人2018 (https://arxiv.org/html/2608.13618#bib.bib18)、McLaughlin与Spiess 2022 (https://arxiv.org/html/2608.13618#bib.bib44))。在实践中,这两方面是共同决定的:规范从业者如何使用AI的规则,会反向影响企业构建AI的方式。当监管针对使用端时,而触发责任的性能差异在上游设计阶段形成时,这种相互依赖性尤为重要。由此产生一个反馈循环:(1)企业为不同客户群体设计产品质量,(2)面临政策约束的专家中介决定是否使用该产品。临床决策支持为这一反馈循环提供了典型场景。尽管“临床算法”曾指透明的流程图,但AI的进步已将其前沿推向高性能但往往不透明的系统(Gottlieb 2024 (https://arxiv.org/html/2608.13618#bib.bib27)、Green与Defoe 1978 (https://arxiv.org/html/2608.13618#bib.bib28)、Margolis 1983 (https://arxiv.org/html/2608.13618#bib.bib43))。截至2026年初,美国食品药品监督管理局(FDA)已批准超过1,300种基于AI的医疗设备(FDA 2025 (https://arxiv.org/html/2608.13618#bib.bib20))。这些AI工具可改善筛查、诊断和治疗决策(Leong等人2023 (https://arxiv.org/html/2608.13618#bib.bib36)、Rajpurkar等人2022 (https://arxiv.org/html/2608.13618#bib.bib53)、Topol 2019 (https://arxiv.org/html/2608.13618#bib.bib59)),但其融入常规医疗仍不均衡(Abràmoff等人2024 (https://arxiv.org/html/2608.13618#bib.bib2)、Wu等人2023 (https://arxiv.org/html/2608.13618#bib.bib61))。采用的主要障碍是对*算法差异*的担忧——即受保护群体间预测性能的系统性差异——这引发了公平性质疑,并使临床医生和医院面临重大法律风险(Mehrabi等人2021 (https://arxiv.org/html/2608.13618#bib.bib45)、Obermeyer等人2019 (https://arxiv.org/html/2608.13618#bib.bib50)、Obermeyer等人2021 (https://arxiv.org/html/2608.13618#bib.bib49))。反映这些担忧,美国医疗保险和医疗补助服务中心(CMS)已将《民权法案》第1557条的非歧视要求扩展至临床决策支持工具(§ 92.210)。该规则禁止歧视性使用,并明确要求相关实体做出合理努力以识别和减轻差异,从而将算法问责的直接负担置于医疗服务提供者身上(CMS 2022 (https://arxiv.org/html/2608.13618#bib.bib9)、CMS 2024 (https://arxiv.org/html/2608.13618#bib.bib10))。由于在美国背景下,大多数医疗服务提供者是医生,本文后续部分将“医生”和“提供者”这两个术语互换使用。 受此政策转变的启发,我们研究当算法在不同患者群体间表现不均时,部署端的非歧视责任如何改变临床AI开发和使用中的激励。为隔离此机制,我们抽象了更广泛的责任渠道——尤其是医疗事故(Price等人2019 (https://arxiv.org/html/2608.13618#bib.bib52))——并聚焦于该监管最直接执行的边界:临床医生在患者护理中对决策支持工具的依赖。我们的模型以两阶段结构将上游技术设计与下游临床实践联系起来。首先,AI公司选择针对两组患者的准确性:优势群体(其性能提升相对便宜)和弱势群体(由于数据稀疏和测量摩擦,提升成本更高(Chen等人2018 (https://arxiv.org/html/2608.13618#bib.bib7)、Mehrabi等人2021 (https://arxiv.org/html/2608.13618#bib.bib45)))。其次,医生决定在特定病例中是否使用该工具,并在决定使用时,是否遵循其建议。这一设置使我们能够研究责任是通过诱导减少差异的投资来实现其预期目标,还是反而削弱采用并转移投资,从而使弱势患者处境更差。 我们将这种相互作用形式化如下:当算法存在差异时,对弱势患者遵循错误建议会产生特定的责任风险;当算法具有均等准确性时,这种基于差异的责任渠道被移除。医生的核心权衡由此明确:AI可以减少临床不确定性,但其使用也带来使用成本和预期法律风险。这一结构捕捉了核心的监管张力:在使用端执行的政策可能反作用于差异本身的产生阶段——设计阶段。 我们的分析得出三个主要结论。第一,与差异化AI工具不良结果相关的责任可能引发AI的*差异化使用*。即使算法的准确性固定,医生也会为更少的弱势患者咨询AI,因为预期法律风险对该群体而言如同额外的影子依赖成本。因此,旨在保护弱势患者免受不平等算法性能影响的政策,可能最终限制他们完全获得AI的机会。第二,责任对弱势患者AI使用的影响是非单调的。小幅增加责任时,直接威慑效应占主导,使用量下降。但随着责任进一步上升,企业通过重新分配投资以提升弱势群体准确性来内生性地回应,并在超过阈值后转向均等准确性设计。这些上游反应降低了医生的预期风险,并能恢复使用量,甚至相对于中等责任水平有所增加。这种反馈循环意味着,抑制下游使用的同一政策,在较高责任水平时可能强化上游减少差异的激励。第三,我们表明强制要求跨组测量准确性均等并不一定能提高福利,且在合理条件下可能同时降低双方的福利。一刀切的准确性要求在非对称改进成本下扭曲了企业的资源配置:在许多情况下,它大幅降低优势群体准确性,同时仅适度提升弱势群体准确性。结合奖励AI使用的报销结构,这种转变还可能改变临床部署方式,导致不当使用增加。平衡算法性能与确保适当的临床依赖是不同的政策目标。针对前者的责任标准可能需要配套工具——如报销设计、使用指南或监控规则——来实现后者。 日益增长的证据表明,算法性能可能因群体差异而系统性地影响护理和结果(Abràmoff等人2022a (https://arxiv.org/html/2608.13618#bib.bib1)、Goodman等人2023 (https://arxiv.org/html/2608.13618#bib.bib26))。例如,Obermeyer等人2019 (https://arxiv.org/html/2608.13618#bib.bib50)显示,一种广泛使用的临床风险算法中的种族差异导致更少的黑人患者被识别出需要额外护理,尽管其疾病更严重。尽管在开发早期解决差异通常比事后修复更有效(Gichoya等人2023 (https://arxiv.org/html/2608.13618#bib.bib24)),但我们的分析表明,监管设计仍然至关重要:相同的法律目标可能因激励结构不同而产生截然不同的均衡结果。我们并非反对监管算法差异;而是阐明若责任标准要按预期发挥作用,必须解决的激励权衡问题。更广泛地说,本文将医学AI视为专家决策的投入,而非替代。即使AI高度准确,其部署也取决于透明度、问责制以及闭环中人类专家的激励。诸如§ 92.210之类的法规限制了对差异化工具的依赖,这意味着AI设计的福利影响是通过下游采用决策来过滤的。因此,我们的模型允许医生决定是否使用AI,以及在使用时依赖程度如何;我们研究这些部署决策如何反作用于企业的设计激励,以及责任和报销如何塑造这种反馈。 ## 2 文献综述 我们的工作贡献于源于Darby与Karni 1973 (https://arxiv.org/html/2608.13618#bib.bib16)的专家服务文献,他们认为像医生这样的信誉商品提供者可能过度提供专家服务。该文献的一个关键主题是责任塑造临床行为:实证和实验证据证实,医疗事故责任影响医生决策(Currie与MacLeod 2008 (https://arxiv.org/html/2608.13618#bib.bib13)、Dulleck等人2011 (https://arxiv.org/html/2608.13618#bib.bib19)),理论研究表明责任可以约束提供者,就像声誉关注一样(Fong与Liu 2018 (https://arxiv.org/html/2608.13618#bib.bib21)),或诱导适当的治疗选择(Chen等人2022 (https://arxiv.org/html/2608.13618#bib.bib8))。111相关领域(如产品安全(Guan等人2024 (https://arxiv.org/html/2608.13618#bib.bib29)、Iyer与Singh 2018 (https://arxiv.org/html/2608.13618#bib.bib33)))的责任文献提供了有价值见解,但并不直接适用于专家服务背景。AI的引入使这一图景复杂化。例如,Dai与Singh 2025 (https://arxiv.org/html/2608.13618#bib.bib15)探讨了新兴责任框架下的医生行为,但聚焦于医疗事故责任以及因忽视AI建议而产生的责任,未涉及AI算法在不同患者群体间的潜在差异。我们建模了一种AI特定的医疗监管,并分析其对AI公司、医生和患者的影响。 我们的工作也与AI在医疗决策中作用的文献相关。使用AI支持临床决策与信息获取文献相连。先前工作研究了人类如何与算法互动,包括算法偏好和算法厌恶(Dietvorst等人2018 (https://arxiv.org/html/2608.13618#bib.bib18)、Iyer与Ke 2024 (https://arxiv.org/html/2608.13618#bib.bib32)、Leung等人2018 (https://arxiv.org/html/2608.13618#bib.bib37)、Mohammadi等人2024 (https://arxiv.org/html/2608.13618#bib.bib47))。文献也试图识别AI过度使用/过度依赖的原因。McLaughlin与Spiess 2022 (https://arxiv.org/html/2608.13618#bib.bib44)提供了一种解释:AI改变偏好可导致过度依赖;例如,决策者可能将算法建议视为默认行动。关于AI使用不足的原因,Dai与Singh 2020 (https://arxiv.org/html/2608.13618#bib.bib14)开发了一个信号模型,表明高技能医生可能通过低使用诊断测试来传递其技能信号。Balakrishnan等人2026 (https://arxiv.org/html/2608.13618#bib.bib4)表明,当人类自身的私人信息(算法无法获取)有价值时,人类会过度依赖算法预测,否则则依赖不足。我们与这一研究流的区别在于,不直接研究人类因素的影响,而是考察潜在责任的影响。通过连接医学AI的上游和下游,我们表明在责任相对较小时,医生可能因主要的担忧而使用不足;在责任相对较大时,由于上游激励投资于高算法准确性,医生可能过度使用。 我们的工作也贡献于算法性能差异的文献。大量研究记录了种族、性别、年龄和其他特征在健康和医疗保健方面的系统性差异(Heckler 1985 (https://arxiv.org/html/2608.13618#bib.bib30)、Nelson 2002 (https://arxiv.org/html/2608.13618#bib.bib48))。随着预测算法在高风险领域扩散,一个核心担忧是,当训练数据和预测目标与临床需求不一致时,这些工具可能复制甚至扩大此类差距(Benjamin 2016 (https://arxiv.org/html/2608.13618#bib.bib5)、Gianfrancesco等人2018 (https://arxiv.org/html/2608.13618#bib.bib23))。例如,Tipton等人2023 (https://arxiv.org/html/2608.13618#bib.bib58)回顾了证据表明,标准的“公平性修复”(如忽略种族)可能在一个维度上改善平等性,同时却恶化更广泛的健康结果。相关工作开发了减少差异性能的技术方法——通过改变目标
相似文章
在信息缺失情况下评估医疗人工智能:同源评审者与人工评分者改变表观安全性
本文将信息缺失压力测试推广至开放式医疗对话,发现大语言模型评审者的选择会显著改变表观安全性,且LLM评审者比临床医生更为宽松。
立场:医疗AI忽视真实治疗结果
本文立场文章论证了医疗AI在训练和评估中忽视了真实治疗结果,阻碍了其改善患者护理的能力,并建议纳入实际结果数据以符合循证医学原则。
AI与责任
布鲁斯·施奈尔评论德国一项裁决,该裁决认定谷歌对其AI概述中的错误负有责任,并主张AI代理应被视为部署者的代理人。
对齐可信度:医疗AI安全保证的新标准
提出将'对齐可信度'作为医疗AI安全保证的新监管标准,类比生物可信度,并要求三个层次的对齐以对应临床监督。
如何不微调你的医疗大语言模型:深入探讨Mark Kaplan的healtthruth.ai——"覆盖并重构基础训练"
本文批评了Mark Kaplan通过其平台healtthruth.ai微调医疗大语言模型的方法,指出了在医疗AI中覆盖基础训练的陷阱。