基于上下文Bandit偏好学习的人机协同多智能体呼吸机决策支持

arXiv cs.AI 论文

摘要

本文提出了VDSS,一种用于呼吸机决策支持的人机协同多智能体框架,它利用上下文Bandit偏好学习来适应特定临床医生的调校风格。回顾性ICU轨迹重放表明,推荐的可接受性提高,交互轮次减少。

arXiv:2605.23320v1 Announce Type: new 摘要:呼吸机决策支持需要顺序决策,这些决策跟踪不断变化的生理状态和疾病轨迹,同时尊重安全边界和临床医生特定的调校风格。基于规则的方法很少能实现个性化通用,而端到端的强化学习或单一大型语言模型系统仍然难以控制和审计。我们提出了呼吸机决策支持系统(VDSS),这是一个人在回路中的多智能体框架,通过契约驱动的结构化接口协调模块化决策组件,并生成可追溯的证据以供审查。VDSS通过上下文Bandit进行在线偏好自适应,从每个调整周期最终接受的决策中更新临床医生特定偏好,并使用这些偏好来指导后续推荐。结构化的拒绝反馈触发了有针对性的重新规划,以减少无效迭代并提高交互稳定性。回顾性ICU轨迹重放与专家评审表明,推荐的可接受性更高,达到可接受计划所需的交互轮次更少,支持临床部署的人机协作。
查看原文
查看缓存全文

缓存时间: 2026/05/25 08:57

# 人在回路的多智能体呼吸机决策支持系统:基于上下文赌博机的偏好学习

来源:https://arxiv.org/html/2605.23320

11institutetext:上海工程技术大学,上海,中国
11email:qiuxihe1993@gmail\.com22institutetext:腾讯优图实验室,腾讯,中国33institutetext:同济大学医学院附属上海第十人民医院重症医学科,上海,中国44institutetext:上海交通大学医学院附属松江医院急诊与危重症科,上海,中国55institutetext:马克斯·普朗克心肺研究所,巴特瑙海姆,德国66institutetext:复旦大学,上海,中国77institutetext:柏林夏里特医学院生物医学创新中心,柏林,德国Xiaoyu Tan,∗Qixing WangWeiyi ZhaoChen ZhanTeqi HaoXuemin WangLei GuRoland EilsXihe Qiu,✉

###### 摘要

呼吸机决策支持需要序贯决策,既要跟踪不断变化的生理状态和疾病轨迹,又要遵守安全边界并结合临床医生的个性化调校风格。基于规则的方法通常难以实现个性化,而端到端强化学习或单一大型语言模型系统则难以控制和审计。我们提出了**呼吸机决策支持系统**(VDSS),这是一个人在回路的多智能体框架,通过契约驱动的结构化接口协调模块化决策组件,并生成可追溯的证据供审查。VDSS利用上下文赌博机实现在线偏好自适应,在每个调整周期中根据最终接受的决策更新临床医生特定偏好,并以此指导后续推荐。结构化的拒绝反馈会触发有针对性的重新规划,以减少无效迭代并提高交互稳定性。回顾性ICU轨迹回放与专家评审表明,该系统具有更高的推荐可接受性,并且达到可接受计划所需的交互轮次更少,支持了临床可部署的人机协作。

††footnotetext:\*同等贡献。 ✉ 通讯作者。

## 1 引言

机械通气是重症监护病房中维持生命的核心治疗手段。其临床价值不仅在于维持氧合和通气,有效治疗还需要根据患者不断变化的生理状态进行持续、精细的设置调整\[24 (https://arxiv.org/html/2605.23320#bib.bib2),4 (https://arxiv.org/html/2605.23320#bib.bib12)\]。呼吸机管理本质上是动态的。床边团队必须随着肺力学、气体交换、血流动力学和镇静水平的变化反复修订决策,同时实时平衡多个临床目标\[16 (https://arxiv.org/html/2605.23320#bib.bib4)\]。同时,高质量的滴定依赖于呼吸治疗师和经验丰富的临床医生的频繁评估和快速响应\[10 (https://arxiv.org/html/2605.23320#bib.bib28)\]。在许多医疗体系中,这一专业人才资源持续匮乏,持续的工作负担加上轮班交接,使得即使在同一个机构内也难以实现持续个性化的管理\[6 (https://arxiv.org/html/2605.23320#bib.bib14)\]。随着患者数量增加和工作流程压力增大,呼吸机决策支持的一个实际动机是将专家实践嵌入一种可扩展且可复用的形式,从而减轻认知负担并提高一致性\[15 (https://arxiv.org/html/2605.23320#bib.bib3)\]。

当前实践由方案和积累的经验指导,但ICU实际护理对决策支持提出了持续挑战\[5 (https://arxiv.org/html/2605.23320#bib.bib13)\]。患者的异质性和非平稳轨迹导致策略收益因个体和时间而异,限制了固定规则的可靠性\[9 (https://arxiv.org/html/2605.23320#bib.bib5),19 (https://arxiv.org/html/2605.23320#bib.bib15)\]。床旁滴定通常需要基于多个不完美的信号快速调整设置,而检查并记录理由的时间有限,可能导致不同周期之间的调整不一致\[21 (https://arxiv.org/html/2605.23320#bib.bib19),7 (https://arxiv.org/html/2605.23320#bib.bib20)\]。此外,临床团队在风险容忍度、调校风格和本地惯例上存在差异,如果没有显式建模和自适应,决策支持很难获得持续的信任和采纳\[8 (https://arxiv.org/html/2605.23320#bib.bib21),26 (https://arxiv.org/html/2605.23320#bib.bib22)\]。除了推荐的设置之外,临床医生还需要一个透明的链接,将推荐、患者状态、当前实践和团队偏好联系起来,以支持高效的重用\[14 (https://arxiv.org/html/2605.23320#bib.bib25)\]。这些因素促使呼吸机决策支持需要与工作流程对齐、连贯且可解释,同时能够随着临床偏好的变化而自适应\[20 (https://arxiv.org/html/2605.23320#bib.bib24),1 (https://arxiv.org/html/2605.23320#bib.bib26)\]。

基于这些需求,我们认为在高风险临床环境中,点态模型性能是必要但不充分的\[22 (https://arxiv.org/html/2605.23320#bib.bib1),13 (https://arxiv.org/html/2605.23320#bib.bib16)\]。成功部署的关键在于决策支持的行为能在床旁被检查,并能随着时间的推移进行优化而不破坏临床工作流程。因此,我们提出了呼吸机决策支持系统,这是一个人在回路的多智能体框架,将呼吸机决策过程分解为模块化智能体,并通过契约驱动的结构化接口调节智能体间的通信,实现连贯的多轮协作,并带有清晰、可审计的推理轨迹\[27 (https://arxiv.org/html/2605.23320#bib.bib6),3 (https://arxiv.org/html/2605.23320#bib.bib7)\]。该系统使用分层的短期和长期记忆来管理轨迹级信息和轮内上下文,提高推荐一致性和交互稳定性\[17 (https://arxiv.org/html/2605.23320#bib.bib8)\]。它进一步集成了一个上下文赌博机用于在线偏好自适应,将每个调整周期结束时临床医生的最终决策作为反馈,更新个体化的偏好表示,并指导后续推荐。我们通过回顾性ICU轨迹回放和专家评审验证了这一框架,显示出更高的推荐可接受性以及达到可接受推荐所需的交互轮次更少\[2 (https://arxiv.org/html/2605.23320#bib.bib27)\]。

1. 1\.VDSS被引入作为一个在回路多智能体呼吸机决策支持框架,通过模块化分解和契约驱动接口实现可验证且可维护的协作。
2. 2\.将分层的短期和长期记忆与可审计的证据追踪集成,使得多轮推荐保持连贯,并附带可追溯的状态摘要和理由,便于结构化审查。
3. 3\.基于上下文赌博机开发了一种在线偏好自适应机制,利用周期级临床医生决策作为反馈,适应不同的调校风格,提高可接受性并减少交互轮次。

参考图注图1:VDSS概览。面板A展示了患者及临床数据中枢,包含上下文窗口和长期记忆。面板B展示了VDSS多智能体推理引擎,从检测和阶段目标推断,到保持/调整门控、规划、安全检查以及反馈驱动的修订。面板C总结了一者在回路界面以及基于上下文赌博机的在线临床医生偏好优化。
## 2 呼吸机决策支持系统

### 2.1 VDSS架构:多智能体框架

VDSS将床边呼吸机滴定组织为一个契约治理的多智能体工作流,而不是一个直接将临床输入映射为呼吸机推荐的单一模型。这里,智能体指具有定义临床角色、角色特定输入和模式约束输出的LLM或VLM推理模块,而图路由、模式兼容性验证和安全检查则作为确定性控制组件实现。在每个调整周期tt,VDSS从当前床边状态、当前呼吸机设置、短期上下文和长期记忆中形成决策输入xtx_{t}。生理和通气测量值被视为状态变量,而临床医生可调整的呼吸机设置,包括通气模式、PEEP、氧浓度、压力支持、吸气压力和呼吸频率,则被视为动作变量。这种设计保持了从证据提取到决策推理再到面向临床医生的沟通的可追踪路径。

当波形数据可用时,**波形分析器**首先将渲染的压力和流量曲线转换为结构化的床边线索,包括波形质量、异步模式、可疑事件、观察到的患者状态和不确定性,从而用动态通气证据补充表格信号\[23 (https://arxiv.org/html/2605.23320#bib.bib17)\]。**检测智能体**将这些波形导出的线索与生理和通气测量值整合,识别异常并生成结构化的状态摘要。该摘要随后由**阶段目标管理器**解释,推断当前治疗阶段并指定主要和次要目标。根据检测到的异常和阶段一致的目标,**保持/调整门**选择一个分支决策bt∈{hold,adjust}b_{t}\in\{\mathrm{hold},\mathrm{adjust}\}。此门控使VDSS能够在当前配置可接受或可用证据不足以安全调整时避免不必要的滴定。

整体工作流程如图1 (https://arxiv.org/html/2605.23320#S1.F1)所示。如果bt=holdb_{t}=\mathrm{hold},VDSS直接进入周期结束,生成面向临床医生的摘要和结构化记录。如果bt=adjustb_{t}=\mathrm{adjust},VDSS进入主动滴定分支。**策略选择器**确定调整优先级,**模式选择**智能体评估在设备和模式特定的控制语义下是否需要模式更改,**参数规划器**在允许的动作变量上提出一组紧凑的可执行设置更新。在临床医生审阅之前,提出的更新通过确定性的安全性和兼容性检查,确保生成规划始终受显式的设备、模式和安全约束限制。如果临床医生拒绝推荐,**反思智能体**将结构化反馈转化为修订约束,并确定需要重新审视的决策层(如策略选择、模式选择或参数规划)。一旦推荐被接受,**记录生成器**生成最终的面向临床医生的摘要,存储可审计的周期记录,并提取用于后续偏好自适应的偏好信号。

### 2.2 人在回路交互与重新规划

VDSS围绕临床医生确认的调整周期组织。在推理引擎产生候选设置更新并通过初始**安全**一致性检查后,系统暂停,并呈现提议的通气模式和参数更新,同时附上安全评估和当前偏好上下文。这个周期级检查点与床边滴定实践相匹配,并使临床医生的监督成为控制回路的一个显式组成部分\[25 (https://arxiv.org/html/2605.23320#bib.bib9)\]。

对于周期tt,交互通过轮次k=1,...,Ktk=1,\dots,K_{t}进行。第kk轮的提议为at(k)a_{t}^{(k)},临床医生反馈为ot(k)∈{accept,reject}o_{t}^{(k)}\in\{\mathrm{accept},\mathrm{reject}\}。周期在第一个被接受的提议处结束,得到最终接受的配置a~t\tilde{a}_{t}:

Kt=min{k:ot(k)=accept},a~t=at(Kt).K_{t}=\min\{k:\,o_{t}^{(k)}=\mathrm{accept}\},\qquad\tilde{a}_{t}=a_{t}^{(K_{t})}.\(1\)
拒绝被视为结构化的控制信号。当提议被拒绝时,系统记录临床医生的理由和具体有问题的参数,**反思智能体**将该反馈转化为修订约束,同时定位需要重新审视的最小决策层级。然后仅对涉及的阶段进行重新规划,并在可能的情况下重用中间结果,而不是重新运行整个流程。当波形输入可用时,**波形分析器**可能会在修订前重新执行以刷新证据,从而使后续提议仍基于当前床边线索。这种有针对性的回滚机制将更新限制在与反馈相关的层,减少了跨轮次的冗余推理。

一旦接受,**记录生成器**通过生成最终决策的结构化摘要并提取临床医生偏好信号来结束该周期。这些输出被写入长期记忆,以支持轨迹连续性和后续偏好自适应,同时轮内轨迹被保留用于审计和接下来描述的周期结束偏好更新。交互受限于最大轮次预算KmaxK_{\max},以保持一个可控且可审查的过程。

算法1 VDSS中基于上下文赌博机的周期结束偏好更新1:输入:临床医生

dd,上下文

xtx_{t},当前设置,长期记忆

2:

k←1k\leftarrow 1,

accepted←false\mathrm{accepted}\leftarrow\mathrm{false}
3:while

¬accepted\neg\mathrm{accepted}且

k≤Kmaxk\leq K_{\max}do

4:生成提议

at(k)a_{t}^{(k)},应用**安全**检查,呈现给临床医生审查,收集

ot(k)o_{t}^{(k)}
5:if

ot(k)=rejecto_{t}^{(k)}=\mathrm{reject}then

6:**反思智能体**生成修订约束,并选择需要重新审视的最小决策阶段

7:从所选阶段重新规划;

k←k+1k\leftarrow k+1
8:else

9:

a~t←at(k)\tilde{a}_{t}\leftarrow a_{t}^{(k)},

Kt←kK_{t}\leftarrow k,

accepted←true\mathrm{accepted}\leftarrow\mathrm{true}
10:endif

11:endwhile

12:**记录生成器**输出日志摘要

sts_{t}和偏好信号

ptp_{t}
13:更新临床医生偏好状态

θd←BanditUpdate(θd;xt,a~t,ht,pt)\theta_{d}\leftarrow\mathrm{BanditUpdate}(\theta_{d};\,x_{t},\tilde{a}_{t},h_{t},p_{t})
14:将

sts_{t}和

ptp_{t}写入长期记忆

### 2.3 基于上下文赌博机的在线偏好优化

VDSS通过一个在线上下文赌博机适应临床医生特定的调校风格,该赌博机仅在调整周期被临床医生接受并解决后才更新。对于每个临床医生dd,赌博机维护一个偏好状态θd\theta_{d}\[11 (https://arxiv.org/html/2605.23320#bib.bib18)\]。该状态作为偏好上下文提供给推理引擎,并在后续周期中调节候选方案的排名和选择。在周期结束时,**记录生成器**产生两个周期级产物并持久化到长期记忆中:最终的患者日志摘要和临床医生偏好信号。

偏好学习定义在一组固定的十二个长期偏好类别上,这对应于用于临床医生建模的十二个赌博机臂。这些类别涵盖了对调整粒度和调整风格的偏好,以及对临床目标侧重点和床边滴定中常见的实用工作流选择的偏好。具体来说,这些类别包括对模式级更改与保持在当前模式内的偏好,保守的小步更新与快速的调整。

相似文章