通过不确定性感知的多专家融合增强卒中康复中的临床决策

arXiv cs.LG 论文

摘要

本文介绍了xAARA,一种不确定性感知的多专家融合引擎,通过提供校准的不确定性和可解释的说明来增强卒中康复的临床评估,在动作质量评估中实现了高精度并降低了预测不确定性。

arXiv:2606.24960v1 公告类型: 新 摘要: 定制卒中康复需要评估动作的组织方式,而不仅仅是动作是否成功。目前,这种评估是一个限制速度的瓶颈。像行动研究手臂测试(ARAT)这样的工具将丰富的行为观察压缩为单个序数终点,丢弃了区分康复与代偿的动作质量细节。自动化替代方案通常追逐有噪声的单一观察者标签的准确性,输出不透明的分数——这是一种以技术为中心的方法,很少应用于临床实践。为解决这一问题,我们提出了xAARA:一种旨在增强而非取代临床判断的引擎。通过多视角视频,xAARA返回带有校准不确定性和跨任务、动作阶段和动作质量层面解释的ARAT评估。将临床评分视为一个不适定的推理问题,xAARA通过基于熵的门控的动态贝叶斯网络组合了692个校准的多模态模型。它根据临床有效性规则对结果进行限定,并对低置信度案例进行延迟判断。在105名卒中幸存者(788次练习)中,xAARA实现了94.2%的任务准确率(Cohen's kappa=0.934)和81.3%的动作阶段准确率(kappa=0.727),与单一临床医生评分相比,预测不确定性降低了96.1%。对于主观案例,它100%与至少一个评分者一致,且从未返回超出范围的分数。四位独立临床医生验证了这些评估,并表示愿意采用该系统。我们认为,原则性的不确定性量化和与临床医生对齐的可解释性是将自动化评估从技术演示转变为可部署临床工具的关键桥梁。
查看原文
查看缓存全文

缓存时间: 2026/06/25 05:08

# 通过不确定性感知的多专家融合增强中风康复中的临床决策
来源: https://arxiv.org/html/2606.24960

[1]\fnmTamim\surAhmed

[1]\orgdivBioemdical Engineering,\orgnameUniversity of Soutehrn California,\orgaddress,\cityLos Angeles,\postcode90007,\stateCA,\countryUSA

###### 摘要

大多数中风幸存者存在持久的上肢功能障碍,而康复方案的定制不仅取决于评估动作是否成功,更取决于动作是如何组织的。在实践中,这一评估是限速步骤:动作研究手臂测试(ARAT)等工具由单一临床医生按照标准评估流程执行,将丰富的行为观察压缩为一个有序终点指标,丢弃了区分真正恢复与代偿的动作质量细节。自动化的替代方案大多追求在这些嘈杂的单观察者标签上的准确性,并报告一个不透明的点得分——这种以技术为中心的模式很少真正进入临床。我们选择了不同的路径。我们提出了 xAARA,这是一个增强而非取代临床判断的引擎,它从多视角视频返回 ARAT 评估结果,并附带校准的不确定性以及在任务、动作阶段和动作质量层面的解释。将评分视为在观测不确定性下的不适定推理问题,xAARA 通过一个基于熵的门控动态贝叶斯网络组合了 692 个校准的多模态模型,根据临床有效性规则对每个结果进行验证,并将低置信度案例推迟处理。在 88 名中风幸存者(788 个练习)中,它达到了 94.2% 的任务准确率(Cohen's κ=0.934)和 81.3% 的动作阶段准确率(κ=0.727),相较于传统的单临床医生评分,预测不确定性降低了 96.1%;在专家评分具有主观性的情况下,它在 100% 的任务上至少与一名评分者一致,并且从未返回范围外的分数。四位未参与开发的临床医生验证了这些评估结果,并愿意采用该系统。我们认为,原则性的不确定性量化和与临床医生对齐的解释,是推动自动动作评估从演示走向可部署临床工具的关键。

## 引言

中风是导致长期残疾的主要原因,大多数幸存者存在上肢功能障碍,限制了日常功能[langhorne2011stroke]。恢复在最初几周最为显著,但会持续数月,且个体间差异很大,因此康复必须个体化,并根据患者的变化不断调整[borschmann2020recovery,li2023stroke]。做到这一点的关键在于评估:临床医生必须反复判断动作是否能够完成以及如何完成,并利用这一判断来设定目标并调整治疗剂量[lang13]。在大部分中风护理中,正是这一评估环节,而非治疗的实施,成为了限速步骤。

最关键且最难捕捉的判断正是我们工作要解决的核心问题。上肢恢复的一个核心区别在于真正的神经功能恢复与代偿——通过改变姿势和运动模式而非恢复控制来完成任务——两者预后不同,需要不同的治疗[levin2009motor,krakauer2006motor]。然而,常规使用的工具,如 ARAT[mcdonnell2008action,yozbatiran2008standardized] 和 Fugl-Meyer 评估[gladstone2002fugl],评分只关注任务是否完成以及完成得如何,而对动作如何组织基本视而不见;它们同样认可代偿性成功与神经典型性成功,并且对区分恢复与代偿以及标志有意义进展的动作质量变化不敏感[levin2009motor,van2001responsiveness]。因此,在个体化护理中量化动作质量对于测量敏感结局至关重要。但可靠且大规模地做到这一点仍然困难[nordin2014assessment,cirstea]。

这些限制因评分方式而加剧。单个临床医生按照标准评估流程分配一个有序分数(例如 ARAT 中的 0 到 3)。这将专家丰富的行为观察压缩为一个数字,该数字对变化的响应性有限且评分者间可靠性差[van2001responsiveness,lannin2004reliability]——以至于专门引入了标准化实施流程来抑制评分者之间的变异性[yozbatiran2008standardized]。这种主观性并非简单可平均的噪声:在临界动作上,它反映了哪个分数正确这一真正的模糊性。因此,将一个评分者的标签视为唯一真实值,丢弃了第二位专家会不同权衡的信息[dawidskene1979,uma2021disagreement]。自动化迄今为止回避了这个问题。为复现 ARAT 式分数而构建的传感器和视频系统[dutta2021poststroke,ahmed2025automatedaratscoringusing] 基于单一共识或多数标签进行训练,并针对单一真实值进行评估。这类流程无法解决模糊性;它们是更广泛模式的一个实例:拟合模型到单观察者标签并报告准确率,这产生了强大的基准却几乎没有临床影响[sokol2025translational]。它既未处理不确定性的显式量化[zhou2025uncertainty],也未处理值得信赖的评估所需的专家主观性显式处理。

此外,困难本质上是内在的。人类运动是高维且冗余的,因此同一有序分数可能源于多种不同的运动组织。从视频中恢复临床判断是一个不适定的逆问题,加之遮挡、视角和动作表现的真实模糊性[TODO:neuromechanics]。由于这种专家主观性是合理的而非错误,拟合到单一分数的模型是在追求一个嘈杂且有损的目标。我们的回应是改变目标:不是匹配或击败临床医生,而是增强临床医生——消除测量瓶颈,同时保持临床医生作为权威核心,并将不确定案例送回审查[sokol2025translational]。这需要一种与临床推理对齐的表示、校准的不确定性以及匹配决策层面的解释。我们基于一个领域无关的计算转换器,该转换器将证据组织在嵌套的环境-活动-目标-意义(EAGM)表示中,并耦合到一个双向动态贝叶斯网络[ahmed2025methodology]。该转换器在一个与执业物理治疗师共同设计的多视角捕捉与标注系统[TODO:xAARA]的核心工作。该系统通过将隐性的临床判断转化为结构化的多层次标注并共同设计干预,将一个本质上不可学习的目标转化为可学习的目标。

在此基础之上,我们构建了 xAARA,这是一个评估引擎,它从多视角视频对每个 ARAT 练习进行评估,并返回一个任务分数、每个动作阶段的分数、所涉及的动作质量要素以及一个校准的不确定性,该不确定性决定一个案例是被报告还是被推迟。其设计直接映射到上述康复问题。通过将表现分解为动作阶段和质量要素,它揭示了临床医生用于区分代偿与恢复的动作质量信息,而非将其压缩为一个数字[levin2009motor,nordin2014assessment]。通过组合多个校准模型并将预测不确定性降低两个数量级,它将一个主观的、依赖评分者的分数转化为量化的分数。并且通过在每项任务数分钟内提供经临床医生验证的一致性结果,它解决了限制个体化治疗和敏感试验的评估瓶颈。在 105 名中风幸存者的队列中,我们展示了共同设计的标注在保留真实评分者间主观性的同时降低了标注不确定性。系统的概率组合产生了准确、低不确定性、可解释的评估;也就是说,在两位专家对一个动作评分不同的情况下,模型族通过返回一个在专家认可答案集合内的分数而非离群值来降低这种主观性。该引擎被未参与其开发的临床医生判定为可采纳。

## 结果

### 一个能够评分、量化不确定性并提供解释的引擎

xAARA 通过一个五阶段流程(图 1 (https://arxiv.org/html/2606.24960#Sx2.F1))从同步的多视角视频评估每个 ARAT 练习。检测器定位身体、手和物体关键点,并将练习分割为动作阶段;增强器清理并插补所得信号;特征提取器生成骨架(CTR-GCN)、外观(VideoMAE)和手工运动学(HBM)表示;预测器通过十个模型族将这些特征映射到分数,其中最强大的是我们引入的段注意力融合变换器(SAFT;方法,图 3 (https://arxiv.org/html/2606.24960#Sx2.F3));一个由 DBN 控制的专家乘积融合通过校准的不确定性组合预测。对于每个练习,引擎返回一个涵盖所有四个 EAGM 层的评估——一个行为-上下文标签、一个任务分数、四个动作阶段(初始定位 [IP]、抓取 [T]、操作-运输 [MTR] 和放置-释放 [PR])的分数以及所涉及的动作质量要素——每个都附有置信度和熵,以支持临床医生分流。整个引擎由 692 个组件模型(198 个任务级、62 个阶段级和 432 个动作质量级)组成,跨越十个模型族。

见图注图 1:xAARA 评估引擎。同步的多视角视频(同侧、对侧-变焦、俯视)流经检测器、增强器、特征提取器和预测器;一个带有 EAGM 嵌套熵验证的 DBN 控制专家乘积融合组合预测,并输出带有校准后验概率的任务、动作阶段和动作质量结果,供临床医生分流。
### 通过干预降低临床医生标注的熵

由于模型不可能优于其所拟合的标签,我们首先刻画了临床医生标签本身的不确定性。使用一个跨越任务、阶段和动作质量层次的分层贝叶斯标签模型,我们追踪了随着标注的丰富,标注熵如何下降(表 1 (https://arxiv.org/html/2606.24960#Sx2.T1))。一名治疗师按照标准方案进行评分,其平均任务熵为 0.459 纳特——是四点量表最大熵的三分之一。两名临床医生进行录制的多视角审查将熵降至 0.147 纳特;加入明确的动作阶段结构使其降至 0.036 纳特;完整的分层模型达到了 0.004 纳特。一旦临床医生实际使用的证据变得可表达,任务分数实际上就变得明确无误了。

表 1:各标注阶段的任务级标注熵 H(T)(纳特;最后一列以 log4 ≈ 1.386 归一化)。

这种降低并非对专家主观性的压制,这一区别在临床上和统计上都至关重要。分解残余不确定性显示,任务级的熵接近零(0.004 纳特),但阶段级(0.093 纳特)和动作质量级(0.292 纳特,约为二元最大熵的 42%)的熵相当可观:评分者同意某个练习是 2 分,但对其由哪些质量缺陷造成仍不确定。评分者间一致性在任务级(κ=0.748)和阶段级(κ=0.699)为显著,在动作质量综合得分上则从显著到一般不等(κ=0.273–0.666);评分者最一致的综合得分也是模型后来检测得最好的综合得分,将困难定位在动作质量要素本身,而非标注或模型。其直接后果是:保持流程不变,仅更改标签,使用共同设计的标注而非标准单临床医生标签进行训练,准确率提高了 8.8 个百分点(87.4% 对比 78.6%),可靠性提升更为显著(κ=0.847 对比 0.615)。同一个模型的大部分性能提升来自更好的目标,而非更好的架构——并且在阶段级的监督额外提升了任务预测(87.4% 对比 84.1%),这是人类标签中熵降低的计算回响。
### 组合校准模型产生准确、低不确定性、可解释的评估

随着标签的解决,引擎的准确性来自于组合而非任何单个估计器。跨模态融合在每个层次上都优于任何单一模态,并且重要的证据与临床推理一致:在任务级,骨架和外观的同侧融合达到了 87.4%(κ=0.847),高于任一模态单独(77.5%,78.6%)和手工运动学基线(81.6%);在阶段级,精细空间细节占主导,基于外观的融合领先(78.8%,κ=0.719);我们的 SAFT 模型保留了而非合并临床医生关注的每个阶段结构,在任何条件下都是最强的(方法)。通过完整的熵门控融合,在 88 名患者和 788 个练习上,引擎达到了 94.2% 的任务准确率(κ=0.934,极佳)和 81.3% 的阶段准确率(κ=0.727,显著;表 2 (https://arxiv.org/html/2606.24960#Sx2.T2)),残余误差集中在有序分数 2–3 的边界,此时接近正常的运动在临床上最难与正常区分。

表 2:xAARA 相对于临床医生共识的表现。

组合不仅仅提高了准确率;它还使引擎的置信度值得信赖,因此系统可靠地知道自己何时知道。归一化预测不确定性从单一模型在标准单临床医生分数上训练的 0.599 降至多视角共识融合后的 0.148(降低 75.3%),并在完整组合下降至 0.023(降低 96.1%;表 3 (https://arxiv.org/html/2606.24960#Sx2.T3))。一个逐阶段分解将两个最大的降幅置于多视角(环境)和跨层动作阶段(目标)阶段——这与临床医生标签中看到的顺序相同,表明 EAGM 层捕捉了不确定性真实的分层组织,而非模型的人为产物。

表 3:不同评分范式下的归一化预测不确定性(H_norm ∈ [0,1];88 名患者,3 折交叉验证)。

对临床使用至关重要的一点是,引擎的证据是可检查且有意义的(图 2 (https://arxiv.org/html/2606.24960#Sx2.F2))。在操作-运输阶段,每个关节的平均速度随 ARAT 分数单调增加,并且在两个视角下远端关节——手腕和手部——速度最大(图 2a),再现了上肢恢复的从近端到远端的组织,而这是模型从特征中提取的,并未被告知。类别平均空间热图显示,从分数 1 到分数 3,运动变得更大且更集中(图 2b),而单个样本热图则揭示了类内显著的可变性(

相似文章

通过交互感知的Mixture-of-Experts理解结构化健康数据

arXiv cs.LG

本文研究了利用结构化健康记录的多层次视图,通过交互感知的Mixture-of-Experts进行中风后僵硬预测。尽管性能提升微乎其微,但路由归因揭示了不同视图间系统性的重要性差异,强调视图构建是实现可解释性的关键。

不确定性下的人机互补稳健性

arXiv cs.LG

本文研究了对AI预测质量的不确定性如何影响人类决策者从互补信息中获益的能力,发现人类与AI预测之间的负误差相关能够实现稳健的改进策略。