基于仿真护理教育的自我视角视频的AI辅助能力评估
摘要
本文研究了在仿真过程中使用视觉语言模型从第一视角视频评估护理能力,发现识别准确率与能力水平呈负相关,表明这一信号具有教学意义。
arXiv:2605.20233v1 公告类型:交叉
摘要:评估学习者在临床仿真中的能力需要专家观察,这耗时、难以扩展,且存在评估者间差异。视觉语言模型已成为理解复杂视觉行为的有前景工具。本文通过一个三阶段框架研究视觉观测能否为能力评估提供有教育意义的信号:(1)使用冻结的视觉编码器和少样本学习从自我视角的护理仿真视频中提取行为时间线;(2)推导序列级特征和每会话识别指标;(3)将这些指标与教师评分的能力相关联。在22个密集标注的会话(3.8小时,493个动作)中,使用HMM Viterbi解码的冻结DINOv2骨干网络在留一法单样本识别中达到57.4%的MOF。令人惊讶的是,我们观察到识别准确率与能力之间存在负相关趋势(mIoU的rho = -0.524, p = 0.012),该趋势对六种混杂控制具有鲁棒性:能力更强的学生产生多样化且更难分类的工作流程,而简单序列特征则无此关系。逐项分析发现,患者安全协议和团队沟通是这一模式中反映最明显的预期行为,过程模型比较显示,更高能力的学生表现出更符合协议的动作转换。这些发现表明,在自动化能力评估中,识别准确率可能作为具有教学意义的信号补充预测的动作时间线。
查看缓存全文
缓存时间: 2026/05/22 08:52
# 基于第一人称视频的模拟护理教育中AI辅助能力评估
来源:https://arxiv.org/html/2605.20233
Hanchen David Wang∗Yilin Liu Madison J\. Lee Surya Chand Rayala Gautam Biswas Daniel T\. Levin Meiyi Ma 范德堡大学 \{hanchen\.wang\.1, yilin\.liu\.1, madison\.j\.lee, surya\.chand\.rayala, gautam\.biswas, daniel\.t\.levin, meiyi\.ma\}@vanderbilt\.edu
###### 摘要
评估学习者在临床模拟中的能力需要专家观察,这既耗时、难以规模化,且易受评分者间差异影响。视觉-语言模型已成为理解复杂视觉行为的有前途工具。在本文中,我们研究视觉观察能否通过一个三阶段框架为能力评估提供有教育意义的信号,该框架:(1) 使用冻结的视觉编码器和少样本学习从第一人称护理模拟视频中提取动作时间线,(2) 推导序列级特征和每轮次识别指标,(3) 将这些与教师评分的能力关联。在22个密集标注的轮次(3.8小时,493个动作)中,带有HMM Viterbi解码的冻结DINOv2主干在留一法单样本识别中达到了57.4%的MOF。令人惊讶的是,我们观察到识别准确率与能力之间存在负相关趋势(mIoU的ρ=−0.524,p=0.012),该趋势在控制六个混淆变量后依然稳健:能力更强的学生产生更多样化、更难以分类的工作流程,而简单的序列特征则没有这种关系。逐项目分析发现,患者安全规程和团队沟通是该模式中最能反映的预期行为,过程模型比较揭示出能力更高的学生表现出更多符合规程的动作转换。这些发现表明,识别准确率可能作为自动能力评估中具有教学信息价值的信号,补充预测的动作时间线。
## 1 引言
在教育和劳动力培训中,一个核心目标是确定学习者是否已发展出在实践中有效表现所需的知识、技能和判断力,这种品质被广泛称为*能力*[19 (https://arxiv.org/html/2605.20233#bib.bib19)]。在以熟练身体表现为特征的领域中,能力评估需要专家观察随时间展开的、依赖上下文的行为。未检测到的差距在临床教育中后果尤为严重,因为用药错误仍然是最常见的可预防不良事件之一,且常源于培训中未被发现的操作疏漏[9 (https://arxiv.org/html/2605.20233#bib.bib9)]。基于模拟的学习通过让学生在不危及真实患者的情况下练习临床技能来应对这一问题[13 (https://arxiv.org/html/2605.20233#bib.bib13)],但能力不仅包括正确执行操作,还包括以适当的顺序、完成所有安全检查以及流畅的任务转换[5 (https://arxiv.org/html/2605.20233#bib.bib5)]。教师使用标准化工具(如Creighton能力评估工具C-CEI [27 (https://arxiv.org/html/2605.20233#bib.bib27)])评估每个轮次,该工具将可观察行为映射到能力结构(例如,临床判断、患者安全)[16 (https://arxiv.org/html/2605.20233#bib.bib16)]。该模型面临两个结构性限制:专家观察无法随学习者群体增长而扩展[1 (https://arxiv.org/html/2605.20233#bib.bib1)],并且即使在训练有素的教师中,评分者间信度也仅为中等至显著[11 (https://arxiv.org/html/2605.20233#bib.bib11)]。这些局限性推动了能够持续、规模化分析可观察行为的自动能力评估方法。在护理模拟中,视频提供了学习者表现丰富的记录,捕捉了操作动作及其时间组织。在本工作中,我们研究模拟视频中的视觉证据能在多大程度上支持能力评估。
视频捕捉学习者做什么、如何移动、以及他们与哪些物体交互,所有这些都不需要仪器化的环境。第一人称视频理解的最新进展使得以自我为中心(egocentric)的录制特别引人注目。头戴式摄像头提供了无遮挡、靠近双手的视角,观察学生关注和操作的对象,当与眼动追踪结合时[12 (https://arxiv.org/html/2605.20233#bib.bib12)],可以揭示与熟练活动错误相关的注意模式[28 (https://arxiv.org/html/2605.20233#bib.bib28)]。如图1 (https://arxiv.org/html/2605.20233#S1.F1)所示,这一视角捕捉了临床接触的完整行为,从学生如何拿药瓶到他们使用哪种设备进行剂量计算,精确保留了区分新手和专家工作流程的特征。
参阅图注图 1:五位护理学生模拟视频中查看患者屏幕、计算剂量和准备药物的示例图片。学生A、B、E使用手机计算剂量,而学生C和D使用手持计算器。准备药物时,学生C和E使用深棕色药瓶,而学生A、B、D各使用不同的瓶子且持握方式不同。更多模拟过程细节见附录A (https://arxiv.org/html/2605.20233#A1)。用药管理是一个理想的验证场景,因为能力本质上是顺序性的:正确动作但顺序错误,或遗漏安全步骤,都构成临床错误[13 (https://arxiv.org/html/2605.20233#bib.bib13)]。本研究所用的标注编码手册围绕用药管理工作流程开发,借鉴了已建立的护理能力测量工具[23 (https://arxiv.org/html/2605.20233#bib.bib23)],并捕捉了如剂量计算等细粒度动作。C-CEI评分量表将预期行为映射到整个临床接触中的更广泛能力结构;基于视觉的分析可以直接对应前者,而后者则需要教师判断。然而,将第一人称视频理解应用于此场景引入了领域特定的挑战:临床动作词汇在标准基准中缺失,由于隐私限制群体人数较少,并且预训练于真实人体的模型面临与模拟人体模型的领域差异。虽然外科教育已经证明AI可以从腹腔镜录像中识别手术阶段和分类技能水平[14 (https://arxiv.org/html/2605.20233#bib.bib14)],但该工作假设数据丰富、固定摄像头的环境。护理模拟的不同之处在于:录像是以自我为中心的,群体受IRB约束,而且能力是整体性的,而非绑定于单一技术操作。然而,这些困难可能并非纯粹噪声。外科技能评估的研究发现,自动分类器在高技能从业者上表现更差[25 (https://arxiv.org/html/2605.20233#bib.bib25)],并且动作执行的时间模式比单纯的结果指标更能捕捉技能水平[29 (https://arxiv.org/html/2605.20233#bib.bib29)]。这提出了一个可能性:识别准确率本身携带有教学信号,更低的准确率反映了能力更强学生的多样化工作流程。
这一空白促使了本研究,我们调查通过冻结的视觉编码器和少样本分析的第一人称视频,能否支持护理模拟中的能力评估。要使这种方法在模拟教育中有用,它必须捕捉可观察的学习者表现,反映对教师评分能力有意义的差异,并揭示任务执行在不同学习者之间的差异。因此,我们在本研究中调查以下三个**研究问题**:
1. RQ1. 少样本动作识别能在多大程度上识别自我中心护理模拟视频中的临床动作?
2. RQ2. 自动提取的动作序列和识别难度在多大程度上与教师评分的能力相关,并且C-CEI上的哪些预期行为最能从基于视觉的动作分析中反映出来?
3. RQ3. 哪些时间动作模式区分了表现较高和较低的学生?
**贡献**。为了回答这些问题,我们提出了一个三阶段框架,提取动作时间线,分析其序列结构,并将序列特征和识别准确率与22个密集标注轮次的能力分数相关联。我们的具体贡献如下:
1. **少样本临床动作识别**。我们展示,带有HMM Viterbi解码的冻结DINOv2特征在留一法单样本动作识别中达到57.4%的MOF(护理模拟第一人称视频),在不进行任何微调的条件下,验证了在极低数据量情况下的可行性。
2. **分类困难度与能力的关联**。我们观察到识别准确率与教师评分能力之间存在负相关趋势(mIoU的ρ=−0.524,p=0.012),该趋势在控制六个混淆变量后依然稳健。逐项目分析识别,与患者安全规程和团队沟通相关的预期行为是该模式中最能反映的C-CEI项目。
3. **时间工作流分析**。基于真实动作序列的过程模型比较显示,表现较高的学生表现出更多样化、更符合规程的动作转换,描绘了单模态视频评估的边界。
## 2 相关工作
**临床技能评估的计算机视觉**。深度学习已广泛用于手术工作流识别和技能评估,包括手术视频中的工具检测和阶段识别[17 (https://arxiv.org/html/2605.20233#bib.bib17)]、从视频直接进行技能分类[7 (https://arxiv.org/html/2605.20233#bib.bib7)]、细粒度动作三元组识别,以及技术技能的可扩展客观评估[8 (https://arxiv.org/html/2605.20233#bib.bib8)]。这些研究强调了基于视频的临床评估的前景,但大多数是在数据丰富的手术环境中开发的,使用固定摄像头和相对受控的工作流。相比之下,我们的环境是自我中心和小规模的,目标是评估整体护理能力而非孤立的技术技能。
**教育及学习分析的计算机视觉**。MMLA整合视频、音频、生理信号和交互日志来研究学习过程。在这一范式中,视觉已被用于检测与学习相关的情感状态[2 (https://arxiv.org/html/2605.20233#bib.bib2)],将神经注意力与人类注视对齐[26 (https://arxiv.org/html/2605.20233#bib.bib26)],分析具身课堂学习[6 (https://arxiv.org/html/2605.20233#bib.bib6)],以及建模学生交互序列;最近的一篇综述调查了跨成人培训环境(包括护理模拟)的多模态方法[3 (https://arxiv.org/html/2605.20233#bib.bib3)]。我们专注于单一模态(第一人称视频)以建立视觉单独能揭示关于临床能力的什么。
**少样本和时间动作识别**。原型网络使得使用最少标记示例进行分类成为可能。时间动作分割在不同模态的标准基准上取得了快速进展,大规模第一人称数据集与自监督编码器(如DINOv2 [18 (https://arxiv.org/html/2605.20233#bib.bib18)])提供了强大的冻结表示。我们结合原型匹配与HMM Viterbi解码[20 (https://arxiv.org/html/2605.20233#bib.bib20)],在极低数据的临床条件下进行时间分割。
## 3 问题形式化
第一人称视频V_i → 少样本时间动作建模 → 预测时间线ŷ_i,真实时间线y_i^*;阶段1:动作识别;片段提取 → 动作序列s_i;阶段2:序列分析;模式分析 → 能力评估,教师分数c_i;阶段3:能力分析
图 2:提出的三阶段框架概览。灰色框表示输入,橙色框表示处理模块,绿色框表示输出,蓝色框表示监督或参考信号。实线箭头表示前向推理流程,虚线箭头表示监督或 oracle 指导。三个阶段分别执行动作时间线预测、动作序列构建以及能力评估。
设V = {V_1, ..., V_N}表示N个第一人称视频轮次的集合,其中每个轮次V_i = (f_i^(1), f_i^(2), ..., f_i^(T_i))由T_i个有序帧组成,其中i∈{1,...,N}索引轮次,t∈{1,...,T_i}索引帧。每个视频关联一个教师分配的能力得分向量c_i ∈ ℝ^23,涵盖C-CEI评分量表上的23个预期行为(附录B (https://arxiv.org/html/2605.20233#A2)), 其中11个对应视频可观察的动作;这11个项目的均值用作关联分析的总体能力百分比。并非所有项目在每个轮次都被评分,因此c_i的某些条目缺失。
**阶段1:动作识别**。给定一个临床基础的动作分类体系A = {a_1, ..., a_K, a_∅},包含K=16个临床动作类别和一个背景类别a_∅(共17个标签),目标是为每个帧分配标签y_i^(t)∈A,生成帧级预测ŷ_i = (ŷ_i^(1), ..., ŷ_i^(t))。冻结编码器φ提取每帧特征z_i^(t)=φ(f_i^(t)),这些特征与从支持集S(从保留轮次中采样的标记示例)计算出的类原型进行匹配:
ŷ_i = Decode(sim(φ(V_i), P(S))), (1)
其中P(S)从支持集[24 (https://arxiv.org/html/2605.20233#bib.bib24)](第4.1节 (https://arxiv.org/html/2605.20233#S4.SS1))计算类原型,Decode应用HMM Viterbi解码[20 (https://arxiv.org/html/2605.20233#bib.bib20)]来强制时间上连贯的标签序列。我们使用帧级准确率(MOF)、平均交并比(mIoU)和分段F1分数评估ŷ_i与真实标注y_i^*的对比(RQ1)。
**阶段2:序列分析**。从预测的帧级标签ŷ_i中,我们将连续的相同标签帧折叠成一个有序的动作序列s_i = ((c_i^(1), d_i^(1)), ..., (c_i^(L_i), d_i^(L_i))),包含L_i个片段(l∈{1,...,L_i}),其中c_i^(l)∈A\{a_∅}是动作标签,d_i^(l)是片段持续时间(以帧计)。从这个序列我们推导出两类特征,用于后续步骤。相似文章
ACE-Ego-0: 统一第一人称人类与机器人数据用于VLA预训练
ACE-EGO-0是一个统一的视觉-语言-动作预训练框架,利用第一人称人类视频和机器人轨迹,通过可靠性感知训练目标,在具身AI基准上达到了最先进水平。
HumanScale: 自我中心人类视频在具身预训练中可超越真实机器人数据
本文发现,经过过滤和标注流水线处理的自我中心人类视频,在预训练具身基础模型时可以超越遥操作真实机器人数据,在真实机器人任务上实现了更低的验证损失和更高的成功率。
利用视觉-语言模型检测教育视频中的注意力
本文探讨了使用视觉-语言模型(VLM)通过结合注视数据与视频内容来检测教育视频中的注意力丧失,但发现VLM方法并未超越传统的机器学习基线。
AI并不比婴儿更聪明——尚未
一项新的基准测试EgoBabyVLM挑战AI视觉语言模型,要求它们从婴儿头戴摄像头拍摄的视频中学习,结果显示当前的AI模型无法匹敌婴儿的学习效率,并表明类似婴儿的学习架构可能带来更高效的AI。
看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础
本文研究了视觉-语言模型在非对称对话中能否区分潜在共同基础与已确立共同基础。在MapTask数据上的实验表明,提供任务相关的地图内容(视觉或文本)会使模型倾向于过度预测对齐,因为它们依赖于静态指示范例而非通过对话历史追踪共同基础的确立过程。