评估帧速率在基于序列的自闭症相关自我刺激手部特发性行为分类中的影响

arXiv cs.AI 论文

摘要

本文评估了帧采样率对使用LSTM和GRU模型进行基于序列的自闭症相关自我刺激手部行为分类的影响,在15帧间隔下实现了高达98.75%的准确率,并分析了针对小规模行为视频数据集的数据增强策略。

arXiv:2607.07957v1 公告类型:新 摘要:自闭症谱系障碍(ASD)影响全球超过7500万人,然而可扩展的远程行为筛查计算方法仍然有限。本研究针对从视频中自动检测自闭症相关自我刺激行为的两个互补挑战:(1) 确定最优的基于序列的神经网络架构和时间采样率;(2) 描述针对小规模行为数据集训练的数据增强策略。对于第一个目标,使用长短期记忆网络(LSTM)和门控循环单元(GRU)模型,基于自刺激行为诊断(SSBD)数据集中提取的姿态特征进行训练,帧采样间隔分别为1、5、15、30、45和90帧。两种架构均超越了先前的卷积神经网络(CNN)基线(62-76%准确率),在每15帧采样间隔下达到峰值准确率:LSTM 97.5%,GRU 98.75%。对于第二个目标,将十种数据增强策略应用于I3D迁移学习流水线,并通过消融实验量化每种技术的边际贡献。水平翻转实现了最高的独立准确率(48.78%),而从增强流水线中移除上采样导致最大性能下降,表明其在复杂行为视频增强中的必要性。一种个性化机器学习方法,即对每个视频的时间分割片段训练和测试每个受试者模型,产生了一致的预测(平均损失1.84,标准差0.79)。这些结果为从业者在数据稀缺的临床领域中进行基于视频的行为分类提供了关于架构选择、采样率和增强策略的具体指导。
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:06

# 评估帧率对基于序列的自闭症相关自我刺激手部特征分类的影响

来源: https://arxiv.org/html/2607.07957
Raunak Mondal¹ 及 Peter Washington²  
¹ 卡内基梅隆大学计算机科学学院,宾夕法尼亚州匹兹堡,美国  
² 夏威夷大学马诺阿分校信息与计算机科学系,夏威夷州檀香山,美国

###### 摘要

自闭症谱系障碍(ASD)影响全球超过 7500 万人,但可扩展的远程行为筛查计算方法仍然有限。本研究针对从视频中自动检测自闭症相关自我刺激行为的两项互补挑战:(1) 确定最优的基于序列的神经网络架构和时间采样率,以及 (2) 描述针对小规模行为数据集训练的数据增强策略。对于第一个目标,在自刺激行为诊断(SSBD)数据集上,以 1、5、15、30、45 和 90 帧的采样间隔,训练了长短期记忆(LSTM)和门控循环单元(GRU)模型,特征来自姿态提取。两种架构均超越了先前的卷积神经网络(CNN)基线(62–76% 准确率),其中在每 15 帧采样间隔下,LSTM 达到 97.5% 的峰值准确率,GRU 达到 98.75%。对于第二个目标,将十种数据增强策略应用于 I3D 迁移学习流水线,并通过消融研究量化了每种技术的边际贡献。水平翻转实现了最高的独立准确率(48.78%),而从增强流水线中排除上采样导致性能下降最大,表明对于复杂行为视频的增强,上采样是必要的。一种个性化机器学习方法,即为每个受试者训练模型,并在每个视频的时间分割片段上进行测试,产生了一致的预测(平均损失 1.84,标准差 0.79)。这些结果为在数据稀缺的临床领域中,针对基于视频的行为分类的架构选择、采样率和增强策略提供了具体指导。

## 1 引言

自闭症谱系障碍(ASD)是一种神经发育疾病,其特征是社交沟通差异以及存在受限、重复的行为[2 (https://arxiv.org/html/2607.07957#bib.bib1)]。目前估计全球患病率约为 7500 万人,美国报告的发病率自 2000 年以来增加了 241%[3 (https://arxiv.org/html/2607.07957#bib.bib2)]。尽管患病率很高,但诊断仍然需要大量劳动力:临床医生依赖结构化行为观察工具,如自闭症诊断观察量表(ADOS-2),这需要经过培训的管理者和多次就诊的评估流程[18 (https://arxiv.org/html/2607.07957#bib.bib3)]。这些限制造成了诊断瓶颈,尤其是在专家资源有限的低资源环境中。

从视频中自动识别自我刺激("stimming")行为为实现可扩展的筛查提供了一条途径。诸如拍手、撞头和旋转等行为是 ASD 中常见的运动刻板印象,原则上可以从消费级视频记录中检测出来[21 (https://arxiv.org/html/2607.07957#bib.bib4)]。然而,计算方法面临两个相互关联的挑战。首先,公开可用的标记刺激行为数据集很小。自刺激行为诊断(SSBD)数据集[21 (https://arxiv.org/html/2607.07957#bib.bib4)]是少数专门构建的资源之一,仅包含涵盖三种行为类别的 75 个视频。其次,先前的工作严重依赖卷积神经网络(CNN)模型,这些模型在这些任务上仅能达到 62–76% 的最先进准确率[13 (https://arxiv.org/html/2607.07957#bib.bib5)]。

诸如长短期记忆(LSTM)网络和门控循环单元(GRU)等序列架构非常适合时间模式识别,并在相邻的活动识别领域表现出强大的性能[10 (https://arxiv.org/html/2607.07957#bib.bib6),5 (https://arxiv.org/html/2607.07957#bib.bib7)]。然而,它们在自闭症特定行为分类中的应用仍未充分探索[12 (https://arxiv.org/html/2607.07957#bib.bib8)]。另一个未解决的问题涉及输入特征应采样的时间粒度:在每一帧提取姿态或运动特征可能会引入冗余,而过度激进的下采样又可能丢弃诊断相关的时间动态。

与此同时,行为数据集的小规模激发了在不额外收集数据的情况下提高模型鲁棒性的策略研究。来自大规模活动识别模型(如 Inflated 3D ConvNet (I3D)[4 (https://arxiv.org/html/2607.07957#bib.bib9)])的迁移学习可以提供有用的特征表示,而数据增强技术可以综合扩展有效的训练集。然而,不同增强策略对临床行为视频的相对有效性尚未得到系统描述。

本文在 SSBD 数据集上进行了两组互补实验。第一组实验在六个时间采样率下评估 LSTM 和 GRU 架构,以确定最大化分类准确率的架构和采样配置。第二组实验在 I3D 迁移学习框架内应用了十种数据增强方法,并辅以消融研究和个性化机器学习协议。这些实验共同为开发基于视频的自闭症行为筛查工具的研究人员提供了具体、可操作的指导。

本文的贡献如下:

1. 1. 在六个帧采样间隔下对 LSTM 和 GRU 架构进行系统比较,用于自我刺激行为分类,表明两种架构均优于先前的 CNN 基线,并且 15 帧的采样间隔可获得峰值性能。
2. 2. 对十种用于小规模行为视频数据集上基于 I3D 的迁移学习的数据增强策略进行了描述,包括一项消融研究,将上采样确定为唯一最关键的增强组件。
3. 3. 评估了一种个性化机器学习方法,其中为每个受试者训练模型,并在单个视频的时间分割片段上进行测试。

## 2 相关工作

### 2.1 自闭症行为检测的计算方法

用于自闭症检测的机器学习方法涵盖了多种模态和架构。Shahamiri 和 Thabtah [23 (https://arxiv.org/html/2607.07957#bib.bib10)] 开发了 Autism AI,这是一个结合多种机器学习分类器的筛查系统,相对于单模型方法提高了检测准确率。Abbas 等人 [1 (https://arxiv.org/html/2607.07957#bib.bib11)] 提出了一个多模块框架,整合了视频、问卷和传感器数据,用于幼儿的简化诊断,表明组合数据源可以改善相对于单模态方法的分类效果。Ghosh 等人 [9 (https://arxiv.org/html/2607.07957#bib.bib12)] 综述了人工智能与物联网技术在 ASD 筛查和管理中的交叉应用,指出了可穿戴设备和环境传感器在自然环境中捕捉行为数据的潜力。Wall 等人 [25 (https://arxiv.org/html/2607.07957#bib.bib13)] 应用机器学习缩短了行为诊断过程,表明 ADOS 项目的一个子集可以实现与完整工具相当的诊断准确率。这些研究共同表明人们对计算性自闭症筛查的兴趣日益增长,但大多数依赖于应用于静态帧的手工特征或 CNN 架构,而不是利用行为序列的时间结构。

### 2.2 基于深度学习的活动识别

从视频中自动识别人体活动是计算机视觉中一个研究充分的问题。Mo 等人 [20 (https://arxiv.org/html/2607.07957#bib.bib14)] 通过将 CAD-60 骨骼姿态序列输入 CNN,在 12 类活动分类上实现了 81.8% 的准确率。Li 和 Chuah [17 (https://arxiv.org/html/2607.07957#bib.bib15)] 提出了 ReHAR,一个结合 CNN 和 LSTM 组件的框架,用于从传感器数据进行鲁棒的活动识别。Carreira 和 Zisserman [4 (https://arxiv.org/html/2607.07957#bib.bib9)] 介绍了 Inflated 3D ConvNet (I3D),它将 2D 卷积滤波器扩展到时间维度,并使用在 Kinetics 数据集上预训练的权重,在更小的下游活动识别任务上实现了强大的迁移性能。I3D 架构与本文工作特别相关,因为它提供了一种将学习到的时空表示迁移到数据稀缺领域(如自闭症行为分析)的机制。

### 2.3 基于序列的时间分类模型

循环神经网络,特别是 LSTM [11 (https://arxiv.org/html/2607.07957#bib.bib16)] 和 GRU [5 (https://arxiv.org/html/2607.07957#bib.bib7)] 变体,在语音识别、自然语言处理和时间序列分析等多个领域的序列分类任务中表现出了强大的性能 [10 (https://arxiv.org/html/2607.07957#bib.bib6)]。在活动识别文献中,基于 LSTM 的模型已应用于基于骨架的动作识别 [8 (https://arxiv.org/html/2607.07957#bib.bib17)] 和视频字幕生成 [7 (https://arxiv.org/html/2607.07957#bib.bib18)]。GRU 提供了一种计算上更轻的替代方案,参数更少,通常在以更短的训练时间达到可比的准确率 [6 (https://arxiv.org/html/2607.07957#bib.bib19)]。尽管这些架构适合捕捉行为序列中的时间依赖关系,但在自闭症特定数据集上的系统评估仍然有限。

### 2.4 面向视频模型的数据增强

数据增强是在数据受限环境中提高泛化能力的标准策略。对于视频和活动识别,增强在空间和时间维度上均可操作。空间增强包括水平翻转和垂直翻转、裁剪以及噪声注入;时间增强包括速度扰动、时间弹性变形、重采样和帧重排 [24 (https://arxiv.org/html/2607.07957#bib.bib20)]。Li 等人 [16 (https://arxiv.org/html/2607.07957#bib.bib21)] 提出了密集联合运动图像,用于增强基于骨架的动作识别数据,而 Luo 等人 [19 (https://arxiv.org/html/2607.07957#bib.bib22)] 引入了 ActivityGAN,一种用于合成基于传感器的活动数据的生成对抗方法。Kim 等人 [14 (https://arxiv.org/html/2607.07957#bib.bib23)] 将时间序列增强与深度学习应用于施工设备活动识别,展示了准确率和泛化能力的改进。这些策略的有效性具有领域依赖性,并且它们对临床行为视频分类的影响此前尚未被描述。

### 2.5 SSBD 数据集上的先前工作

自刺激行为诊断(SSBD)数据集由 Rajagopalan 等人 [21 (https://arxiv.org/html/2607.07957#bib.bib4)] 引入,他们使用 STIP 和 HIG/HOF 特征结合支持向量机(SVM)的词袋表示,建立了基线分类结果,在代码本大小为 500、1000 和 1500 的三类任务上报告了平均准确率为 47.1%。在后续工作中 [22 (https://arxiv.org/html/2607.07957#bib.bib24)],同一团队在撞头 vs 旋转的二分类上达到了 86.6% 的准确率,在三分类任务上达到了 76.3% 的准确率。Lakkapragada 等人 [15 (https://arxiv.org/html/2607.07957#bib.bib25)] 将 MobileNetV2 特征提取应用于 SSBD 中的拍手子集,使用五折交叉验证(100 个随机种子,共 500 折)获得了 84 的 F1 分数(精确率 89.6,召回率 80.4)。本研究在这些结果的基础上,在相同数据集上评估了序列架构(LSTM、GRU)以及带有数据增强的迁移学习。

## 3 方法

### 3.1 数据集

所有实验均使用自刺激行为诊断(SSBD)数据集 [21 (https://arxiv.org/html/2607.07957#bib.bib4)],该数据集包含儿童表现出自我刺激行为的视频,分为手臂拍打、撞头和旋转三类。该数据集包含 75 个带注释的视频,每个视频的平均时长约为 90 秒。注释以 XML 格式提供,指定了每个行为实例的时间边界。数据集中的所有视频均来自公开可用的记录,这些记录由家长或看护人同意发布到互联网上 [21 (https://arxiv.org/html/2607.07957#bib.bib4)],无需独立审查委员会批准。

### 3.2 实验 1:基于序列的架构比较

#### 3.2.1 特征提取与采样

对于架构比较实验,使用了包含拍手行为的 50 个视频子集。每个视频包含 90 帧。使用特征提取流水线从每一帧提取基于姿态的几何特征,该流水线计算检测到的身体关键点的空间属性。为了研究时间采样粒度的影响,以六个采样间隔提取特征:每 1、5、15、30、45 和 90 帧。在以 \(k\) 帧为采样间隔时,从帧 \(\{1, 1+k, 1+2k, \ldots\}\) 提取特征,产生长度为 \(\lfloor 90/k \rfloor\) 的输入序列。

#### 3.2.2 模型架构

评估了两种序列模型架构,每种包含三个层:

##### LSTM 模型。

第一个模型包含一个 LSTM 层,后跟一个 dropout 层(比率 = 0.5)和一个具有 softmax 激活的密集输出层。LSTM 层处理输入的特征序列并产生固定长度的隐藏状态表示。LSTM 的遗忘门、输入门和输出门能够选择性地保留跨序列的时间信息。

参照图注图 1:LSTM 模型架构。以 \(k\) 帧间隔提取的输入姿态特征由 LSTM 层处理,然后进行 dropout 正则化和密集分类层。LSTM 单元(右侧)使用三个门——遗忘门、输入门和输出门——来选择性地保留时间信息。
##### GRU 模型。

第二个模型将 LSTM 层替换为 GRU 层,保持相同的 dropout 率和密集输出配置。GRU 使用更新门和重置门来控制信息流,以比 LSTM 更少的参数(两个门对三个门)实现可比的选通机制,从而加快训练速度[6 (https://arxiv.org/html/2607.07957#bib.bib19)]。

参照图注图 2:GRU 模型架构。GRU 单元使用两个门(更新门和重置门)而不是三个,相对于 LSTM 减少了参数数量和训练时间,同时保持了可比的选通能力。两个模型均在 TensorFlow/Keras 中实现,并使用分类交叉熵损失和 Adam 优化器进行训练。二分类任务将拍手行为与非拍手行为区分开来。

#### 3.2.3 评估协议

模型使用 80-20 训练-测试分割进行评估。针对每种架构和采样间隔的组合,记录准确率、精确率、召回率和损失。

相似文章

解码儿童步态行为

Hugging Face Daily Papers

介绍了一个新的问题领域,用于从标准RGB视频中对儿童步态行为进行细粒度分析,同时提供了一个包含超过1,100个高帧率序列的新数据集和一个统一框架,证明了当前的SOTA方法和多模态大语言模型(MLLMs)在此临床任务上表现不佳。

ASD-Bench:用于自闭症谱系障碍的 AI 模型四维综合基准测试

arXiv cs.LG

本文介绍了 ASD-Bench,这是一个全面的基准测试,从预测性能、校准度、可解释性和鲁棒性四个维度评估用于自闭症谱系障碍(ASD)筛查的 AI 模型。该研究使用 AQ-10 数据分析了不同年龄组的多种模型,强调了在临床 AI 应用中采用多指标评估的重要性。