GEESE:基因型感知的端到端时空嵌入行为表型分析

arXiv cs.LG 论文

摘要

GEESE 是一个端到端深度学习框架,能够直接从3D姿态动态中学习行为表征,无需手工特征。在三种自闭症相关遗传模型(CNTNAP2、CHD8、FMR1)中,它在行为分类和基因型预测任务上超越了传统基线。该框架还引入了 HONK,一个基于自然语言进行行为表型分析的交互式工具。

arXiv:2605.24370v1 公告类型:新 摘要:遗传动物模型的行为表型分析目前需要耗费大量人工的手工特征工程,这限制了可重复性和可扩展性。我们提出了 GEESE,一个端到端深度学习框架,能够直接从3D姿态动态中学习行为表征,无需手工特征。利用预训练的时间序列基础模型,我们将运动序列编码到一个行为流形中,该流形同时支持行为分类和基因型预测。在三种自闭症相关遗传模型(CNTNAP2、CHD8、FMR1)上的评估表明,我们的深度学习方法在这两项任务上均超越了手工特征基线,揭示了学习到的表征能够捕获基因型特异性的行为特征。该框架能够泛化到不同的遗传背景,并且一个全队列模型仅从运动模式中即可识别遗传背景和基因型。我们还提供了 HONK,一个交互式智能工具,使没有编程专业知识的 researchers 能够通过自然语言交互从姿态数据中进行行为表型分析。
查看原文
查看缓存全文

缓存时间: 2026/05/26 09:05

# GEESE: 基因型感知的端到端时空嵌入用于行为表型分析
来源:https://arxiv.org/html/2605.24370
M.S.1; Yuen Gao博士2; Chunqi Qian博士2; Zijun Cui博士1 1计算机科学与工程系,密歇根州立大学,东兰辛,密歇根州,美国 2放射学系,密歇根州立大学,东兰辛,密歇根州,美国

## 摘要

遗传动物模型的行为表型分析目前依赖于劳动密集型的手工特征工程,这限制了可重复性和可扩展性。我们提出了GEESE,一个端到端的深度学习框架,无需手工特征即可直接从3D姿态动态中学习行为表示。通过使用预训练的时间序列基础模型,我们将运动序列编码到一个行为流形中,该流形同时支持行为分类和基因型预测。在三种自闭症相关遗传模型(CNTNAP2、CHD8、FMR1)上的评估表明,我们的深度学习方法在这两项任务上均超越了基于手工特征的基线,揭示了学习到的表示能够捕捉基因型特异性的行为特征。该框架能够泛化到不同的遗传背景,并且一个全队列模型仅从运动模式中即可识别遗传背景和基因型。我们还提供了HONK,一个交互式智能工具,使没有编程经验的研究人员能够通过自然语言交互从姿态数据中进行行为表型分析。

## 1 引言

行为评估是神经系统和精神疾病诊断和治疗监测的基础,从帕金森病11(https://arxiv.org/html/2605.24370#bib.bib23)和亨廷顿病1(https://arxiv.org/html/2605.24370#bib.bib24)的运动症状,到自闭症谱系障碍(ASD)10(https://arxiv.org/html/2605.24370#bib.bib28)的社交和重复行为。尽管角色核心,临床评估仍然主要依赖主观判断、耗时且依赖于专家的可用性。这些局限性凸显了对行为表型分析的需求,即将原始运动转化为标准化、客观且可扩展的数字特征。超越定性观察,自动化的表型分析将能够直接比较不同遗传模型之间的表型,并加速药物开发管线,而可及的筛查则可以缩短从初次关注到诊断和干预的时间。

尽管行为表型分析的目标在临床环境中很明确,但实现这些目标需要克服技术挑战。在临床前研究中,携带ASD相关遗传变异的啮齿动物模型通常通过行为测定进行评估,如旷场测试、社交互动范式和理毛分析2(https://arxiv.org/html/2605.24370#bib.bib31);13(https://arxiv.org/html/2605.24370#bib.bib32)。现代无标记姿态估计方法使得高分辨率的行为运动学数据日益可及15(https://arxiv.org/html/2605.24370#bib.bib6);17(https://arxiv.org/html/2605.24370#bib.bib12);18(https://arxiv.org/html/2605.24370#bib.bib7);5(https://arxiv.org/html/2605.24370#bib.bib11)。人工智能的最新进展,特别是深度学习和大规模数据预训练的基础模型,为自动化这一转换并降低行为表型分析工具临床应用的障碍提供了机遇。但将原始姿态坐标转化为有意义的行为描述仍然具有挑战性,这主要归因于对手工特征工程的依赖,这种依赖引入了研究者偏差并限制了跨实验室的可重复性。现有的深度学习方法提供了行为可视化和聚类,但不支持基因型预测的下游任务。

在这项工作中,我们提出了GEESE(基因型感知的端到端时空嵌入),一个从3D姿态动态中进行行为表型分析的表示学习流程。我们利用一个时间序列基础模型7(https://arxiv.org/html/2605.24370#bib.bib16),该模型在大规模时间序列数据上进行了预训练,作为编码器主干,随后在行为标签上进行微调以学习行为表示。得到的潜在空间作为一个统一的表示空间,支持多个下游任务,而无需任务特定的特征工程。我们在146个记录会话上评估了GEESE,覆盖三种ASD相关遗传模型(CNTNAP2、CHD8、FMR1),结果表明学习到的表示在行为分类和基因型预测方面均优于手工基线,能够跨队列泛化,并捕捉基因型特异性的行为特征。

为了支持更广泛的应用,我们还提供了HONK(动手自然语言知识库),一个交互式分析工具,使没有编程经验的研究人员能够直接从姿态数据中进行行为表型分析。该框架代表了向自动化行为评估工具迈出的一步,这些工具最终可能支持ASD及其他行为定义疾病的临床筛查和疗法开发。

## 2 相关工作

**用于行为分析的手工特征工程。** 传统行为分析流程依赖手工特征工程来管理运动学数据的高维性。主成分分析(PCA)24(https://arxiv.org/html/2605.24370#bib.bib1)常用于降低坐标维度,而小波变换27(https://arxiv.org/html/2605.24370#bib.bib3);12(https://arxiv.org/html/2605.24370#bib.bib2)近似时间动态。s-DANNCE流程14(https://arxiv.org/html/2605.24370#bib.bib5)结合了3D姿态跟踪与小波特征提取来映射行为结构,但仍然需要手动设计的频谱特征。这些手工流程需要大量的领域专业知识来为每个特定实验背景设计合适的特征,这固有地将研究者偏差引入量化过程。此外,生成的指标可能遗漏未在预定义测量中捕捉到的细微模式。另外,亚秒级行为常常被遗漏8(https://arxiv.org/html/2605.24370#bib.bib8),关键点抖动可能导致虚假的分段转换23(https://arxiv.org/html/2605.24370#bib.bib9)。

**用于行为表示的深度学习方法。** 直接从运动学中学习行为表示提供了一种根本上不同的范式,绕过了人类定义特征的局限性20(https://arxiv.org/html/2605.24370#bib.bib33)。基于学习的方法不通过预定义描述符来总结运动,而是将整个运动序列嵌入到一个连续潜在空间中14(https://arxiv.org/html/2605.24370#bib.bib5)。最近的深度学习方法已应用于这一领域:CEBRA使用对比学习从行为和神经数据中生成一致的潜在嵌入20(https://arxiv.org/html/2605.24370#bib.bib33);Keypoint-MoSeq应用生成模型将连续姿态轨迹解析为离散的行为音节23(https://arxiv.org/html/2605.24370#bib.bib9);社会行为图谱(SBeA)框架使用少样本学习来减少姿态估计和身份识别的标注需求8(https://arxiv.org/html/2605.24370#bib.bib8)。这些方法表明,端到端的表示学习可以在没有手工特征的情况下从运动数据中提取行为结构。然而,这些方法中没有一个支持从学习到的表示中进行基因型预测,因此现有的行为分析流程中缺乏一个端到端的预测框架。

## 3 方法论

GEESE作为一个三步流程运行(图1(https://arxiv.org/html/2605.24370#S3.F1))。首先,连续的3D姿态记录被分割成重叠的时间窗口,每个窗口表示为一个矩阵 \(\mathbf{X}\in\mathbb{R}^{T\times D}\),捕捉所有骨骼关键点的瞬时姿态和短期动态。其次,每个窗口通过一个预训练的时间序列基础模型,该模型将高维姿态序列压缩成一个紧凑的嵌入 \(\mathbf{z}\in\mathbb{R}^{d}\)。这些嵌入形成一个行为流形,其中邻近度反映运动学相似性。然后附加任务特定的分类头用于下游预测。

参考说明图1:系统架构。姿态序列由预训练的时间序列模型处理,产生行为表示。在行为标签上进行训练将这些表示按行为类型组织,从而实现行为分类。相同的表示在针对基因型标签进行简短微调后支持基因型预测。

### 3.1 预备知识:时间序列基础模型

MOMENT6(https://arxiv.org/html/2605.24370#bib.bib14)是一个开源的基础模型,在时间序列堆(Time Series Pile)上进行了预训练,这是一个涵盖医疗、金融和工程领域的大规模数据集。其变压器编码器(\(L=24\)层)通过分块嵌入处理多元时间序列,并支持向分类任务的迁移学习。

### 3.2 模型架构

编码器 \(f_\theta\) 将每个输入窗口映射到一个固定维度的嵌入:

\[
\mathbf{z}=f_\theta(\mathbf{X})\in\mathbb{R}^{d} \qquad (1)
\]

其中 \(d=1024\)。在内部,MOMENT通过一个分块嵌入层处理 \(D=69\) 个输入通道,应用 \(L=24\) 个带有多头自注意力的变压器编码器块,并生成每个令牌的表示,通过均值池化进行聚合:

\[
\mathbf{z}=\frac{1}{N_{\text{patches}}}\sum_{i=1}^{N_{\text{patches}}}\mathbf{h}_i \qquad (2)
\]

其中 \(\mathbf{h}_i\in\mathbb{R}^{d}\) 是第 \(i\) 个分块的最后一个变压器块的输出,\(N_{\text{patches}}\) 是时间分块的数量。

对于下游任务,我们在编码器上附加任务特定的线性分类头。对于行为分类,一个线性头 \(g_{\phi_b}\) 将嵌入映射到类别logits:

\[
\hat{\mathbf{y}}_b = g_{\phi_b}(\mathbf{z}) = \mathbf{W}_b\mathbf{z} + \mathbf{b}_b \qquad (3)
\]

其中 \(\mathbf{W}_b\in\mathbb{R}^{C_b\times d}\),\(\mathbf{b}_b\in\mathbb{R}^{C_b}\),\(C_b=9\) 是行为类别的数量。对于基因型分类,一个独立的线性头 \(g_{\phi_g}\) 映射到基因型logits:

\[
\hat{\mathbf{y}}_g = g_{\phi_g}(\mathbf{z}) = \mathbf{W}_g\mathbf{z} + \mathbf{b}_g \qquad (4)
\]

其中 \(\mathbf{W}_g\in\mathbb{R}^{C_g\times d}\),\(\mathbf{b}_g\in\mathbb{R}^{C_g}\),\(C_g\in\{2,3\}\) 根据队列而定。

### 3.3 训练策略

我们采用两阶段训练策略:首先在专家标注的行为标签上训练编码器,以按行为类型组织流形;然后以降低的学习率对基因型标签进行端到端微调,以获得对基因型相关运动模式的敏感性,同时保留学习到的行为结构。

**阶段1:用于行为分类的有监督训练。** HLAC(高级动作分类)由s-DANNCE的开发人员基于视觉检查手动定义,提供了人工标注的行为标签,包括行进、理毛、站立和其他刻板动作14(https://arxiv.org/html/2605.24370#bib.bib5)。我们通过最小化行为标签上的交叉熵损失来训练模型:

\[
\mathcal{L}_{\text{behav}} = -\frac{1}{N}\sum_{i=1}^{N}\sum_{c=1}^{C_b} y_{b,i}^{(c)} \log\frac{\exp(\hat{y}_{b,i}^{(c)})}{\sum_{j=1}^{C_b}\exp(\hat{y}_{b,i}^{(j)})} \qquad (5)
\]

其中 \(y_{b,i}^{(c)}\) 是样本 \(i\) 和类别 \(c\) 的独热编码真实标签,\(N\) 是训练样本数量。在此阶段,编码器参数 \(\theta\) 被冻结,仅更新分类头参数 \(\phi_b\)。

**阶段2:用于基因型分类的微调。** 然后我们替换分类头并在基因型标签上进行微调。基因型损失为:

\[
\mathcal{L}_{\text{geno}} = -\frac{1}{N}\sum_{i=1}^{N}\sum_{c=1}^{C_g} y_{g,i}^{(c)} \log\frac{\exp(\hat{y}_{g,i}^{(c)})}{\sum_{j=1}^{C_g}\exp(\hat{y}_{g,i}^{(j)})} \qquad (6)
\]

在此阶段,编码器参数 \(\theta\) 和基因型头参数 \(\phi_g\) 都以降低的学习率(\(\eta=10^{-5}\))进行更新,以保留学习到的行为结构,同时获得对基因型相关运动模式的敏感性。训练最多进行10个周期,并采用早停法(耐心5)。

## 4 评估

### 4.1 实验设置

**数据集。** 我们使用了s-DANNCE仓库14(https://arxiv.org/html/2605.24370#bib.bib5)中的3D姿态跟踪数据,该数据包含来自自闭症相关基因的啮齿动物模型的记录。我们分析了三个队列:CNTNAP2(42个会话;WT、HET、HOM)、CHD8(80个会话;WT、HET)和FMR1(24个会话;WT、HET)。所有记录均为单独(单动物)会话。每个会话包含23个骨骼关键点的连续3D坐标,以30帧/秒的速度捕获,并带有专家标注的九个类别行为标签(静止、嗅探、理毛、蜷缩、主动下蹲、站立、探索、行进、快速行进)。行为标注由s-DANNCE的开发人员基于对啮齿动物姿态动态的视觉检查进行定义。对于数据预处理,连续姿态序列被分割成重叠的窗口作为模型输入。每个窗口表示为一个矩阵 \(\mathbf{X}\in\mathbb{R}^{T\times D}\),其中 \(T=32\) 帧(在30帧/秒下大约1秒)是窗口长度,\(D = J \times 3 = 69\) 是通过展平 \(J=23\) 个骨骼关键点的3D坐标得到的输入通道数。窗口以步长 \(S=16\) 提取,实现50%重叠。为防止来自时间相关窗口的数据泄漏,我们采用了基于会话的分割:训练集(64%)、验证集(16%)和测试集(20%),确保来自给定会话的所有窗口仅出现在一个分割中。

**评估指标。** 我们报告行为分类和基因型分类的测试准确率和归一化混淆矩阵。对于无监督分析,我们应用K-Means聚类(\(k=9\))并使用轮廓系数19(https://arxiv.org/html/2605.24370#bib.bib46)评估聚类紧凑性,以及归一化互信息(NMI)21(https://arxiv.org/html/2605.24370#bib.bib47)评估与真实标签的对应关系,以便检查超出监督标签的学习到的表示。

**实现细节。** 两个阶段均使用Adam和混合精度(FP16)训练。阶段1使用学习率在平台期衰减(因子0.5,耐心5);阶段2使用固定学习率 \(10^{-5}\) 并采用早停法(耐心5)。

### 4.2 定量评估

我们在三个层面上评估GEESE:与基线方法在队列内任务上的比较(第4.2.1节(https://arxiv.org/html/2605.24370#S4.SS2.SSS1))、跨队列泛化(包括统一的多队列建模,第4.2.2节(https://arxiv.org/html/2605.24370#S4.SS2.SSS2)),以及统一的多队列表型分析(第4.2.3节(https://arxiv.org/html/2605.24370#S4.SS2.SSS3))。

相似文章