解码儿童步态行为

Hugging Face Daily Papers 论文

摘要

介绍了一个新的问题领域,用于从标准RGB视频中对儿童步态行为进行细粒度分析,同时提供了一个包含超过1,100个高帧率序列的新数据集和一个统一框架,证明了当前的SOTA方法和多模态大语言模型(MLLMs)在此临床任务上表现不佳。

我们引入了一个新的人类动作识别问题领域:从标准RGB视频中对儿童步态行为进行细粒度分析。我们特别关注3-17岁儿童的行走模式。这些行为在多种关键发育和神经肌肉疾病(如脑瘫和偏瘫)的诊断和治疗中自然出现。尽管具有临床价值,但目前基于3D传感器的步态分析系统成本高昂、具有侵入性,且对于年幼受试者往往不切实际。为此,我们构建了一个新数据集,包含来自110名受试者的超过1,100个高帧率(60 FPS)视频序列,并配有同步且匿名化的姿态序列。在每次会话中,儿童执行一项5秒的“走动”任务,从多个视角捕捉步态周期。关键在于,我们证明了当前最先进的方法(包括步态基础模型和多模态大语言模型(MLLMs))无法有效解析这些临床细微差别。我们识别了分析这些不规律且细微的运动模式所面临的关键技术挑战,并描述了一个用于解码儿科步态基本组成部分的统一端到端框架。通过全面的实验结果,我们展示了该数据集在推动新研究问题方面的潜力,并为自动化儿童步态评估建立了严格的基线。
查看原文
查看缓存全文

缓存时间: 2026/08/05 09:44

论文页面 - 解码儿童步态行为

Source: https://huggingface.co/papers/2608.00371

作者:

, , , , , , , , , , , ,

摘要

我们引入了一个新的人类动作识别问题领域:从标准RGB视频中对儿童步态行为进行细粒度分析。我们特别关注3-17岁儿童的行走模式。此类行为在多种关键发育和神经肌肉疾病(如脑性瘫痪和偏瘫)的诊断和治疗中自然出现。尽管其具有临床价值,当前基于3D传感器的步态分析系统昂贵、具侵入性,且通常对年幼受试者不切实际。为解决这一问题,我们引入了一个新数据集,包含来自110名受试者的超过1,100个高帧率(60FPS)视频序列,并伴有同步且匿名化的姿态序列。在每次会话中,儿童执行一项5秒的“走动”任务,从多个视角捕捉步态周期。关键的是,我们证明了当前最先进的方法(包括步态基础模型和多模态大语言模型(MLLMs))无法有效解决这些临床细微差别。我们识别了分析这些不规律且微妙的运动模式所面临的关键技术挑战,并描述了一个统一的端到端框架,用于解码儿童步态的基本组成部分。通过全面的实验结果,我们展示了该数据集在推动新研究问题和建立自动化儿童步态评估严谨基线方面的潜力。

查看 arXiv 页面 (https://arxiv.org/abs/2608.00371)
查看 PDF (https://arxiv.org/pdf/2608.00371)
项目页面 (https://pediamedai.com/ChildrenGait/)
GitHub2 (https://github.com/PediaMedAI/ChildrenGait)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.00371)

在您的代理中获取此论文:

hf papers read 2608\.00371

没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.00371,即可从本页面链接到该模型。

引用此论文的数据集0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.00371,即可从本页面链接到该数据集。

引用此论文的Space0

没有Space链接此论文

在Space的 README.md 中引用 arxiv.org/abs/2608.00371,即可从本页面链接到该Space。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页面链接到它。

相似文章

AdaCodec:面向视频多模态大模型的预测性视觉编码

Hugging Face Daily Papers

AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。

DreamTraj:通过读取未渲染视频扩散潜变量生成6DoF物体轨迹

Hugging Face Daily Papers

DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。