解码儿童步态行为
摘要
介绍了一个新的问题领域,用于从标准RGB视频中对儿童步态行为进行细粒度分析,同时提供了一个包含超过1,100个高帧率序列的新数据集和一个统一框架,证明了当前的SOTA方法和多模态大语言模型(MLLMs)在此临床任务上表现不佳。
查看缓存全文
缓存时间: 2026/08/05 09:44
论文页面 - 解码儿童步态行为
Source: https://huggingface.co/papers/2608.00371
作者:
, , , , , , , , , , , ,
摘要
我们引入了一个新的人类动作识别问题领域:从标准RGB视频中对儿童步态行为进行细粒度分析。我们特别关注3-17岁儿童的行走模式。此类行为在多种关键发育和神经肌肉疾病(如脑性瘫痪和偏瘫)的诊断和治疗中自然出现。尽管其具有临床价值,当前基于3D传感器的步态分析系统昂贵、具侵入性,且通常对年幼受试者不切实际。为解决这一问题,我们引入了一个新数据集,包含来自110名受试者的超过1,100个高帧率(60FPS)视频序列,并伴有同步且匿名化的姿态序列。在每次会话中,儿童执行一项5秒的“走动”任务,从多个视角捕捉步态周期。关键的是,我们证明了当前最先进的方法(包括步态基础模型和多模态大语言模型(MLLMs))无法有效解决这些临床细微差别。我们识别了分析这些不规律且微妙的运动模式所面临的关键技术挑战,并描述了一个统一的端到端框架,用于解码儿童步态的基本组成部分。通过全面的实验结果,我们展示了该数据集在推动新研究问题和建立自动化儿童步态评估严谨基线方面的潜力。
查看 arXiv 页面 (https://arxiv.org/abs/2608.00371)
查看 PDF (https://arxiv.org/pdf/2608.00371)
项目页面 (https://pediamedai.com/ChildrenGait/)
GitHub2 (https://github.com/PediaMedAI/ChildrenGait)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.00371)
在您的代理中获取此论文:
hf papers read 2608\.00371
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2608.00371,即可从本页面链接到该模型。
引用此论文的数据集0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2608.00371,即可从本页面链接到该数据集。
引用此论文的Space0
没有Space链接此论文
在Space的 README.md 中引用 arxiv.org/abs/2608.00371,即可从本页面链接到该Space。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection),即可从本页面链接到它。
相似文章
评估帧速率在基于序列的自闭症相关自我刺激手部特发性行为分类中的影响
本文评估了帧采样率对使用LSTM和GRU模型进行基于序列的自闭症相关自我刺激手部行为分类的影响,在15帧间隔下实现了高达98.75%的准确率,并分析了针对小规模行为视频数据集的数据增强策略。
AnyGroundBench: 视觉语言模型中视频定位的专业领域基准
介绍 AnyGroundBench,这是一个面向时空视频定位的领域自适应基准,评估了五个专业领域的15个视觉语言模型,发现当前模型在零样本和上下文学习适应中均失败。
Gait2Hip-60:基于多节奏步态运动学预测髋部肌肉力和关节力矩的统一深度学习基准
本文介绍了Gait2Hip-60基准数据集和深度学习框架,用于从步态运动学预测髋部肌肉力和关节力矩,并对LSTM、Transformer和Mamba模型进行了比较。Transformer取得了最佳性能,在零样本泛化到病理步态时表现中等。
AdaCodec:面向视频多模态大模型的预测性视觉编码
AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。
DreamTraj:通过读取未渲染视频扩散潜变量生成6DoF物体轨迹
DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。