Humanoid-GPT:扩展数据和结构以实现零样本运动追踪
摘要
Humanoid-GPT 是一种GPT风格的Transformer,在十亿级运动语料库上预训练,实现了对未见过的动作和任务的全身运动追踪的零样本泛化。
查看缓存全文
缓存时间: 2026/06/03 03:35
论文页面 - Humanoid-GPT:扩展数据与结构实现零样本运动追踪
来源:https://huggingface.co/papers/2606.03985
发布于 6月2日
#3 今日论文(https://huggingface.co/papers/date/2026-06-03)
作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
Humanoid-GPT 是一种采用因果注意力机制的 GPT 风格 Transformer,在亿级运动语料上训练,通过多样化运动数据的可扩展预训练,实现了对未见运动和控制任务的零样本泛化。
我们提出 Humanoid-GPT,这是一种基于 GPT 风格的 Transformer(https://huggingface.co/papers?q=Transformer),采用因果注意力机制(https://huggingface.co/papers?q=causal%20attention),在十亿帧级别的运动语料(https://huggingface.co/papers?q=motion%20corpus)上训练,用于全身控制。与以往受限于数据稀缺和敏捷性-泛化权衡的浅层 MLP 追踪器不同,Humanoid-GPT 在包含 20 亿帧的重定向语料(https://huggingface.co/papers?q=retargeted%20corpus)上预训练,该语料统一了所有主要动捕数据集(https://huggingface.co/papers?q=mocap%20datasets)和大规模内部录制数据。通过扩展数据和模型容量,我们得到了一个单一的生成式 Transformer(https://huggingface.co/papers?q=generative%20Transformer),它能够追踪高度动态的行为(https://huggingface.co/papers?q=dynamic%20behaviors),同时实现前所未有的零样本泛化(https://huggingface.co/papers?q=zero-shot%20generalization)到未见运动和控制任务。广泛的实验和扩展分析表明,我们的模型建立了新的性能前沿,展现了在追踪高度动态和复杂运动的同时,对未见任务的鲁棒零样本泛化(https://huggingface.co/papers?q=zero-shot%20generalization)能力。
查看 arXiv 页面(https://arxiv.org/abs/2606.03985)查看 PDF(https://arxiv.org/pdf/2606.03985)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.03985)
在你的代理中获取本文:
hf papers read 2606\.03985
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
没有模型链接到本文
在模型 README.md 中引用 arxiv.org/abs/2606.03985 即可从此页面链接。
引用本文的数据集 0
没有数据集链接到本文
在数据集 README.md 中引用 arxiv.org/abs/2606.03985 即可从此页面链接。
引用本文的 Space 0
没有 Space 链接到本文
在 Space README.md 中引用 arxiv.org/abs/2606.03985 即可从此页面链接。
包含本文的收藏集 0
没有收藏集包含本文
将本文添加到一个收藏集(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
HumanTracker:迈向全面且与人类对齐的运动追踪基准
HumanTracker 引入了一个大规模基准和一个称为 HumanScore 的偏好对齐指标,用于评估类人机器人运动追踪,重点关注感知质量和物理接触稳定性,以更好地预测人类偏好并识别传统运动学指标遗漏的失败情况。
@HuggingPapers:将视频预训练扩展到12万小时 ZimaBlue将视频缩放视为实现可泛化世界行动模型的途径……
将视频预训练扩展到12万小时,可将世界行动模型在真实机器人上的零样本成功率从36.1%提升至77.8%,实现更快的动作预测。
Gait2Hip-60:基于多节奏步态运动学预测髋部肌肉力和关节力矩的统一深度学习基准
本文介绍了Gait2Hip-60基准数据集和深度学习框架,用于从步态运动学预测髋部肌肉力和关节力矩,并对LSTM、Transformer和Mamba模型进行了比较。Transformer取得了最佳性能,在零样本泛化到病理步态时表现中等。
Image GPT
OpenAI的Image GPT(iGPT)将GPT-2 Transformer应用于像素序列,用于图像生成和分类。它展示了用于语言处理的相同架构能够以无监督的方式学习连贯的视觉特征,并在图像分类基准测试中实现具有竞争力的性能。
HumanNet:将以人为本的视频学习扩展至百万小时规模
HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。