Humanoid-GPT:扩展数据和结构以实现零样本运动追踪

Hugging Face Daily Papers 论文

摘要

Humanoid-GPT 是一种GPT风格的Transformer,在十亿级运动语料库上预训练,实现了对未见过的动作和任务的全身运动追踪的零样本泛化。

我们介绍了Humanoid-GPT,这是一种具有因果注意力机制的GPT风格Transformer,在十亿级运动语料库上预训练,用于全身控制。与之前受限于稀缺数据和敏捷-泛化权衡的浅层MLP追踪器不同,Humanoid-GPT在一个包含所有主要动作捕捉数据集和大规模内部录制的20亿帧重定向语料库上进行了预训练。通过扩展数据和模型容量,我们得到了一个单一的生成式Transformer,它能够追踪高度动态的行为,同时在未见过的动作和控制任务上实现了前所未有的零样本泛化。大量的实验和规模分析表明,我们的模型建立了新的性能前沿,在同时追踪高度动态和复杂动作时,展现了强大的零样本泛化能力。
查看原文
查看缓存全文

缓存时间: 2026/06/03 03:35

论文页面 - Humanoid-GPT:扩展数据与结构实现零样本运动追踪

来源:https://huggingface.co/papers/2606.03985
发布于 6月2日

#3 今日论文(https://huggingface.co/papers/date/2026-06-03)
作者:

,

,

,

,

,

,

,

,

,

,

,

摘要

Humanoid-GPT 是一种采用因果注意力机制的 GPT 风格 Transformer,在亿级运动语料上训练,通过多样化运动数据的可扩展预训练,实现了对未见运动和控制任务的零样本泛化。

我们提出 Humanoid-GPT,这是一种基于 GPT 风格的 Transformer(https://huggingface.co/papers?q=Transformer),采用因果注意力机制(https://huggingface.co/papers?q=causal%20attention),在十亿帧级别的运动语料(https://huggingface.co/papers?q=motion%20corpus)上训练,用于全身控制。与以往受限于数据稀缺和敏捷性-泛化权衡的浅层 MLP 追踪器不同,Humanoid-GPT 在包含 20 亿帧的重定向语料(https://huggingface.co/papers?q=retargeted%20corpus)上预训练,该语料统一了所有主要动捕数据集(https://huggingface.co/papers?q=mocap%20datasets)和大规模内部录制数据。通过扩展数据和模型容量,我们得到了一个单一的生成式 Transformer(https://huggingface.co/papers?q=generative%20Transformer),它能够追踪高度动态的行为(https://huggingface.co/papers?q=dynamic%20behaviors),同时实现前所未有的零样本泛化(https://huggingface.co/papers?q=zero-shot%20generalization)到未见运动和控制任务。广泛的实验和扩展分析表明,我们的模型建立了新的性能前沿,展现了在追踪高度动态和复杂运动的同时,对未见任务的鲁棒零样本泛化(https://huggingface.co/papers?q=zero-shot%20generalization)能力。

查看 arXiv 页面(https://arxiv.org/abs/2606.03985)查看 PDF(https://arxiv.org/pdf/2606.03985)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.03985)

在你的代理中获取本文:

hf papers read 2606\.03985

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

没有模型链接到本文

在模型 README.md 中引用 arxiv.org/abs/2606.03985 即可从此页面链接。

引用本文的数据集 0

没有数据集链接到本文

在数据集 README.md 中引用 arxiv.org/abs/2606.03985 即可从此页面链接。

引用本文的 Space 0

没有 Space 链接到本文

在 Space README.md 中引用 arxiv.org/abs/2606.03985 即可从此页面链接。

包含本文的收藏集 0

没有收藏集包含本文

将本文添加到一个收藏集(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

HumanTracker:迈向全面且与人类对齐的运动追踪基准

Hugging Face Daily Papers

HumanTracker 引入了一个大规模基准和一个称为 HumanScore 的偏好对齐指标,用于评估类人机器人运动追踪,重点关注感知质量和物理接触稳定性,以更好地预测人类偏好并识别传统运动学指标遗漏的失败情况。

Image GPT

OpenAI Blog

OpenAI的Image GPT(iGPT)将GPT-2 Transformer应用于像素序列,用于图像生成和分类。它展示了用于语言处理的相同架构能够以无监督的方式学习连贯的视觉特征,并在图像分类基准测试中实现具有竞争力的性能。

HumanNet:将以人为本的视频学习扩展至百万小时规模

Hugging Face Daily Papers

HumanNet 是一个包含百万小时标注视频的大规模以人为本的视频数据集,旨在训练视觉-语言-动作模型。它证明了以第一人称视角拍摄的人类视频可以有效地替代机器人数据,用于具身智能任务。