TT4D:一种基于单目视频进行乒乓球4D重建的Pipeline与数据集

Hugging Face Daily Papers 论文

摘要

本文介绍了TT4D,这是一种新颖的Pipeline和大规模数据集,旨在从单目视频中重建乒乓球比赛的4D场景。该方案采用独特的“先升维”策略,在进行时间分割之前,先估计乒乓球的3D轨迹和旋转,从而即使在存在遮挡的情况下也能实现稳健的重建。

我们提出了TT4D,一个大规模、高保真的乒乓球数据集。它提供了从单目广播视频中重建的140多个小时的双打和单打比赛录像,具有多模态注释,如高质量相机标定、精确的3D球位置、球旋转、时间分割以及随时间变化的3D人体网格。这些丰富的数据为虚拟回放、深入的玩家分析和机器人学习提供了新的基础。数据集在规模和精度上的结合是通过一种新颖的重建Pipeline实现的。以前的方法首先根据2D球轨迹将比赛序列划分为单个镜头片段,然后才尝试重建。然而,基于2D的时间分割在遮挡和不同相机视角下会失效,导致无法可靠地重建。我们通过首先通过学习到的升维网络将整个未分割的2D球轨迹提升到3D来反转这一范式。然后,我们可以基于3D轨迹可靠地执行时间分割。学习到的升维网络还可以推断球的旋转,处理不可靠的球检测,并在高遮挡情况下成功重建球的轨迹。这种先升维的设计是必要的,因为我们的Pipeline是唯一能够从通用视角的广播单目视频中重建乒乓球比赛的方法。我们通过两个下游任务证明了数据集的保真度:估计球拍在击球时的姿态和速度,以及训练竞争性回合的生成模型。
查看原文
查看缓存全文

缓存时间: 2026/05/08 07:58

论文页面 - TT4D: A Pipeline and Dataset for Table Tennis 4D Reconstruction From Monocular Videos

来源: https://huggingface.co/papers/2605.01234

摘要

一种从单目广播视频中重建乒乓球比赛的新型重建管线,通过在时间分割之前对未分割的 2D 轨迹应用学习到的提升网络,实现了高保真度的 3D 球体轨迹和旋转估计。

我们提出了 TT4D,一个大规模、高保真的乒乓球数据集 (https://huggingface.co/papers?q=table%20tennis%20dataset)。它提供了从单目广播视频中重建的 140 多个小时的双打和单打比赛数据 (https://huggingface.co/papers?q=monocular%20broadcast%20videos),包含高质量相机校准、精确 3D 球体位置 (https://huggingface.co/papers?q=3D%20ball%20positions)、球体旋转 (https://huggingface.co/papers?q=ball%20spin)、时间分割 (https://huggingface.co/papers?q=time%20segmentation) 以及随时间变化的 3D 人体网格 (https://huggingface.co/papers?q=3D%20human%20meshes) 等多模态标注。这些丰富数据为虚拟回放、深入球员分析和机器人学习提供了新的基础。该数据集在规模与精度上的结合是通过一种新型重建管线 (https://huggingface.co/papers?q=reconstruction%20pipeline) 实现的。以往的方法首先基于 2D 球体轨迹将比赛序列划分为单独的击球片段,然后再进行重建。然而,基于 2D 的时间分割 (https://huggingface.co/papers?q=time%20segmentation) 在遮挡和多变相机视角下会失效,导致无法可靠重建。我们通过先通过学习到的提升网络 (https://huggingface.co/papers?q=learned%20lifting%20network) 将整个未分割的 2D 球体轨迹 (https://huggingface.co/papers?q=unsegmented%202D%20ball%20track) 提升到 3D 空间,从而逆转了这一范式。该 3D 轨迹随后使我们能够可靠地进行时间分割 (https://huggingface.co/papers?q=time%20segmentation)。学习到的提升网络 (https://huggingface.co/papers?q=learned%20lifting%20network) 还能推断球体旋转、处理不可靠的球体检测,并在高遮挡情况下成功重建球体轨迹。这种“先提升”的设计是必要的,因为我们的管线是唯一能从通用视角的单目广播视频中重建乒乓球比赛的方法。我们通过两个下游任务证明了数据集的保真度:估算拍面在击球瞬间的姿态与速度,以及训练竞争回合的生成模型。

查看 arXiv 页面 (https://arxiv.org/abs/2605.01234) 查看 PDF (https://arxiv.org/pdf/2605.01234) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.01234)

在您的 agent 中获取此论文:

hf papers read 2605\.01234

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.01234 即可从此页面链接。

引用此论文的数据集 0

无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.01234 即可从此页面链接。

引用此论文的 Spaces 0

无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.01234 即可从此页面链接。

包含此论文的收藏集 0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

Lift4D:协调单视角3D估计用于野外4D重建

Hacker News Top

Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。

D4RT:教会 AI 以四维视角观察世界

Google DeepMind Blog

DeepMind 推出 D4RT,一个统一的 AI 模型,用于动态 4D 场景重建与追踪,效率较此前方法提升高达 300 倍。该模型采用基于查询的 Transformer 架构,为机器人技术与 AR 应用解决复杂的空间和时序任务。

TrackCraft3R: 改造视频扩散变换器用于密集3D追踪

Hugging Face Daily Papers

TrackCraft3R 改造视频扩散变换器,用于从单目视频进行密集3D追踪。它采用双潜在表示和时间RoPE对齐,以比先前方法快1.3倍的速度和少4.6倍的峰值内存,实现了最先进的性能。