TT4D:一种基于单目视频进行乒乓球4D重建的Pipeline与数据集
摘要
本文介绍了TT4D,这是一种新颖的Pipeline和大规模数据集,旨在从单目视频中重建乒乓球比赛的4D场景。该方案采用独特的“先升维”策略,在进行时间分割之前,先估计乒乓球的3D轨迹和旋转,从而即使在存在遮挡的情况下也能实现稳健的重建。
查看缓存全文
缓存时间: 2026/05/08 07:58
论文页面 - TT4D: A Pipeline and Dataset for Table Tennis 4D Reconstruction From Monocular Videos
来源: https://huggingface.co/papers/2605.01234
摘要
一种从单目广播视频中重建乒乓球比赛的新型重建管线,通过在时间分割之前对未分割的 2D 轨迹应用学习到的提升网络,实现了高保真度的 3D 球体轨迹和旋转估计。
我们提出了 TT4D,一个大规模、高保真的乒乓球数据集 (https://huggingface.co/papers?q=table%20tennis%20dataset)。它提供了从单目广播视频中重建的 140 多个小时的双打和单打比赛数据 (https://huggingface.co/papers?q=monocular%20broadcast%20videos),包含高质量相机校准、精确 3D 球体位置 (https://huggingface.co/papers?q=3D%20ball%20positions)、球体旋转 (https://huggingface.co/papers?q=ball%20spin)、时间分割 (https://huggingface.co/papers?q=time%20segmentation) 以及随时间变化的 3D 人体网格 (https://huggingface.co/papers?q=3D%20human%20meshes) 等多模态标注。这些丰富数据为虚拟回放、深入球员分析和机器人学习提供了新的基础。该数据集在规模与精度上的结合是通过一种新型重建管线 (https://huggingface.co/papers?q=reconstruction%20pipeline) 实现的。以往的方法首先基于 2D 球体轨迹将比赛序列划分为单独的击球片段,然后再进行重建。然而,基于 2D 的时间分割 (https://huggingface.co/papers?q=time%20segmentation) 在遮挡和多变相机视角下会失效,导致无法可靠重建。我们通过先通过学习到的提升网络 (https://huggingface.co/papers?q=learned%20lifting%20network) 将整个未分割的 2D 球体轨迹 (https://huggingface.co/papers?q=unsegmented%202D%20ball%20track) 提升到 3D 空间,从而逆转了这一范式。该 3D 轨迹随后使我们能够可靠地进行时间分割 (https://huggingface.co/papers?q=time%20segmentation)。学习到的提升网络 (https://huggingface.co/papers?q=learned%20lifting%20network) 还能推断球体旋转、处理不可靠的球体检测,并在高遮挡情况下成功重建球体轨迹。这种“先提升”的设计是必要的,因为我们的管线是唯一能从通用视角的单目广播视频中重建乒乓球比赛的方法。我们通过两个下游任务证明了数据集的保真度:估算拍面在击球瞬间的姿态与速度,以及训练竞争回合的生成模型。
查看 arXiv 页面 (https://arxiv.org/abs/2605.01234) 查看 PDF (https://arxiv.org/pdf/2605.01234) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2605.01234)
在您的 agent 中获取此论文:
hf papers read 2605\.01234
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.01234 即可从此页面链接。
引用此论文的数据集 0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.01234 即可从此页面链接。
引用此论文的 Spaces 0
无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.01234 即可从此页面链接。
包含此论文的收藏集 0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
Lift4D:协调单视角3D估计用于野外4D重建
Lift4D是一个测试时优化框架,能够从单目野外视频中重建动态物体的完整4D几何、外观和形变,在具有遮挡和非刚性运动的挑战性序列上优于先前方法。
D4RT:教会 AI 以四维视角观察世界
DeepMind 推出 D4RT,一个统一的 AI 模型,用于动态 4D 场景重建与追踪,效率较此前方法提升高达 300 倍。该模型采用基于查询的 Transformer 架构,为机器人技术与 AR 应用解决复杂的空间和时序任务。
TrackCraft3R: 改造视频扩散变换器用于密集3D追踪
TrackCraft3R 改造视频扩散变换器,用于从单目视频进行密集3D追踪。它采用双潜在表示和时间RoPE对齐,以比先前方法快1.3倍的速度和少4.6倍的峰值内存,实现了最先进的性能。
Track2View:通过配对3D点轨迹实现4D一致的相机控制视频生成
Track2View 通过将视频扩散转换器基于配对3D点轨迹进行条件生成,从视频中生成新的相机视角,实现了最先进的视觉质量,并显著降低了旋转和平移误差。
视频扩散模型在手部运动重建中的惊人有效性
ViDiHand 利用预训练的视频扩散模型表示,直接从自我中心视频帧中重建4D手部运动,无需检测器或优化,在ARCTIC、HOT3D和HOI4D上优于现有方法。