DreamTraj:通过读取未渲染视频扩散潜变量生成6DoF物体轨迹

Hugging Face Daily Papers 论文

摘要

DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。

在操作过程中准确预测物体轨迹对于闭环感知-行动回路至关重要。进展在两个方面受到限制:现有数据集缺乏细粒度的语言到运动的标注,且现有的预测器要么依赖视频、深度或CAD模型等特权输入,要么通过昂贵且易出错的感知流水线从完全生成的视频中恢复运动。我们通过MOVE数据集弥补了监督信号的不足,该数据集包含5,038条以物体为中心的第一人称轨迹,每条轨迹都配有细粒度的自然语言指令,而非粗略的动词-名词标签。我们进一步提出了DreamTraj,它从单个RGB图像和任务指令预测6自由度物体轨迹,推理时不需要视频、深度或CAD模型:它不是生成视频,而是在早期去噪步骤中从冻结的图像到视频扩散模型的内部表示中读取运动。一个轻量级的流匹配读取器将查询-键注意力轨迹和池化隐藏状态解码为相对6自由度位姿。据我们所知,这是首个直接从视频扩散中间表示而非生成的像素中解码物体6自由度轨迹的方法。DreamTraj在平移和旋转方面均达到了新的最先进水平,超越了使用多帧或特权输入的预测器,并且运行速度比先生成后提取的流水线快4.6倍。
查看原文
查看缓存全文

缓存时间: 2026/08/04 09:38

论文页面 - DreamTraj:通过读取未渲染的视频扩散潜变量生成6-DoF物体轨迹

来源:https://huggingface.co/papers/2608.00486

摘要

在操作过程中准确预测物体的轨迹对于闭环感知-动作循环至关重要。目前进展在两个方面受限:现有数据集缺乏细粒度的语言到运动标注,而现有预测器要么依赖视频、深度或CAD模型等特权输入,要么通过昂贵且易出错的感知流程从完全生成的视频中恢复运动。我们利用MOVE数据集弥补了这一监督缺口,该数据集包含5,038条以物体为中心的第一人称轨迹,每条轨迹都配有细粒度的自然语言指令,而非粗略的动词-名词标签。我们进一步提出DreamTraj,它仅从单张RGB图像和一条任务指令即可预测6-DoF物体轨迹,推理时无需视频、深度或CAD模型:它不是生成视频,而是从冻结的图像到视频扩散模型在早期去噪步骤中的内部表示中读取运动。一个轻量级的流匹配读取器将查询-键注意力轨迹和池化隐藏状态解码为相对的6-DoF姿态。据我们所知,这是第一个直接从视频扩散的中间表示而非生成的像素中解码物体6-DoF轨迹的方法。在平移和旋转方面,DreamTraj都超越了使用多帧或特权输入的预测器,达到了新的最优水平,且运行速度比“先生成再提取”的流程快4.6倍。

查看 arXiv 页面 (https://arxiv.org/abs/2608.00486)查看 PDF (https://arxiv.org/pdf/2608.00486)项目页面 (https://whathappen0.github.io/DreamTraj/)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.00486)

在你的智能代理中获取此论文:

hf papers read 2608\.00486

没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2608.00486 以从此页面链接它。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.00486 以从此页面链接它。

引用此论文的 Spaces0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2608.00486 以从此页面链接它。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

TrackCraft3R: 改造视频扩散变换器用于密集3D追踪

Hugging Face Daily Papers

TrackCraft3R 改造视频扩散变换器,用于从单目视频进行密集3D追踪。它采用双潜在表示和时间RoPE对齐,以比先前方法快1.3倍的速度和少4.6倍的峰值内存,实现了最先进的性能。

VideoMDM: 基于2D监督的3D人体运动生成方法

Hugging Face Daily Papers

VideoMDM利用扩散框架,通过2D重投影损失和3D运动正则化器,从2D姿态中训练3D人体运动先验,在无需3D真实数据的情况下实现了接近3D监督的性能。

MolmoMotion:语言引导的3D运动预测

Hugging Face Blog

MolmoMotion是一种新的语言引导的3D运动预测模型,它从视频帧和动作描述中预测未来的3D点轨迹,性能优于现有方法。同时,该模型还发布了一个大型数据集(MolmoMotion-1M)和一个基准(PointMotionBench)。