ReferTrack: 先指代后追踪的具身视觉追踪方法

Hugging Face Daily Papers 论文

摘要

ReferTrack 提出了一种用于具身视觉追踪的“先指代后追踪”范式,在 EVT-Bench 上取得了单视角成功率高达 89.4% 的最先进性能,并在腿式机器人和人形机器人上展示了强大的仿真到现实迁移能力。

具身视觉追踪(EVT)要求移动智能体仅利用机载视觉持续跟踪以自然语言描述的特定目标。虽然最近的视觉-语言-行动(VLA)策略统一了目标识别和轨迹规划,但其思维链(CoT)推理通常在抽象的潜在空间中运行,难以监督且与显式图像空间检测的对齐较弱。为解决这一问题,我们提出了 ReferTrack,一种利用单个前置摄像头将具身视觉追踪具象化的先指代后追踪范式。我们的模型首先从索引的边界框集合中选择目标,然后基于这一图像相关的决策解码追踪航点。为了随时间保留目标运动线索,ReferTrack 维护了一个先前所选边界框的滑动窗口队列,并通过时间-视角-边界框指示器(TVBI)令牌将其几何特征注入视觉历史。我们通过在自定义的 Refer-QA 数据集上共同训练进一步增强了目标识别能力。在 EVT-Bench 上,ReferTrack 在单目标、干扰和模糊追踪子集上分别取得了 89.4%、73.3% 和 74.1% 的成功率,达到了最先进的单视角性能——在识别密集型任务上匹配甚至超越了多个多摄像头基线。最后,在腿式机器人及人形机器人上的实际部署验证了其强大的仿真到现实迁移能力。代码可在 https://github.com/MedlarTea/referTrack 获取。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:06

论文页面 - ReferTrack: 先指认再跟踪的具身视觉跟踪

来源: https://huggingface.co/papers/2607.20061

摘要

具身视觉跟踪(Embodied Visual Tracking,EVT)要求移动机器人仅凭机载视觉持续跟踪自然语言描述的特定目标。虽然最近的视觉-语言-动作(VLA)策略统一了目标识别和轨迹规划,但其思维链(CoT)推理通常在抽象的空间隐层中运作,难以监督且与显式图像空间检测的对齐较弱。为解决这一问题,我们提出ReferTrack,一种基于单目前向摄像头的先指认再跟踪范式。我们的模型首先从一组带索引的边界框中选择目标,然后根据这个基于图像的决策来解码跟踪航点。为了保留随时间变化的目标运动线索,ReferTrack维护一个滑动窗口队列,存储先前选中的边界框,并通过时间-视角-边界框指示器(TVBI)标记将其几何特征注入视觉历史。我们进一步通过联合训练一个自定义的Refer-QA数据集来增强目标识别能力。在EVT-Bench上,ReferTrack在单目标、干扰和模糊跟踪子任务上分别取得了89.4%、73.3%和74.1%的成功率,达到了最先进的单视角性能——在识别密集型任务上甚至匹配或超越了多个多摄像头基线。最后,在四足机器人和人形机器人上的实际部署验证了其鲁棒的仿真到现实迁移能力。代码已开源在 https://github.com/MedlarTea/referTrack。

查看arXiv页面 (https://arxiv.org/abs/2607.20061)查看PDF (https://arxiv.org/pdf/2607.20061)项目页面 (https://medlartea.github.io/referTrack/)GitHub8 (https://github.com/MedlarTea/referTrack)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20061)

在你的智能体中获取此论文:

hf papers read 2607.20061

没有最新的命令行接口?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

请在模型README.md中引用arxiv.org/abs/2607.20061以便从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

请在数据集README.md中引用arxiv.org/abs/2607.20061以便从此页面链接。

引用此论文的Space0

没有Space链接此论文

请在Space README.md中引用arxiv.org/abs/2607.20061以便从此页面链接。

包含此论文的收藏0

没有收藏包含此论文

将这篇论文添加到一个收藏 (https://huggingface.co/new-collection)来从此页面链接。

相似文章

TrackCraft3R: 改造视频扩散变换器用于密集3D追踪

Hugging Face Daily Papers

TrackCraft3R 改造视频扩散变换器,用于从单目视频进行密集3D追踪。它采用双潜在表示和时间RoPE对齐,以比先前方法快1.3倍的速度和少4.6倍的峰值内存,实现了最先进的性能。