ReferTrack: 先指代后追踪的具身视觉追踪方法
摘要
ReferTrack 提出了一种用于具身视觉追踪的“先指代后追踪”范式,在 EVT-Bench 上取得了单视角成功率高达 89.4% 的最先进性能,并在腿式机器人和人形机器人上展示了强大的仿真到现实迁移能力。
查看缓存全文
缓存时间: 2026/07/24 05:06
论文页面 - ReferTrack: 先指认再跟踪的具身视觉跟踪
来源: https://huggingface.co/papers/2607.20061
摘要
具身视觉跟踪(Embodied Visual Tracking,EVT)要求移动机器人仅凭机载视觉持续跟踪自然语言描述的特定目标。虽然最近的视觉-语言-动作(VLA)策略统一了目标识别和轨迹规划,但其思维链(CoT)推理通常在抽象的空间隐层中运作,难以监督且与显式图像空间检测的对齐较弱。为解决这一问题,我们提出ReferTrack,一种基于单目前向摄像头的先指认再跟踪范式。我们的模型首先从一组带索引的边界框中选择目标,然后根据这个基于图像的决策来解码跟踪航点。为了保留随时间变化的目标运动线索,ReferTrack维护一个滑动窗口队列,存储先前选中的边界框,并通过时间-视角-边界框指示器(TVBI)标记将其几何特征注入视觉历史。我们进一步通过联合训练一个自定义的Refer-QA数据集来增强目标识别能力。在EVT-Bench上,ReferTrack在单目标、干扰和模糊跟踪子任务上分别取得了89.4%、73.3%和74.1%的成功率,达到了最先进的单视角性能——在识别密集型任务上甚至匹配或超越了多个多摄像头基线。最后,在四足机器人和人形机器人上的实际部署验证了其鲁棒的仿真到现实迁移能力。代码已开源在 https://github.com/MedlarTea/referTrack。
查看arXiv页面 (https://arxiv.org/abs/2607.20061)查看PDF (https://arxiv.org/pdf/2607.20061)项目页面 (https://medlartea.github.io/referTrack/)GitHub8 (https://github.com/MedlarTea/referTrack)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.20061)
在你的智能体中获取此论文:
hf papers read 2607.20061
没有最新的命令行接口?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
请在模型README.md中引用arxiv.org/abs/2607.20061以便从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
请在数据集README.md中引用arxiv.org/abs/2607.20061以便从此页面链接。
引用此论文的Space0
没有Space链接此论文
请在Space README.md中引用arxiv.org/abs/2607.20061以便从此页面链接。
包含此论文的收藏0
没有收藏包含此论文
将这篇论文添加到一个收藏 (https://huggingface.co/new-collection)来从此页面链接。
相似文章
Go-with-the-Track: 基于点追踪的视频合成与运动控制
Go-with-the-Track 使用点轨迹嵌入与空间感知编码及视频扩散变压器,统一了视频生成中的运动控制与参考图像合成,在单一模型中实现了卓越的运动与参考控制。
TrackCraft3R: 改造视频扩散变换器用于密集3D追踪
TrackCraft3R 改造视频扩散变换器,用于从单目视频进行密集3D追踪。它采用双潜在表示和时间RoPE对齐,以比先前方法快1.3倍的速度和少4.6倍的峰值内存,实现了最先进的性能。
SceneBot:接触提示的通用人形全身追踪与场景交互
SceneBot 是一个统一的运动追踪框架,通过参考运动和每连杆接触标签来指导单一的人形策略,从而实现在接触密集环境中的自由空间移动、地形穿越和全身操控。
@PinzhiHuang: 状态追踪是视频理解的核心支柱:它需要识别实体和事件,并映射它们如何随时间演变…
介绍VSTAT,一个衡量多模态大语言模型在视频中追踪状态能力的新基准,揭示前沿模型在人类认为简单的任务上表现不佳。
Track2View:通过配对3D点轨迹实现4D一致的相机控制视频生成
Track2View 通过将视频扩散转换器基于配对3D点轨迹进行条件生成,从视频中生成新的相机视角,实现了最先进的视觉质量,并显著降低了旋转和平移误差。