LocateAnything: 快速高质量的视觉-语言定位与并行框解码
摘要
LocateAnything 提出并行框解码用于统一视觉定位与目标检测,将几何元素解码为原子单元,以提高吞吐量和定位精度,并得到包含1.38亿样本的大规模数据集的支持。
查看缓存全文
缓存时间: 2026/05/27 02:47
论文页面 - LocateAnything:结合并行框解码的快速高质量视觉语言定位
来源:https://huggingface.co/papers/2605.27365 作者:
,
,
,
,
,
,
,
,
,
,
,
摘要
并行框解码(Parallel Box Decoding)通过将几何元素作为原子单位进行解码,实现了高效且准确的统一视觉定位与检测,并同时提升了吞吐量和定位质量。
视觉语言模型(Vision-language models)(https://huggingface.co/papers?q=Vision-language%20models)(VLMs)通常将视觉定位(visual grounding)(https://huggingface.co/papers?q=visual%20grounding)和检测(detection)(https://huggingface.co/papers?q=detection)构建为坐标令牌生成(coordinate-token generation)(https://huggingface.co/papers?q=coordinate-token%20generation)问题,将每个二维框序列化为多个一维令牌,这些令牌在很大程度上是独立学习与解码的。这种逐令牌解码方式与框几何结构(box geometry)(https://huggingface.co/papers?q=box%20geometry)的耦合特性不匹配,并因严格串行生成而造成了实际推理瓶颈。我们提出 LocateAnything,一种基于并行框解码(Parallel Box Decoding)(https://huggingface.co/papers?q=Parallel%20Box%20Decoding)(PBD)的统一生成式定位与检测(detection)(https://huggingface.co/papers?q=detection)框架。通过将边界框和点等几何元素作为原子单位在单步中解码,LocateAnything 保持了框内几何一致性(geometric coherence)(https://huggingface.co/papers?q=geometric%20coherence),并释放了显著并行性。我们证明 PBD 既提升了解码吞吐量(decoding throughput)(https://huggingface.co/papers?q=decoding%20throughput),也提高了定位精度(localization accuracy)(https://huggingface.co/papers?q=localization%20accuracy)。我们进一步开发了可扩展的数据引擎,并整理了 LocateAnything-Data,一个包含超过 1.38 亿训练样本的大规模数据集,显著增加了高精度定位的数据多样性。广泛评估表明,LocateAnything 推动了速度-精度的前沿,在实现更高解码吞吐量(decoding throughput)(https://huggingface.co/papers?q=decoding%20throughput)的同时,在多个基准上提升了高 IoU 定位质量。这些结果凸显了并行框解码(Parallel Box Decoding)(https://huggingface.co/papers?q=Parallel%20Box%20Decoding)和大规模训练数据(large-scale training data)(https://huggingface.co/papers?q=large-scale%20training%20data)在实现高效且精确的统一视觉定位(visual grounding)(https://huggingface.co/papers?q=visual%20grounding)与检测(detection)(https://huggingface.co/papers?q=detection)方面的互补优势。
查看 arXiv 页面 (https://arxiv.org/abs/2605.27365)查看 PDF (https://arxiv.org/pdf/2605.27365)项目页面 (https://research.nvidia.com/labs/lpr/locate-anything/)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.27365)
在您的代理中获取此论文:
hf papers read 2605\.27365
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.27365 以从此页面链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.27365 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.27365 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
新建一个收藏集 (https://huggingface.co/new-collection)以从此页面链接此论文。
相似文章
@ZhidingYu:感谢 NVIDIA!我将在 #CVPR2026 上于 NVIDIA 展台展示 LocateAnything:6月5日 MDT 下午4:20-4:40(周五…
NVIDIA 推出了 LocateAnything,这是一个统一的生成式定位与检测框架,采用并行框解码(Parallel Box Decoding)来提升解码吞吐量和定位精度。该工作将在 CVPR 2026 上进行展示。
视频中定位万物:重新思考高效生成式时空视频定位
Parallel Tube Decoding 通过消除自回归依赖,实现高效的同步时空视频定位,减少延迟并提高准确性,优于标准方法。
@VincentLogic: NVIDIA 刚开源的这个 LocateAnything 模型,真的有点强。 以前那种视觉定位模型,生成坐标是一个数字一个数字往外蹦(像挤牙膏一样),又慢又不稳定。 这个新模型用了“并行边界框解码”,直接一步预测完整坐标,速度快多了,框得…
NVIDIA 开源了 LocateAnything 模型,采用并行边界框解码技术,一步预测完整坐标,速度快且准确。模型仅 3B 参数,可在消费级显卡上运行,支持视频物体定位、UI 识别和 OCR 等任务。
@NVIDIAAI: 我们的研究团队在 #CVPR2026 发表的论文在 @HuggingFace 上排名第一。认识一下 LocateAnything:一个视觉语言检测模型……
NVIDIA 研究团队发布了 LocateAnything,一种重新定义边界框预测的视觉语言检测模型,该模型在 HuggingFace 上排名第一。
将视觉-语言接地视为双向概念对应
本文介绍了ConCor-1,一种接地模型,将视觉-语言接地视为双向概念对应,无需预设短语即可联合恢复文本跨度、图像片段和跨模态匹配。它统一了短语接地、指称表达接地和开放词汇检测,在长标题和零样本LVIS基准上实现了显著的F1提升。