LocateAnything: 快速高质量的视觉-语言定位与并行框解码

Hugging Face Daily Papers 论文

摘要

LocateAnything 提出并行框解码用于统一视觉定位与目标检测,将几何元素解码为原子单元,以提高吞吐量和定位精度,并得到包含1.38亿样本的大规模数据集的支持。

视觉语言模型通常将视觉定位和检测形式化为坐标令牌生成问题,将每个2D框序列化为多个1D令牌,这些令牌在很大程度上独立学习和解码。这种逐令牌解码与框几何的耦合结构不匹配,并且由于严格的顺序生成而造成了实际的推理瓶颈。我们引入了 LocateAnything,这是一个基于并行框解码的统一生成式定位和检测框架。通过将边界框和点等几何元素作为原子单元单步解码,LocateAnything 保持了框内几何一致性并实现了显著的并行性。我们表明,并行框解码提高了解码吞吐量和定位精度。我们进一步开发了一个可扩展的数据引擎,并整理了 LocateAnything-Data,这是一个包含超过1.38亿个训练样本的大规模数据集,显著增加了高精度定位的数据多样性。大量评估表明,LocateAnything 推进了速度-精度边界,在不同基准测试中实现了显著更高的解码吞吐量,同时提高了高IoU定位质量。结果凸显了并行框解码和大规模训练数据在实现高效精确的统一视觉定位和检测中的互补优势。
查看原文
查看缓存全文

缓存时间: 2026/05/27 02:47

论文页面 - LocateAnything:结合并行框解码的快速高质量视觉语言定位

来源:https://huggingface.co/papers/2605.27365 作者:

摘要

并行框解码(Parallel Box Decoding)通过将几何元素作为原子单位进行解码,实现了高效且准确的统一视觉定位与检测,并同时提升了吞吐量和定位质量。

视觉语言模型(Vision-language models)(https://huggingface.co/papers?q=Vision-language%20models)(VLMs)通常将视觉定位(visual grounding)(https://huggingface.co/papers?q=visual%20grounding)和检测(detection)(https://huggingface.co/papers?q=detection)构建为坐标令牌生成(coordinate-token generation)(https://huggingface.co/papers?q=coordinate-token%20generation)问题,将每个二维框序列化为多个一维令牌,这些令牌在很大程度上是独立学习与解码的。这种逐令牌解码方式与框几何结构(box geometry)(https://huggingface.co/papers?q=box%20geometry)的耦合特性不匹配,并因严格串行生成而造成了实际推理瓶颈。我们提出 LocateAnything,一种基于并行框解码(Parallel Box Decoding)(https://huggingface.co/papers?q=Parallel%20Box%20Decoding)(PBD)的统一生成式定位与检测(detection)(https://huggingface.co/papers?q=detection)框架。通过将边界框和点等几何元素作为原子单位在单步中解码,LocateAnything 保持了框内几何一致性(geometric coherence)(https://huggingface.co/papers?q=geometric%20coherence),并释放了显著并行性。我们证明 PBD 既提升了解码吞吐量(decoding throughput)(https://huggingface.co/papers?q=decoding%20throughput),也提高了定位精度(localization accuracy)(https://huggingface.co/papers?q=localization%20accuracy)。我们进一步开发了可扩展的数据引擎,并整理了 LocateAnything-Data,一个包含超过 1.38 亿训练样本的大规模数据集,显著增加了高精度定位的数据多样性。广泛评估表明,LocateAnything 推动了速度-精度的前沿,在实现更高解码吞吐量(decoding throughput)(https://huggingface.co/papers?q=decoding%20throughput)的同时,在多个基准上提升了高 IoU 定位质量。这些结果凸显了并行框解码(Parallel Box Decoding)(https://huggingface.co/papers?q=Parallel%20Box%20Decoding)和大规模训练数据(large-scale training data)(https://huggingface.co/papers?q=large-scale%20training%20data)在实现高效且精确的统一视觉定位(visual grounding)(https://huggingface.co/papers?q=visual%20grounding)与检测(detection)(https://huggingface.co/papers?q=detection)方面的互补优势。

查看 arXiv 页面 (https://arxiv.org/abs/2605.27365)查看 PDF (https://arxiv.org/pdf/2605.27365)项目页面 (https://research.nvidia.com/labs/lpr/locate-anything/)添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.27365)

在您的代理中获取此论文:

hf papers read 2605\.27365

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.27365 以从此页面链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.27365 以从此页面链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.27365 以从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

新建一个收藏集 (https://huggingface.co/new-collection)以从此页面链接此论文。

相似文章

@VincentLogic: NVIDIA 刚开源的这个 LocateAnything 模型,真的有点强。 以前那种视觉定位模型,生成坐标是一个数字一个数字往外蹦(像挤牙膏一样),又慢又不稳定。 这个新模型用了“并行边界框解码”,直接一步预测完整坐标,速度快多了,框得…

X AI KOLs Timeline

NVIDIA 开源了 LocateAnything 模型,采用并行边界框解码技术,一步预测完整坐标,速度快且准确。模型仅 3B 参数,可在消费级显卡上运行,支持视频物体定位、UI 识别和 OCR 等任务。

将视觉-语言接地视为双向概念对应

Hugging Face Daily Papers

本文介绍了ConCor-1,一种接地模型,将视觉-语言接地视为双向概念对应,无需预设短语即可联合恢复文本跨度、图像片段和跨模态匹配。它统一了短语接地、指称表达接地和开放词汇检测,在长标题和零样本LVIS基准上实现了显著的F1提升。