PANORAMA: 通过掩码提案选择实现的全景定位描述
摘要
本文提出了 PANORAMA,一个用于全景定位描述的视觉-语言模型,该模型通过掩码提案选择利用像素级掩码为描述进行定位,并引入了 PanoCaps 基准进行评估。
查看缓存全文
缓存时间: 2026/09/17 10:53
论文页面 - PANORAMA:通过掩码提案选择实现全景接地描述
来源:https://huggingface.co/papers/2609.19143
摘要
智能系统要在现实世界中运作,就需要既全面又具备空间接地能力的图像理解。当前的视觉-语言模型(VLMs)能够生成流畅且详细的图像描述,但将这些描述可靠地与图像像素关联起来仍然具有挑战性。现有将密集描述与像素级接地相结合的方法,往往要么产生不完整的描述,要么生成不精确的分割掩码。我们通过全景接地描述(panoptic grounded captioning)这一任务来研究这个问题,该任务要求 VLM 既能描述前景物体和背景区域,又能将每个指称短语与像素级掩码进行接地。我们做出了三项贡献。首先,我们引入了 PanoCaps,这是一个从全景分割数据集构建的人工标注基准。它提供了像素覆盖率接近完整的密集描述,以及实体级别的图文对齐,支持训练和评估。我们进一步提出了一种短语-掩码匹配协议和一个广义全景质量(gPQ)评估指标,该指标联合评估文本一致性和掩码一致性。其次,我们将短语接地任务表述为从短语条件化的掩码提案池中进行选择,并提出了 PANORAMA,这是一个在上下文化的短语表征条件下调节预训练分割器以获取候选掩码的 VLM,并学习选择与每个短语对应的掩码。将此接口与描述生成联合训练,使得 PANORAMA 能够生成高质量掩码,同时允许每个短语指代单个区域或多个实例。第三,PANORAMA 在 PanoCaps 基准上实现了最佳的整体接地性能,并在多个像素级接地任务上达到或超越了专用模型的性能。实验表明,我们的方法在生成精确的实体级分割的同时,保持了详细且与掩码一致的描述。代码、数据和模型可在 https://www.di.ens.fr/willow/research/panorama/ 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2609.19143)查看 PDF (https://arxiv.org/pdf/2609.19143)项目页面 (https://www.di.ens.fr/willow/research/panorama/)GitHub2 (https://github.com/sarapieri/panorama_grounding)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.19143)
在您的代理中获取此论文:
hf papers read 2609\.19143
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.19143 以将其从此页面链接。
引用此论文的数据集3
Panorama‑grounding/PanoCaps 查看器• 约 4 小时前更新 • 3.47k • 264 • 2 (https://huggingface.co/datasets/Panorama-grounding/PanoCaps)
Panorama‑grounding/COCONut‑PanCap‑Recaptioned 查看器• 约 4 小时前更新 • 118k • 72 • 2 (https://huggingface.co/datasets/Panorama-grounding/COCONut-PanCap-Recaptioned)
Panorama‑grounding/MRSeg‑Referring‑Expressions 查看器• 约 4 小时前更新 • 101k • 55 • 2 (https://huggingface.co/datasets/Panorama-grounding/MRSeg-Referring-Expressions)
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.19143 以将其从此页面链接。
包含此论文的合集0
没有包含此论文的合集
将此论文添加到合集 (https://huggingface.co/new-collection)以将其从此页面链接。
相似文章
全模态密集视频字幕生成的并行自回归解码
本文介绍了PadCaptioner,一个3B参数的全模态密集视频字幕模型,采用并行自回归解码实现高效率和高品质,性能超越7B参数模型。通过利用事件间的弱局部依赖关系,潜在规划机制实现了无损并行生成。
RefCaptioner:多参考图像 grounded 视频字幕生成
介绍了多参考图像 grounded 视频字幕生成任务,并提出了 RefCaptioner,一个两阶段后训练框架,结合混合数据 SFT 和分层覆盖率折扣 GRPO。论文还介绍了 MRVBench,一个用于评估字幕事实性和多参考图像 grounding 的基准。
通过几何感知预训练增强上下文全景生成
Canvas360是一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与微调,通过大规模数据集和新颖的建模技术,提升了几何一致性与全局连贯性。
PanoWorld: 迈向360度全景世界中的空间超感知
PanoWorld引入了球形空间交叉注意力机制用于全景推理,解决了多模态大语言模型在360度空间理解中的局限性。它构建了一个大规模管线用于几何感知监督,并提出一个诊断性基准,在多个基准上取得了最先进的结果。
面向密集空间感知的视觉预训练
本文提出了一种名为掩码边界建模(masked boundary modeling)的自监督视觉预训练范式,该范式通过学习亚像素边界表示来提升密集空间感知能力。由此得到的模型LingBot-Vision在深度估计及其他下游任务中展现出显著改进,证明边界建模是一种可扩展的预训练原则,可用于学习空间结构化的视觉表示。