概念驱动的任意场景视线目标估计

Hugging Face Daily Papers 论文

摘要

提出了可提示视线目标估计(PGE),这是一种端到端的概念驱动范式,利用文本或视觉提示进行视线分析,并介绍了Gaze-Co数据集和GazeAnywhere模型。

从真实场景图像中估计人类注视目标是一项重要且艰巨的任务。现有方法主要采用脆弱的多阶段流程,需要头部边界框和人体姿态等显式输入来识别视线分析的对象。因此,检测错误可能会级联并导致失败。此外,这些先前的工作缺乏通过自然语言提示来指定视线分析任务的灵活性,而这种方法已被证明在其他图像分析任务中具有显著的便利性和可扩展性优势。为了克服这些限制,我们引入了可提示视线目标估计(PGE)任务,这是一种新的端到端、概念驱动的视线分析范式。PGE将视线预测建立在灵活的用户文本或视觉提示上(例如,“穿红色衬衫的男孩”或“位于点[0.52, 0.48]的人”),以识别视线分析的特定对象。这种方法将主体定位与视线估计相结合,并消除了对中间分析阶段的刚性依赖。我们开发了一个可扩展的数据引擎来生成Gaze-Co(概念视线估计),这是一个包含120K高质量、带提示标注的图像对的数据集和基准。我们还提出了GazeAnywhere,这是首个为PGE设计的模型。GazeAnywhere使用基于Transformer的检测器融合来自冻结编码器的特征,同时解决主体定位、画面内/外判定和注视目标热图估计。GazeAnywhere在多个PGE基准上取得了最先进的性能,即使在一个困难的域外真实临床数据集上也为这个新问题设定了强大的基线。GazeAnywhere已在github.com/IrohXu/GazeAnywhere开源。
查看原文
查看缓存全文

缓存时间: 2026/08/13 23:24

论文页面 - Gaze Target Estimation Anywhere with Concepts

来源:https://huggingface.co/papers/2608.11367 发布于8月11日

·

提交者https://huggingface.co/IrohXu

Xu Cao (https://huggingface.co/IrohXu)于8月13日

摘要

一种新的可提示范式将主体定位与视线估计整合到一个端到端的transformer模型中,该模型使用文本或视觉提示来识别主体并预测视线目标,无需多阶段流水线。

从野外图像中估计人类视线目标是一项重要且艰巨的任务。现有方法主要采用脆弱的、多阶段的流水线,这些流水线需要明确的输入(如头部边界框和人体姿态)来识别视线分析的主体。因此,检测误差可能会级联并导致失败。此外,这些先前的工作缺乏通过自然语言提示来指定视线分析任务的灵活性,而这种方法已在其他图像分析任务中被证明在便利性和可扩展性方面具有显著优势。为克服这些限制,我们引入了可提示视线目标估计(PGE)任务,这是一种新的、以概念驱动的视线分析范式。PGE将视线预测条件化为灵活的用户文本或视觉提示(例如,“穿红衣服的男孩”或“点[0.52, 0.48]处的人”),以识别视线分析的特定主体。该方法将主体定位与视线估计相结合,消除了对中间分析阶段的刚性依赖。我们开发了一个可扩展的数据引擎,用于生成Gaze-Co(带概念的视线估计),这是一个包含12万张高质量、带提示标注的图像对的数据集和基准。我们还提出了GazeAnywhere,这是首个为PGE设计的模型。GazeAnywhere使用基于transformer的检测器来融合来自冻结编码器的特征,并同时解决主体定位、帧内/帧外存在性和视线目标热图估计。GazeAnywhere在多个PGE基准上取得了最先进的性能,为这一新问题设定了强基线,即使在困难的域外真实世界临床数据集上也是如此。GazeAnywhere已在github.com/IrohXu/GazeAnywhere (https://huggingface.co/papers?q=GazeAnywhere)开源。

查看arXiv页面 (https://arxiv.org/abs/2608.11367)查看PDF (https://arxiv.org/pdf/2608.11367)项目页面 (https://research.google/pubs/gaze-target-estimation-anywhere-with-concepts/)GitHub21 (https://github.com/IrohXu/GazeAnywhere)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11367)

在您的代理中获取此论文:

hf papers read 2608\.11367

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型0

没有模型关联此论文

在模型README.md中引用arxiv.org/abs/2608.11367以从此页面链接该论文。

引用该论文的数据集1

IrohXu/Gaze-Co-Benchmark 查看器•约3小时前更新 • 8.98k • 37 (https://huggingface.co/datasets/IrohXu/Gaze-Co-Benchmark)

引用该论文的Space0

没有Space关联此论文

在Space README.md中引用arxiv.org/abs/2608.11367以从此页面链接该论文。

包含该论文的收藏集1

相似文章

Point-E:从复杂文本提示生成3D点云的系统

OpenAI Blog

OpenAI推出Point-E,一个通过结合文本到图像和图像到3D的扩散模型,能在单个GPU上在1-2分钟内从文本提示生成3D点云的系统。该方法相比现有方法实现了显著的速度提升,同时发布了预训练模型和代码。

提示驱动探索

arXiv cs.LG

本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。