概念驱动的任意场景视线目标估计
摘要
提出了可提示视线目标估计(PGE),这是一种端到端的概念驱动范式,利用文本或视觉提示进行视线分析,并介绍了Gaze-Co数据集和GazeAnywhere模型。
查看缓存全文
缓存时间: 2026/08/13 23:24
论文页面 - Gaze Target Estimation Anywhere with Concepts
来源:https://huggingface.co/papers/2608.11367 发布于8月11日
·
提交者https://huggingface.co/IrohXu
Xu Cao (https://huggingface.co/IrohXu)于8月13日
摘要
一种新的可提示范式将主体定位与视线估计整合到一个端到端的transformer模型中,该模型使用文本或视觉提示来识别主体并预测视线目标,无需多阶段流水线。
从野外图像中估计人类视线目标是一项重要且艰巨的任务。现有方法主要采用脆弱的、多阶段的流水线,这些流水线需要明确的输入(如头部边界框和人体姿态)来识别视线分析的主体。因此,检测误差可能会级联并导致失败。此外,这些先前的工作缺乏通过自然语言提示来指定视线分析任务的灵活性,而这种方法已在其他图像分析任务中被证明在便利性和可扩展性方面具有显著优势。为克服这些限制,我们引入了可提示视线目标估计(PGE)任务,这是一种新的、以概念驱动的视线分析范式。PGE将视线预测条件化为灵活的用户文本或视觉提示(例如,“穿红衣服的男孩”或“点[0.52, 0.48]处的人”),以识别视线分析的特定主体。该方法将主体定位与视线估计相结合,消除了对中间分析阶段的刚性依赖。我们开发了一个可扩展的数据引擎,用于生成Gaze-Co(带概念的视线估计),这是一个包含12万张高质量、带提示标注的图像对的数据集和基准。我们还提出了GazeAnywhere,这是首个为PGE设计的模型。GazeAnywhere使用基于transformer的检测器来融合来自冻结编码器的特征,并同时解决主体定位、帧内/帧外存在性和视线目标热图估计。GazeAnywhere在多个PGE基准上取得了最先进的性能,为这一新问题设定了强基线,即使在困难的域外真实世界临床数据集上也是如此。GazeAnywhere已在github.com/IrohXu/GazeAnywhere (https://huggingface.co/papers?q=GazeAnywhere)开源。
查看arXiv页面 (https://arxiv.org/abs/2608.11367)查看PDF (https://arxiv.org/pdf/2608.11367)项目页面 (https://research.google/pubs/gaze-target-estimation-anywhere-with-concepts/)GitHub21 (https://github.com/IrohXu/GazeAnywhere)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11367)
在您的代理中获取此论文:
hf papers read 2608\.11367
没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型0
没有模型关联此论文
在模型README.md中引用arxiv.org/abs/2608.11367以从此页面链接该论文。
引用该论文的数据集1
IrohXu/Gaze-Co-Benchmark 查看器•约3小时前更新 • 8.98k • 37 (https://huggingface.co/datasets/IrohXu/Gaze-Co-Benchmark)
引用该论文的Space0
没有Space关联此论文
在Space README.md中引用arxiv.org/abs/2608.11367以从此页面链接该论文。
包含该论文的收藏集1
相似文章
视觉世界实验中的注视行为可用现成的语言-视觉编码器建模
本文提出使用现成的CLIP风格多模态编码器,结合双模态归因方法来预测视觉世界实验中的注视行为,无需微调即可成功复现一项关于人类预测加工的开创性研究。
Point-E:从复杂文本提示生成3D点云的系统
OpenAI推出Point-E,一个通过结合文本到图像和图像到3D的扩散模型,能在单个GPU上在1-2分钟内从文本提示生成3D点云的系统。该方法相比现有方法实现了显著的速度提升,同时发布了预训练模型和代码。
Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning
This paper presents a unified global-to-local paradigm for video anomaly detection, introducing a training-free framework (GtS) and a tool-augmented agentic reasoning method with reinforcement learning, along with a new benchmark VAGU-T and metric JeAUG.
提示驱动探索
本文介绍了提示驱动探索(PDE),一种利用视觉语言模型迭代优化强化学习策略的自然语言提示的方法,即使在零奖励起点也能实现全局探索和成功的策略学习。
GLARE:一种用于查询全局解释的自然语言接口
GLARE是一种基于LLM的接口,能够将自然语言问题转化为针对局部解释数据的SQL查询,使用户能够交互式地探索黑盒图像分类器的全局解释。