GRASP:在多人物非语言交互中建立社交推理的根基
摘要
GRASP是一个大规模数据集,用于多人物视频中的社交推理,将高层次社交问题与细粒度的注视和手势事件联系起来,并引入了社交基础奖励(Social Grounding Reward)以提升多模态模型的理解能力。
查看缓存全文
缓存时间: 2026/05/19 10:31
论文页面 - GRASP:在多人物非语言互动中建立社会推理的基础
来源:https://huggingface.co/papers/2605.15764
摘要
GRASP 是一个大规模的社会推理数据集,将高层次社会问题与细粒度的注视和手势事件连接起来,并引入社会基础奖励(Social Grounding Reward)以提升多模态模型对社会互动的理解。
理解社会互动需要对微妙的非语言线索进行推理,然而当前的多模态大语言模型(https://huggingface.co/papers?q=multimodal%20large%20language%20models,MLLMs)在多人视频中经常无法识别谁与谁在互动。我们提出了 GRASP,这是一个大规模的社会推理(https://huggingface.co/papers?q=social%20reasoning)数据集,将高层次社会问答与细粒度的注视和指示手势事件连接起来。GRASP 包含 46K 个视频(总计 749 小时)上的 290K 问答对,按照 16 类分类体系组织,涵盖注视、手势以及注视-手势联合推理,并配套 GRASP-Bench(https://huggingface.co/papers?q=GRASP-Bench)用于评估。与以往专注于单一线索或高层次社会问答的资源不同,GRASP 基于身份一致的注视轨迹(https://huggingface.co/papers?q=gaze%20trajectories)、指示手势(https://huggingface.co/papers?q=deictic%20gestures)及其组合形成的社会事件(https://huggingface.co/papers?q=social%20events)来构建问题。此外,我们提出了社会基础奖励(Social Grounding Reward,SGR,https://huggingface.co/papers?q=Social%20Grounding%20Reward),这是一种学习信号,利用这些社会事件(https://huggingface.co/papers?q=social%20events)鼓励模型推理每次互动所涉及的参与者。实验表明,SGR 在 GRASP-Bench(https://huggingface.co/papers?q=GRASP-Bench)上提升了性能,同时在相关的社会视频问答基准上保持了零样本性能。
查看arXiv页面(https://arxiv.org/abs/2605.15764)查看PDF(https://arxiv.org/pdf/2605.15764)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.15764)
引用本论文的模型 0
没有模型链接本论文
在模型的README.md中引用 arxiv.org/abs/2605.15764 即可从此页链接。
引用本论文的数据集 0
没有数据集链接本论文
在数据集的README.md中引用 arxiv.org/abs/2605.15764 即可从此页链接。
引用本论文的 Space 0
没有 Space 链接本论文
在 Space 的README.md中引用 arxiv.org/abs/2605.15764 即可从此页链接。
包含本论文的收藏集 0
没有包含本论文的收藏集
将本论文添加到收藏集(https://huggingface.co/new-collection)即可从此页链接。
相似文章
GRASP:面向代理型RAG的粒度感知搜索策略
介绍GRASP,一种强化学习框架,训练智能体在多步推理中自适应地协调语义搜索、关键词搜索和段落读取,提高了多跳基准上的检索召回率和问答性能。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。
SeededGrasp:复杂场景中多形态语言引导的抓取
SeededGrasp 提出了一种数据高效的框架,利用视觉语言模型预测种子点,用于轻量级抓取生成器的条件输入,从而在复杂场景中实现多机器人形态的语言引导抓取。该方法在仿真中达到72%的成功率,在实际中达到78%,优于基线方法,并包含一个全新的大规模多形态抓取数据集。
视觉具象化推理
本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。
密集检索的检索锚定潜在推理
提出检索锚定潜在推理(RGLR),一种面向密集检索的潜在推理框架,它显式地将中间潜在转移与检索改进联系起来,在推理密集型任务上优于基线方法。