视线作为共同基础的证据:MapTask与MUNDEX的跨语料库分析
摘要
本文比较了MapTask和MUNDEX语料库中的视线行为,以理解协作任务中的共同基础,发现任务导向的视线与对齐的引用和理解的判断相关,但效果不大。
查看缓存全文
缓存时间: 2026/09/17 02:51
论文页面 - 注视作为共同理解的基础:MapTask与MUNDEX语料库的跨语料分析
来源:https://huggingface.co/papers/2609.18011
在信息不对称的协作任务中——例如包含不同地标的游戏地图,或仅单方知晓规则的棋盘游戏——相互理解必须通过互动过程建立,而注视轨迹是这一过程中少数可观测的痕迹之一。我们对比了两类任务:HCRC MapTask采用透视主义标注,仅当说话者与听话者理解一致时才将指称标记为“对齐“;MUNDEX则是德国游戏说明任务,要求双方提供事后理解判断。两者都将注视行为离散分类为行为类别(而非眼动追踪坐标),但使用不同的分类体系(上/下/关闭;伙伴/桌面/远离),因此我们将其统一映射为“任务导向/伙伴导向/远离“的通用术语集,并计算每个共同理解标注单元周围的注视特征。
两项任务呈现相同的关联模式:当指称被“对齐“或获得“理解“判断时,均伴随更多任务导向注视、更少伙伴导向注视、更低的注视熵值以及更少的注视切换——这种模式在任务主导方(指令发出者/解释者)中最为显著。在MapTask同说话者的指称链中,说话者的注视熵值会在指称物被确认对齐的那个话轮明显下降。虽然效应量较小,且相对于角色/条件控制变量的预测增益有限,但我们认为注视行为是促成共同理解的辅助线索,而非独立的决定性信号。由于该表征方法仅需离散的注视标签,理论上可迁移应用于其他语料库——欢迎探讨,特别是研究不同类别名称在迥异任务中是否对应相同的交互功能。
相似文章
看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础
本文研究了视觉-语言模型在非对称对话中能否区分潜在共同基础与已确立共同基础。在MapTask数据上的实验表明,提供任务相关的地图内容(视觉或文本)会使模型倾向于过度预测对齐,因为它们依赖于静态指示范例而非通过对话历史追踪共同基础的确立过程。
ReGround:基于多模态证据的审稿意见定位
ReGround 是一个大规模数据集,用于将审稿意见定位到科学论文的多模态证据上,揭示了在检索任务中整合文本、表格和图表的重要性和挑战性。
COMPASS:在统一多模态模型中锚定组合意图引导
本文提出了COMPASS,首个能够同时锚定组合意图控制,以进行组合感知和组合引导生成的统一多模态框架,并引入了共享专家令牌和Comp-11数据集。
面向一对多时序定位
本文介绍了一对多时序定位(OMTG)这一新任务,用于从单个文本查询中定位多个不连续的视频片段,同时提供了基准、评估指标、包含56k样本的数据集以及新颖的奖励函数,取得了最新最优的结果,优于Gemini 2.5 Pro和Seed-1.8。
GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败
本文介绍了GUI-Primitives,这是一个包含994个对比指令对的基准,用于诊断视觉-语言模型在GUI定位中的空间推理失败,揭示了大多数失败源于候选定位而非关系理解。