视线作为共同基础的证据:MapTask与MUNDEX的跨语料库分析

Hugging Face Daily Papers 论文

摘要

本文比较了MapTask和MUNDEX语料库中的视线行为,以理解协作任务中的共同基础,发现任务导向的视线与对齐的引用和理解的判断相关,但效果不大。

在信息不对称的协作任务中,参与者通过互动协调他们的理解。我们询问视线是否在这两个此类任务中提供了关于基础的证据。基于离散的行为注释,我们将HCRC MapTask (Anderson et al., 1991) 和 MUNDEX (Türk et al., 2023) 映射到一个共享的伙伴/任务/远离词汇表,并计算围绕任务相关对话单元的视线特征。在两个语料库中,对齐的引用解释(MapTask)和UND(理解的)判断(MUNDEX)与更多的任务导向视线、更少的伙伴导向视线、更低的视线熵和更少的视线转换相关。关联在任务主导参与者中最为明显:在给予者产生的引用中,以及在解释者判断中,这些也与解释者的视线共变。在同说话者MapTask引用链中,说话者的视线熵在先前未对齐的指代变为对齐的提及处较低。在分组交叉验证下,最佳视线特征组相对于控制组有适度改进:MapTask中的时间特征和MUNDEX中的原始比例。因为效果较小,并且当重复参与者而非对话作为推断单元时,几个效果减弱,我们将视线视为基础的一个贡献线索,需与任务和对话背景一起解释。
查看原文
查看缓存全文

缓存时间: 2026/09/17 02:51

论文页面 - 注视作为共同理解的基础:MapTask与MUNDEX语料库的跨语料分析

来源:https://huggingface.co/papers/2609.18011
在信息不对称的协作任务中——例如包含不同地标的游戏地图,或仅单方知晓规则的棋盘游戏——相互理解必须通过互动过程建立,而注视轨迹是这一过程中少数可观测的痕迹之一。我们对比了两类任务:HCRC MapTask采用透视主义标注,仅当说话者与听话者理解一致时才将指称标记为“对齐“;MUNDEX则是德国游戏说明任务,要求双方提供事后理解判断。两者都将注视行为离散分类为行为类别(而非眼动追踪坐标),但使用不同的分类体系(上/下/关闭;伙伴/桌面/远离),因此我们将其统一映射为“任务导向/伙伴导向/远离“的通用术语集,并计算每个共同理解标注单元周围的注视特征。

两项任务呈现相同的关联模式:当指称被“对齐“或获得“理解“判断时,均伴随更多任务导向注视、更少伙伴导向注视、更低的注视熵值以及更少的注视切换——这种模式在任务主导方(指令发出者/解释者)中最为显著。在MapTask同说话者的指称链中,说话者的注视熵值会在指称物被确认对齐的那个话轮明显下降。虽然效应量较小,且相对于角色/条件控制变量的预测增益有限,但我们认为注视行为是促成共同理解的辅助线索,而非独立的决定性信号。由于该表征方法仅需离散的注视标签,理论上可迁移应用于其他语料库——欢迎探讨,特别是研究不同类别名称在迥异任务中是否对应相同的交互功能。

相似文章

看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础

arXiv cs.CL

本文研究了视觉-语言模型在非对称对话中能否区分潜在共同基础与已确立共同基础。在MapTask数据上的实验表明,提供任务相关的地图内容(视觉或文本)会使模型倾向于过度预测对齐,因为它们依赖于静态指示范例而非通过对话历史追踪共同基础的确立过程。

面向一对多时序定位

Hugging Face Daily Papers

本文介绍了一对多时序定位(OMTG)这一新任务,用于从单个文本查询中定位多个不连续的视频片段,同时提供了基准、评估指标、包含56k样本的数据集以及新颖的奖励函数,取得了最新最优的结果,优于Gemini 2.5 Pro和Seed-1.8。