超越言语通道的否定:对话中的时间多模态关联

arXiv cs.CL 论文

摘要

本文研究人类对话中口语否定线索如何在多模态非言语行为中体现,使用时间序列分类模型在无词汇或声学输入的情况下区分否定上下文与控制上下文。

arXiv:2609.16396v1 Announce Type: new 摘要:否定通常通过其语言实现来建模,尽管口语交互伴随着紧密协调的非言语行为。我们探究以口语否定线索为中心的上下文是否包含可测量的多模态行为信息:是否可以在无词汇或声学输入的情况下将其与匹配的控制上下文区分开来,这些信息在时间上出现在何处,哪些模态承载它,以及它是否延伸到对话伙伴。我们研究了27个在虚拟现实中进行的人与人访谈,包括时间对齐的注视、面部、头部、身体、手部和手指行为,以及964个标注的否定线索。将分类视为预测性探针,我们比较了20个时间序列模型,同时排除了词汇和声学信息,然后系统地变化时间上下文、交互来源、模态可用性和事件时间。通过分组的10折交叉验证,最强的探针从说话者侧行为中达到最高.75的平均保留外AUROC。时间分析表明,预测信息集中在线索起始点附近,但在更广泛的周围间隔内仍可检测到,而对话伙伴行为携带较弱的预测信息,具有相对分散的时间特征。消融和时间扰动进一步表明,面部特征产生最大的模态消融效应,并且训练的探针对观察事件的时间组织敏感。
查看原文
查看缓存全文

缓存时间: 2026/09/16 08:47

# 超越言语通道的否定:对话中的时间多模态关联  
来源:https://arxiv.org/html/2609.16396  
Patrick Schrottenbacher  
Alexander Mehler  
机构:\{hammerla⋅\\cdotschrottenbacher⋅\\cdotmehler\}@em\.uni\-frankfurt\.de  
机构:德国法兰克福歌德大学  

###### 摘要  
否定通常通过其实现的语言形式进行建模,尽管口语交际伴随着紧密协调的非言语行为。我们探究以口语否定线索为核心的语境是否包含可测量的多模态行为信息:它们能否在不依赖词汇或声学输入的情况下,与匹配的对照语境区分开;这些信息出现的时间位置;哪些模态承载信息;以及信息是否延伸至对话伙伴。我们研究了27场在虚拟现实中进行的人-人访谈,包含时间对齐的凝视、面部、头部、身体、手部和手指行为数据以及964个标注的否定线索。将分类作为预测探针,我们在排除词汇和声学信息的情况下比较了20种时间序列模型,并系统性地改变时间语境、交互来源、模态可用性和事件时序。通过分组十折交叉验证,最强的探针从说话者行为中获得高达0.75的平均留出AUROC。时间分析表明,预测信息集中在线索起始点附近,但在更宽的周围区间内仍可检测到;而对话伙伴行为携带的预测信息较弱,且时间分布相对分散。消融和时序扰动进一步表明,面部特征产生最大的模态消融效应,并且训练的探针对观测事件的时间组织敏感。

## 1 引言  
人类交流本质上是多模态的。口语伴随着凝视、面部行为、头部和身体运动以及手势,这些构成了在时间上紧密协调的交流渠道(Goldin-Meadow & Alibali, 2013;Kelly et al., 2009)。尽管计算模型越来越多地利用这些信号,但特定的语言现象如何在非言语行为中体现,以及这些效应在何种时间尺度上可观测,仍不甚清楚(Tsai et al., 2019)。否定提供了一个特别有趣的案例。在计算语言学中,否定主要通过其实现的语言形式进行研究,包括否定线索及其范围的识别(Morante & Blanco, 2012)。同时,否定表达可以与非言语行为系统性地相关联,其中头部动作是一个特别有据可查的例子(Kendon, 2002)。此外,对话是一种共同活动,听者持续对说话者产生行为反应(Clark & Krych, 2004)。因此,明确的否定线索可能与周围多模态交互中的可测量模式相关联。这些模式可能分布在不同模态、参与者和时间中,而非局限于单一手势或瞬间。  

在本研究中,我们考察了人-人对话中口语否定线索的时间多模态关联。我们使用时间对齐的多模态交互数据,以口语词语为锚点,观察其周围的非言语事件。然后,我们探讨仅基于多模态行为(不依赖词汇或声学输入),以否定线索为中心的窗口能否与匹配的对照词语窗口区分开。我们将分类作为预测探针,量化以线索为中心的语境在时间语境、模态和交互来源上与匹配对照的差异。这提供了一种受控的方式来探究与明确否定线索相关的行为信息在*何时*、*何处*以及*通过谁*变得具有预测性。我们解决以下研究问题:  

- • 可区分性:仅使用周围的多模态行为,能否将否定线索中心语境与匹配的对照区分开?  
- • 时间范围:这种可区分性如何随不同的时间语境变化?  
- • 模态贡献:哪些行为模态对线索中心的可区分性贡献最大?  
- • 交互来源:与线索相关的预测信息如何在说话者和对话伙伴之间分配?  
- • 时间敏感性:哪些行为事件类型对它们与口语词语的时间关系表现出最大的预测敏感性?  

通过将预测框架化为对多模态交互的探查,本研究考察了明确的否定线索如何嵌入协调的、时间依赖的人类行为中,而非仅将其视为孤立的语言标签。  

## 2 相关工作  
### 2.1 否定在自然语言处理中的研究  
否定在自然语言处理中已被广泛研究,最常见的是通过识别*否定线索*及其*范围*内的语言材料(Morante & Sporleder, 2012;Morante & Blanco, 2012)。BioScope(Szarvas et al., 2008)和*SEM2012共享任务(Morante & Blanco, 2012)等标注资源建立了广泛使用的线索、范围和焦点检测框架。早期的计算方法包括基于规则的系统(Chapman et al., 2001;Peng et al., 2018)以及结合词汇和句法信息与SVM、CRF等分类器的基于特征的统计模型(Morante & Daelemans, 2009;Lapponi et al., 2012)。后续工作越来越多地采用神经架构(Fancellu et al., 2016),包括基于Transformer的系统如NegBERT(Khandelwal & Sawant, 2020)以及语法感知的图注意力扩展如D-Neg(Hammerla et al., 2025)。尽管取得了这些进展,否定对当代语言模型来说仍然具有挑战性。否定样本在常见的NLU基准测试中代表性不足(Hossain et al., 2022),预训练语言模型可能无法区分肯定和否定陈述(Kassner & Schütze, 2020),并且在更大的自回归语言模型中仍存在类似局限性(Truong et al., 2023;García-Ferrero et al., 2023)。然而,这些方法主要通过语言输入处理否定,将其在同步非言语行为中的表现基本排除在建模目标之外。  

### 2.2 多模态否定  
否定并非仅通过言语通道表达。摇头是其记录最充分的非言语关联之一(Kendon, 2002),而手势以及头部和手部动作的组合已被证明系统地伴随口语否定,并与其节点、范围和焦点对齐(Harrison, 2010;Harrison, 2014;Harrison & Larrivée, 2016)。韵律和手势线索还会影响否定语句的解释(Prieto et al., 2013;Tubau et al., 2015;González-Fuente et al., 2015),并且手势与同意和拒绝(Guidetti, 2005)、范围消歧(Brown & Kamiya, 2019)以及隐含否定意义相关(Inbar & Shor, 2019);近期综述可参见Harrison (2024)。计算工作日益考察这些区别是否被多模态模型捕捉。预训练的视觉-语言模型已被证明难以处理否定(Dobreva & Keller, 2021),这推动了针对否定的多模态评估(Parcalabescu et al., 2022;Sato et al., 2023)和否定感知的视频检索(Wang et al., 2022)。后续工作分析了否定在CLIP中的表示方式(Quantmeyer et al., 2024),而更新的研究则开发了专用的基准和训练策略,以提高视觉-语言模型对否定的理解(Park et al., 2025;Alhamoud et al., 2025)。最近,AbuSaleh et al. (2026)通过表示分析和跨模态注意力融合研究了视频-文本数据中的跨模态否定。  

### 2.3 时间多模态交互  
非言语行为在时间上与言语协调,但不一定严格同步,这在手势-言语时序(Leonard & Cummins, 2011)以及说话者和听者之间的凝视耦合(Richardson & Dale, 2005;Richardson et al., 2007)中已得到证实。对话还受到对话者行为反馈的影响,说话者在交互过程中持续监控这些反馈(Clark & Krych, 2004)。计算工作通过结合言语与凝视、手势和其他行为信号的多模态语料库(Carletta et al., 2006;Kontogiorgos et al., 2018;Kim et al., 2025)以及旨在捕捉时间上未对齐的跨模态依赖关系的模型(Tsai et al., 2019)反映了这种时间和交互视角。这些发现表明,语言事件的时间语境以及周围行为的来源都可能影响其携带的多模态信息量。  

综上所述,先前的工作建立了口语否定与非言语行为之间的系统联系,表明多模态模型在否定方面仍面临挑战,并证明了言语和非言语行为在对话中具有时间结构性。然而,围绕口语否定线索的行为关联尚未通过跨越多个模态的细粒度、时间对齐的事件流得到系统性刻画。我们使用虚拟现实(VR)中人-人交互的事件日志来填补这一空白,量化以线索为中心的可区分性如何在时间语境、模态和交互角色中变化。  

## 3 多模态对话语料库  
请参阅图注图1:交互式VR访谈环境,访谈者(左侧)导航调查问卷,受访者坐在对面。  
我们的实验使用了一个来自27场在VR中进行的个体调查访谈的德语多模态对话语料库。111项目代码和处理后的数据集可在https://github.com/vrneg/vrneg01和https://huggingface.co/VR-Faces-Neg获取。数据集论文将在可用时链接在此。录音涉及3030名独特参与者,其中33名担任访谈者,2727名担任受访者。在研究过程中,参与者由虚拟形象代表,其特征通过佩戴的Meta Quest Pro头显进行控制。这些头显不仅记录了他们在房间内的头部和身体位置,还记录了他们的手部、手指、凝视、面部和声音。所有这些特征在平均持续27.727.7分钟的访谈中以大约18.518.5Hz的频率记录。调查本身涵盖五大类别,并特意包含了已知会因主题敏感性(如收入和马基雅维利主义)而引起不适的问题。访谈环境和虚拟形象的描绘如图1所示(https://arxiv.org/html/2609.16396#S3.F1)。  

我们将录音组织在基于事件的SurrealDB数据库中(SurrealDB Ltd., 2026),包含身体、眼睛、面部、头部、手部和手指事件的时间对齐流。音频录音以大约55秒的片段存储,而CrisperWhisper (v1)(Zusag et al., 2024)应用于完整录音,以获得与多模态流对齐的单词级转录和时间戳。我们使用D-Neg(Hammerla et al., 2025)对转录结果进行否定标注,识别否定线索及其相应的范围(两个模型的精确超参数配置见附录A(https://arxiv.org/html/2609.16396#A1))。在语料库的57,97157,971个口语词中,我们识别出953953个否定实例,包括964964个线索词和2,8112,811个范围词。线索分布偏向于nicht,约占标注线索实例的80%。共享的时间表示使得能够提取围绕口语词语的多模态窗口以及来自周围对话上下文的局部匹配对照。  

## 4 任务表述  
我们将明确否定线索周围多模态关联的研究操作化为一个二元的、以线索为中心的分类问题。每个口语词作为一个时间*锚点*。正类包括标注为否定线索的词,而负类包括任何已标注的否定线索或范围之外的词。锚点的词汇身份或声学信息均未提供给分类器;预测完全基于围绕锚点的多模态行为事件。我们将在第7.3节(https://arxiv.org/html/2609.16396#S7.SS3)中通过针对下半脸的消融来专门评估视觉发音的潜在贡献。  

对于时间ti的锚点词wi,我们通过左窗口大小wL和右窗口大小wR定义时间上下文,并收集EiwL,wR={ej∣ti−wL≤tj≤ti+wR}。两个窗口大小可以独立变化,对称窗口满足wL=wR,不对称窗口允许wL≠wR。此外,设置负边界(wL<0或wR<0)会创建一个偏移滑动窗口,有效地将目标事件排除在窗口本身之外。重要的是,我们不是相对于整个词区间定义上下文,即从词前的wL开始。

相似文章