多模态对话状态信号的可靠性如何?来自远程双人协作任务的证据

arXiv cs.CL 论文

摘要

本文评估了用于测量远程双人协作任务中对话状态(如认知负荷和权力)的多模态特征的预测准确性、跨任务泛化能力和重测信度。研究结果表明,语言特征预测良好但泛化能力差,在控制说话者身份后声学可靠性下降,而交互特征提供了最可靠的信号。

arXiv:2607.17452v1 Announce Type: new 摘要:从多模态行为中测量认知负荷和对话权力等对话状态,需要既具有预测性又在不同任务上下文中可靠的特征。我们提出了一个三维评估框架,用于评估从视频会议平台上协作任务中的双人对话中提取的交互、声学和语言特征的预测准确性、跨任务泛化能力和重测信度(AVCAffe数据集;53对双人,9个任务)。我们的结果表明,没有任何单一特征族在所有三个维度上占据主导。语言特征在认知负荷上显示出最高的预测准确性,但在跨任务评估中表现崩溃,显示出对特定任务词汇的敏感性。此外,通常被报告为特征稳定性证据的声学可靠性,在控制说话者身份后下降,证实了标准韵律特征测量的是声音特征而非对话状态。交互特征提供了唯一真正可靠的信号,在说话者归一化后保持不变。有趣的是,在所有条件下,权力角色的分类仍接近随机基线,表明任务级聚合行为在预测对话中的权力角色方面的局限性。我们的发现揭示了三个见解:(1) 语言特征预测效果最佳,但在不同任务上下文中泛化能力差;(2) 声学可靠性在控制说话者身份后降至接近零,挑战了标准评估实践;(3) 交互特征提供了唯一真正可靠的信号,地板主导性预测了双人内认知负荷的不对称性。这些结果主张将说话者归一化和多维评估作为对话系统中上下文感知、鲁棒多模态特征选择的前提条件。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:45

# 对话状态的多模态信号有多可靠?来自远程双人协作任务的证据
来源:https://arxiv.org/html/2607.17452
\(2026\)

###### 摘要

通过多模态行为测量认知负荷和会话权力等对话状态,需要那些不仅具有预测性、而且在任务情境中可靠的特征特征。我们提出了一个三维评估框架,用于评估预测准确性、跨任务泛化性和重测信度,并将其应用于通过视频会议平台进行的协作任务期间双人对话中提取的交互性、声学和语言学特征(AVCAffe数据集;5353对偶,9项任务)。我们的结果表明,没有单一特征族在所有三个维度上占主导地位。语言学特征在认知负荷预测上表现出最高的预测准确性,但在跨任务评估中失效,暴露出其对任务特定词汇的敏感性,而非可泛化的负荷信号。此外,声学信度(常被报道为特征稳定性的证据)在控制说话者身份后会下降,证实了标准韵律特征测量的是发声特征而非对话状态。交互特征提供了唯一真正可靠的信号(标准化后不变,结构上不受说话者身份膨胀影响),而话轮主导性可预测双人组内的心理负荷不对称。有趣的是,权力角色分类在所有条件下均接近随机基线,表明任务层面聚合的行为在预测对话中的权力角色方面存在局限性。我们的发现揭示了三项见解:(1)语言学特征预测效果最好,但在不同任务情境中泛化能力差;(2)一旦控制说话者身份,声学信度几乎降至零,对标准评估实践提出挑战;(3)交互特征提供了唯一真正可靠的信号,其中话轮主导性可预测双人组内认知负荷不对称。这些结果主张将说话者归一化和多维评估作为对话系统中情境感知、鲁棒的多模态特征选择的前提条件。

认知负荷,会话权力,多模态信号,可靠性,双人交互,特征评估,远程协作。

††期刊年份:2026††版权:cc††会议:国际多模态交互会议;2026年10月05日至09日,意大利那不勒斯††书刊名:国际多模态交互会议 (ICMI '26),2026年10月05日至09日,意大利那不勒斯††doi:10.1145/3776574.3831235††isbn:979-8-4007-2318-6/2026/10††ccs:以人为中心的计算 协作与社会计算的实证研究††ccs:计算方法 机器学习††ccs:以人为中心的计算

## 1. 引言

旨在支持协作、谈判和群体决策的社交感知对话系统,依赖于从可观察的多模态行为中可靠地测量潜在对话状态(如认知负荷和会话权力)。越来越多的研究探索了声学韵律、话轮转换动态和语言学内容作为此测量任务的信息性信号(Vinciarelli等人,2010 (https://arxiv.org/html/2607.17452#bib.bib26);Schuller等人,2013 (https://arxiv.org/html/2607.17452#bib.bib27);Vukovic等人,2021 (https://arxiv.org/html/2607.17452#bib.bib9)),然而两个关键问题仍未得到充分解答:*这些信号能否跨任务情境泛化?*以及*它们测量的是它们看起来在测量的东西,还是反映了说话者的其他稳定特征?*

预测准确性是多模态情感计算中的主要评估标准,但它无法回答上述任何一个问题。一个特征可能在特定任务分布内很好地预测认知负荷,但在新颖的任务类型上完全失败。其信度估计可能因稳定的说话者特征(声道解剖结构、说话风格)而膨胀,而非反映了会话期间真实的行为一致性。这些区别对系统设计至关重要:一个具有预测性但不具备泛化性或可靠性的特征族,无法作为部署在不同情境中的实时测量系统的基础。

在本文中,我们同时考察预测准确性、信度和泛化性这三个维度。我们使用以下方法评估交互性、声学和语言学特征族:(1)留一对偶(LODO)交叉验证用于预测准确性;(2)留一任务类别(LOCO)分析跨不同任务类型的泛化性;(3)在说话者内归一化前后的组内相关系数(ICC)用于信度。我们将此三维框架应用于远程双人协作的AVCAffe数据集(Sarkar等人,2023 (https://arxiv.org/html/2607.17452#bib.bib1)),该数据集提供了在九项不同任务中标注了认知负荷和会话权力的自然Zoom交互。具体来说,我们在任务层面的行为特征上训练随机森林模型,以预测自我报告的认知负荷分数¹¹¹本文中,心理需求和时间需求被用作认知负荷构念的度量;它们是六个NASA-TLX子量表(Hart和Staveland,1988 (https://arxiv.org/html/2607.17452#bib.bib2))中的两个,因其在双人远程工作中适度的组内一致性和对任务层面会话行为的敏感性而被选中(第3节 (https://arxiv.org/html/2607.17452#S3))。(回归)和权力类别(分类),使用Lin的一致性相关系数(CCC)和宏F1分别在留一对偶交叉验证下进行评估。

我们围绕四个研究问题组织评估:

- •RQ1:在留一对偶交叉验证下,哪个特征族最能预测认知负荷和会话权力?
- •RQ2:预测特征能否跨任务类别泛化?
- •RQ3:特征在类似任务的重复实例中可靠性如何?说话者归一化后信度是否改变?
- •RQ4:话轮主导性是否能预测双人组内认知负荷的不对称性?

我们的主要贡献是:

- •一个用于多模态特征选择的三维评估框架(预测、泛化性、信度),可在此研究之外的数据集上复用。
- •证据表明,语言学特征预测认知负荷的效果显著优于交互或声学特征,但严重依赖于任务。
- •证据表明,双人远程对话中的原始声学特征反映的是说话者身份而非行为状态:标准的说话者内归一化消除了所有明显的信度,引发了对多模态情感计算应用中膨胀观察结果的担忧。
- •话轮主导性(一种交互特征,衡量哪个说话者控制对话话轮)与双人组内说话者之间的负荷不对称显著相关。

参见图注图1。我们的三维评估框架。每条线追踪一个特征族在预测准确性(平均LODO CCC)、跨任务泛化性(平均LOCO CCC)和重测信度(平均ICC(2,1))上的表现。交叉的线揭示了排名分离:没有特征族在所有三个维度上占主导地位。背景阴影区域表示基于(Koo和Li,2016 (https://arxiv.org/html/2607.17452#bib.bib5))的ICC信度阈值。我们的三维评估框架。每条线追踪一个特征族在预测准确性(平均LODO CCC)、跨任务泛化性(平均LOCO CCC)和重测信度(平均ICC(2,1))上的表现。交叉的线揭示了排名分离:没有特征族在所有三个维度上占主导地位。背景阴影区域表示基于 \cite[citep]{( \@@bibref{AuthorsPhrase1Year}{koo2016icc}{\@@citephrase{, }}{})} 的ICC信度阈值。我们的发现提醒人们注意社会交互中情境意识的需求:在一个对话情境上训练的特征如果要在支持情境感知交互系统中发挥作用,必须能够泛化到其他情境。

## 2. 相关工作

### 2.1. 认知负荷的语音特征

声学特征一直是语音认知负荷检测的主要模态。早期工作由Yin等人(Yin等人,2007 (https://arxiv.org/html/2607.17452#bib.bib6), 2008 (https://arxiv.org/html/2607.17452#bib.bib7))证明,音高、语速和能量携带系统性的负荷特征。Interspeech 2014计算副语言学挑战赛(Schuller等人,2014 (https://arxiv.org/html/2607.17452#bib.bib8))将基于语音的认知和物理负荷估计确立为基准问题,推动了在包括航空通信(Vukovic等人,2021 (https://arxiv.org/html/2607.17452#bib.bib9);Yang等人,2023 (https://arxiv.org/html/2607.17452#bib.bib10))和模拟飞行(Xu等人,2025 (https://arxiv.org/html/2607.17452#bib.bib13))等操作环境中使用声学特征进行认知负荷估计的研究方向。Boyer等人(Boyer等人,2018 (https://arxiv.org/html/2607.17452#bib.bib11))和Taptiklis等人(Taptiklis等人,2023 (https://arxiv.org/html/2607.17452#bib.bib12))在受控条件下证实了韵律声学生物标志物作为可靠的心理努力指标。然而,这部分工作在单一任务、单一语料库设置下评估声学特征;跨任务泛化性和说话者层面的信度未得到评估。据我们所知,此前没有工作在远程协作任务中评估说话者内归一化后的声学信度,我们在本工作中解决了这个问题。

### 2.2. 语言学和多模态特征

Khawaja等人(Khawaja等人,2012 (https://arxiv.org/html/2607.17452#bib.bib14))表明,包括模糊限制语、填充词和代词使用率在内的语言学特征反映了协作交流中的认知负荷,这直接激励了我们研究中的语言学特征族。Abel和Babel(Abel和Babel,2017 (https://arxiv.org/html/2607.17452#bib.bib16))发现,认知负荷会减少双人组内的语言趋同,表明词汇多样性是理论上合理的负荷标志。Zhou等人(Zhou等人,2018 (https://arxiv.org/html/2607.17452#bib.bib17))提出了一个结合行为和生理信号的多模态认知负荷测量模型,认为多模态数据融合能比任何单一数据模态提高模型鲁棒性。这些发现激励了我们的多模态特征族比较。然而,这些先前工作均未评估从多模态数据预测认知负荷时的跨任务泛化性或说话者归一化信度,而这是我们工作的重点。

### 2.3. 对话动态与交互特征

话轮转换模式、重叠和话轮控制已在多项先前工作中被研究为社会权力和会话主导性的指标(Vinciarelli等人,2010 (https://arxiv.org/html/2607.17452#bib.bib26);Gravano和Hirschberg,2011 (https://arxiv.org/html/2607.17452#bib.bib22))。此外,沉默和响应延迟已被与认知脱离和处理时间相关联(Heldner和Edlund,2010 (https://arxiv.org/html/2607.17452#bib.bib23);Johnstone等人,1995 (https://arxiv.org/html/2607.17452#bib.bib24)),表明交互中的不平等参与是认知负荷的一个指标。这些交互特征激励了我们的双人层面特征族来捕捉对话动态,因为它们的信度和跨任务稳定性相对于常用的声学和语言学族此前尚未得到评估。

### 2.4. 远程协作认知负荷数据集

Sarkar等人(Sarkar等人,2023 (https://arxiv.org/html/2607.17452#bib.bib1))引入了AVCAffe,这是首个结合远程工作认知负荷和情感标注的音视频数据集,我们在本文中使用它。他们的评估使用2秒视频片段的二分类任务,结合深度学习骨干网络,报告加权F1(最佳:长视频的心理和时间需求为65–67%)。我们的工作从根本上不同于他们的方法:我们使用与NASA-TLX固有性质一致的任务层面特征摘要(Hart,2006 (https://arxiv.org/html/2607.17452#bib.bib3);Hart和Staveland,1988 (https://arxiv.org/html/2607.17452#bib.bib2)),采用回归分析并以一致性相关系数(CCC)作为评估指标,并且在本工作中专注于测量有效性而非仅基于性能的模型基准测试。

最近引入的CoAffinity数据集(Gunasekaran等人,2025 (https://arxiv.org/html/2607.17452#bib.bib18))为类似任务提供了补充资源:39名参与者执行八项远程工作任务,包含音频、视频和生理信号(PPG、GSR)以及认知负荷标注。他们的结果证实,整合生理模态显著改善了负荷检测,表明纯行为信号面临固有的上限,这一发现与我们所有三个特征族的中等CCC结果一致。

### 2.5. 行为信号的信度和测量效度

我们使用Koo和Li(Koo和Li,2016 (https://arxiv.org/html/2607.17452#bib.bib5))提供的标准组内相关系数(ICC)阈值作为整个信度分析的统计测量指标。尽管ICC是行为测量中重测信度的标准工具,但其在多模态情感计算中的应用相对罕见。我们首次在双人远程对话数据集中实证证明了说话者特定发声特征(例如声道解剖结构、稳定说话风格)对原始声学ICC的系统性膨胀,这是一个值得关注的问题。在类似工作中,Koenecke等人(Koenecke等人,2020 (https://arxiv.org/html/2607.17452#bib.bib29))证明了ASR错误率在说话者背景上的不相等分布,这对于从自动生成转录本中导出的语言学特征的信度具有直接影响,尤其是对于像AVCAffe这样参与者群体多样化(18个原籍国)且存在口音、性别和其他说话者条件变化的数据集。

表1. 我们的贡献相对于先前相关工作。
### 2.6. 定位我们的贡献

表1 (https://arxiv.org/html/2607.17452#S2.T1)总结了我们工作与最相关研究之间的关键区别。我们的贡献有三点:(1)我们引入了一个三维评估框架(预测、泛化性、信度),其他工作均未联合应用;(2)我们提供了远程对话数据集中声学特征的说话者归一化ICC分析,揭示了说话者身份的系统性膨胀;(3)我们考察了语言学特征的高预测准确性是否跨任务情境泛化——此前工作未解决这一问题,且对未来情境感知对话系统的设计有直接影响。

## 3. 数据

### 3.1. AVCAffe数据集

我们使用AVCAffe(Sarkar等人,2023 (https://arxiv.org/html/2607.17452#bib.bib1)),一个通过Zoom进行的远程双人协作的视听数据集。数据集由106名参与者组成(49%男性,50%女性,1%非二元;年龄18–57岁;18个原籍国),组成53个双人组。每个双人组完成包含九个任务实例的会话,涵盖七种任务类型:开放式讨论、调节气氛(分享笑话)、Diapix(识别差异)

相似文章

课堂环境下的多模态说话人识别

arXiv cs.CL

本文评估了一种用于K-12课堂说话人识别的多模态框架,通过将声学嵌入(ECAPA-TDNN)与基于LLM的转录本语义上下文相结合,将整体准确率从39%提升至50.3%,对于较长话语,准确率从64.9%提升至76.9%。

评估主动式对话智能体中的多模态情绪识别:一项用户研究

arXiv cs.AI

本文介绍了一个用于主动对话智能体的多模态情绪识别模块,该模块结合了面部识别与语言分析。一项涉及20名参与者的用户研究发现了一种“扑克脸”效应,即视觉线索不可靠,而语言分析则更为准确;研究还表明,智能体可以通过对话适应性来引发情绪。