面向社交机器人中话轮切换的多模态语音活动预测:基于语音活动相关预训练编码器

arXiv cs.CL 论文

摘要

提出了一种多模态语音活动预测框架,将仅音频的VAP扩展至视听输入,用于社交机器人的话轮切换预测,采用预训练骨干网络和低秩适应方法。在NoXi和Haru EDR语料库上取得了改进。

arXiv:2607.07294v1 Announce Type: cross 摘要:话轮切换预测是社交机器人参与人机交互的关键需求,尤其是在中介场景中,机器人必须预判对话动态,而非仅对停顿做出反应。本文提出一种多模态语音活动预测(MM-VAP)框架,将原始仅音频的VAP公式扩展到同步视听输入,同时保留其自监督未来预测目标。所提方法基于最初为语音相关任务优化的预训练视听骨干网络,并通过低秩适应将其适配至多模态话轮切换问题。在独立说话者编码后,通过说话者间注意力阶段建模预测未来语音活动所需的关系动态。此外,引入语义一致性损失,根据更高层次的对话活动模式对256状态输出空间进行正则化。在NoXi和NoXi+J上的实验表明,相较于现有基线有改进,尤其在某些话轮切换事件上。在Haru EDR语料库上的额外评估进一步支持了该方向在面向中介的人机交互中的适用性。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:52

# 面向社交机器人轮换说话的多模态语音活动投影——基于语音活动相关预训练编码器

来源:https://arxiv.org/html/2607.07294
Antonio Cano¹,² https://orcid.org/0000-0002-0435-4987, Guillermo Pérez¹ https://orcid.org/0000-0002-8358-996X, Luis Merino² https://orcid.org/0000-0003-4927-8647 与 Randy Gomez³ https://orcid.org/0000-0002-3191-6818
¹Antonio Cano 和 Guillermo Perez 任职于 4i Intelligent Insights,西班牙塞维利亚。[email protected] (https://arxiv.org/html/2607.07294v1/mailto:[email protected]), [email protected] (https://arxiv.org/html/2607.07294v1/mailto:[email protected])
³Antonio Cano 任职于塞维利亚大学,西班牙塞维利亚。[email protected] (https://arxiv.org/html/2607.07294v1/mailto:[email protected])
²Luis Merino 任职于巴勃罗·德奥拉维德大学,西班牙塞维利亚。[email protected] (https://arxiv.org/html/2607.07294v1/mailto:[email protected])
³Randy Gomez 任职于本田研究所日本,日本埼玉。[email protected] (https://arxiv.org/html/2607.07294v1/mailto:[email protected])

###### 摘要

轮换说话预测是社交机器人在人与人交互中的关键需求,特别是在调解场景中,机器人必须预判对话动态,而不仅仅是对停顿做出反应。本文提出了一种多模态语音活动投影(MM-VAP)框架,该框架将原始仅音频的 VAP 公式扩展到同步的音频-视觉输入,同时保留了其自监督的未来投影目标。所提出的方法基于预训练的音频-视觉骨干网络,这些网络原本针对语音相关任务进行优化,并通过低秩适应(LoRA)将其适配到多模态轮换说话问题。在独立说话人编码之后,采用说话人间注意力阶段来建模预测未来语音活动所需的动态关系。此外,引入语义一致性损失,根据更高层次的对话活动模式对 256 状态输出空间进行正则化。在 NoXi 和 NoXi+J 上的实验表明,相比现有基线有所改进,尤其是在某些轮换说话事件上。在 Haru EDR 语料库上的额外评估进一步证实了该方向在面向调解的人机交互中的适用性。

源代码和预训练模型可在 https://github.com/acano15/MM-VAP 获取。

## I. 引言

轮换说话是人类交流中用于组织口语互动、协调说话者和听者角色的普遍机制\[33\]。为了实现有效的人机交互(HRI),对话机器人必须在语言和非语言行为上考虑这种类人协调。在社交机器人领域,交互本质上是轮流进行的\[29\],因此准确理解对话流程和时机对于实现流畅有效的交流至关重要。

本文在 Haru 社交机器人项目\[5\]的基础上进行了扩展,特别是当 Haru 作为支持人与人交互的具身社交调解者时\[7,19,41\]。在此场景中,Haru 并非作为主要对话者之一,而是作为背景社交调解者(图 1),帮助调节对话流程、平衡参与度、管理沉默,并支持主动倾听、参与和共情等社会情感行为。这种调解者角色促使本研究朝着使 Haru 能够更好地理解和管理正在进行的交互的方向发展,特别关注对话语控如何随时间演变以及预测何时可能发生变化。

然而,当前的对话系统在管理轮换说话方面还不够精确,这仍是一个活跃的研究领域,因为用户经常体验到此类失败的影响。典型问题包括:在轮换结束之前或之后说话导致的中断或重叠、因响应迟缓而导致的不自然长时间延迟,以及因误解用户输入而给出的错误回答。此外,由于人类交流本质上是多模态的\[1\],这些局限加上缺乏多模态感知能力,可能导致机器人注视错误的人或对不相关的背景语音做出反应。

参见图注
图 1:Haru 在双方交互场景中作为社交调解者运行\[8\]。

解决这一问题需要结构性地理解对话中轮换是如何形成、维持和交换的。在会话分析中,口语互动被描述为轮换构建单元(TCU),其可能的完整定义了转变相关位置(TRP),TRP 可能导致轮换转移、轮换保持或语控关闭。大多数工业系统仍采用反应式\[32\]方法,使用基于静默的启发式规则来检测说话结束(EoT),通常约为 700 毫秒\[37\]。对话系统和对话机器人的研究表明\[23,3,30,37\],此类方法不足以建模对话动态,因为说话者可能在自己的轮换内产生更长的停顿,称为停顿间单元(IPU)\[12\]。人类对话中的轮换说话遵循不同于当前口语对话系统(SDS)的原则。一个关键区别是,人类并非仅仅等待明确线索表明对话者准备放弃语控;相反,他们持续预测正在发生的事件,并相应地调整自己作为听者或说话者的角色。这种真正的预测行为得到了语音生成时间约束的支持:生成语音通常需要大约 600 到 1500 毫秒\[20,2\],而轮换之间的时间(即语控转移偏移,FTO)通常发生在约 200 毫秒的静默中(在某些文化中可能接近 0 毫秒\[18\])。这种时间上的不匹配表明轮换说话依赖于预测,多模态线索引导 TRP 的预判,并以最小延迟协调响应。

受此行为启发,预测式轮换说话模型(PTTM)被提出作为神经网络模型,在帧级别持续预测未来的对话活动,主要应用于双方口语交互\[37\]。在现有方法中,语音活动投影(VAP)\[9\]被定位为用于连续轮换说话预测的最有效公式之一,包括实时实现。VAP 逐帧投影两位说话者的语音活动(VA),并建模他们的交互动态以预测轮换说话事件。最近,VAP 的多模态扩展已成为一个活跃且有前景的研究方向\[27,32,34,21\],其中非语言信息的融入提供了进一步改进的机会,尽管在实际口语对话系统环境中仍面临挑战。

为了对这一研究方向做出贡献,本文提出了一种基于 transformer 的多模态语音活动投影(MM-VAP)模型,该模型建立在专门预训练编码器的基础上。主要贡献如下:

- • 一种音频-视觉 MM-VAP 架构,集成了与 VA 相关的预训练骨干网络,同时保留了其原生的表示和融合能力,用于改进 VA 投影。
- • 一种基于低秩适应的参数高效适配策略,用于将编码器专门化到目标轮换说话任务。
- • 在与调解相关的轮换说话状态上取得改进性能,突显了所提出流水线的优势。
- • MM-VAP 在机器人环境中的首次应用,并对所提出方法在 Haru 社交调解者场景中用于预测式轮换说话进行了实证评估。

## II. 相关工作

轮换说话预测在 SDS、HRI 以及最近的基于 VAP 的方法中得到了广泛研究。本节回顾了最相关的先前工作以及促使本文方法的关键考虑因素。

最近的多模态语音和语言研究\[22,6,38,40,25,28,24\]表明,大型预训练骨干网络可以通过低秩适应(LoRA)高效适配,从而通过仅更新一小部分参数而非整个模型,将知识迁移到更具体的任务。同时,多模态专门化仍然依赖于注意力机制来建模跨模态依赖关系。基于此,我们特别关注两个骨干网络:TalkNet\[39\],它使用交叉注意力和自注意力进行活跃说话者检测(ASD);以及 WhisperFlamingo\[31\],它结合了预训练的 Whisper 和 AV-HuBERT,并采用门控交叉注意力进行多语言视听语音识别(AVSR)。

在 VAP 研究线中,\[9\]将 VAP 引入为一个自监督预测问题,输出两位说话者的 VA。原始模型结合了一个基于预训练 CPC 骨干网络的编码器(在原始音频波形上运行),以及另一个编码器用于整合当前 VA 帧及其历史,之后是一个 transformer 用于投影未来 VA。这一公式一直是 SDS 中轮换说话建模的核心参考,大多数后续研究仅做了微小修改保留了其核心思想。例如,\[10\]将 VAP 扩展到三方交互,通过将投影空间减少为每位说话者两个 bin;\[15\]将其适配到二元和三类反馈(BC)预测;\[17\]修改了损失函数,加入了 BC 和 EoT 项以平衡多任务目标。关于多语言性,\[13\]表明单语模型在未见语言上泛化能力差,而多语言训练的性能与原始特定语言实现相当。作为对此发现的补充,\[35\]认为这些跨语言差异更多地由数据集差异(特别是语音分割标签的不一致性)而非语言本身解释。除了离线基准测试,VAP 也展示了实际价值,因为其连续的帧级公式和轻量级推理使其适用于实时(RT)实现。例如,\[14\]通过缩短 transformer 输入(1 秒)展示了连续轮换说话预测的可行性,仅带来有限的性能下降。然而,根据\[30\],其有效性仍取决于传感器可靠性和同步质量。

在机器人领域,轮换说话相比传统策略显示出有前景的改进。主要的 HRI 参考仍是\[36\],其中一位说话者被机器人的自身语音替代,以便 VAP 能够提供用于语控管理、中断和 BC 的实时轮换说话事件预测。最近,\[16\]重新设计了含有噪声数据的训练以提高鲁棒性和实时环境中的延迟,并在部署于购物中心的对话机器人上进行了验证。

关于多模态 VAP,迄今为止仅有少数研究报告,它们都在接近原始 VAP 设计的公式下,将额外模态扩展到原始声学框架。首个多模态 VAP 解决方案在\[26\]中提出,添加了一个基于视线、动作单元、头部姿态和关节点特征的非语言分支。其结果表明,多模态性提高了预测事件上的性能。该工作随后在\[27\]中通过更广泛的实验研究、添加重叠预测指标以及在多个语料库上的评估进行了扩展。\[32\]遵循了类似的特征方向,其中面部特征定位是最强的视觉贡献者,相比仅音频基线取得了改进性能。然而,这两种方法都依赖于工程化描述符,而非基于模型的特征提取。转向多模态骨干网络导向的解决方案,唯一确定的途径是\[34\],其中作者用预训练音频(原始 CPC)和面部表情编码器(DEFER)替换了手工制作的面部描述符。然而,所选编码器仍然是通用的,其预训练与语音活动无关,这降低了它们在 VAP 中的潜力。此外,由于该方法使用了两个独立的编码器,跨模态关系必须从头开始学习。

受这些局限的启发,本文研究多模态 VAP 是否能受益于专门化的语音活动骨干网络,将其集成到跨模态注意力机制中,以获得更丰富、更任务相关的多模态表示。

## III. 提出方法

参见图注
图 2:针对双方交互的提出 MM-VAP 架构概览。蓝色和红色路径表示从原始输入到说话者 1 和说话者 2 的潜在表示的流程。雪花和火焰符号分别表示冻结和可训练参数。右下角面板展示了如何从 wtΔt 内的语音活动模式推导出目标轮换说话事件。

本节介绍提出的多模态 VAP(MM-VAP)框架及其完整流水线,从同步的音频-视觉输入序列,到 VA 和 VAP 状态投影估计,再到最终的轮换说话事件推断。

### III-A. 多模态语音活动投影(MM-VAP)

VAP 被正式定义为\[9\]预测(投影)对话中每位对话者未来 VA 二值状态(活跃/不活跃)的任务。MM-VAP 通过整合来自多种模态的数据(此处为音频和视觉信号)扩展了标准定义。投影在一个有限的时域 Δt 上定义,该时域从当前时间步 t 延伸到未来点 t+Δt。在该区间内,两位说话者的未来二值 VA 被联合考虑,因此未来 VA 被建模为一个单一的投影窗口 wtΔt,该窗口代表对话的未来轨迹以及两位说话者的联合 VA。窗口长度的选择涉及权衡,因为它应该足够长以捕获相关的轮换说话信息,但又不能长到试图表示过于复杂或不自然的未来交互模式。与原始实现一致,该窗口被分为每位说话者 4 个异构 bin。前两个 bin 较短,代表即时现在或近期未来;后两个 bin 较长,覆盖更远的未来。由于场景涉及两位说话者,完整投影窗口由 2^{2N}=256 种状态的联合空间表示,其中每种状态紧凑地覆盖了双方之间时域交互的每一种可能配置。

### III-B. 提出 MM-VAP 模型架构

如图 2 所示,模型组织为五个阶段:预处理、骨干编码、说话人间注意力、预测头及后处理。

首先,原始音频-视觉流被分割成以每个帧步 t 为中心的 wtΔt 窗口,时域 Δt 被分离为逐说话者特定信号。对于每位说话者 i,音频波形被转换为频谱表示,视觉流由面部检测模块处理,提取时间有序的裁剪面部图像序列。然后,两种模态被同步到相同的时间分辨率,并一起输入到预训练、微调的编码器中。在编码器内部,每种模态首先由其对应的模态编码器分支处理,在各自的潜在空间中得到说话者表示。生成的音频和视觉嵌入通过 b 被融合。

相似文章

通过通用风格感知全双工框架实现主动语音轮换

arXiv cs.CL

本文提出了一种通用风格感知全双工框架,包含一个轻量级的轮换控制器LPS-TC;引入了一个大规模数据集WildTurn,用于真实世界对话;并提出了一种两级评估方案,以增强对话系统中的主动语音交互和响应质量。