全双工语音对话模型中的同步与话轮转换

arXiv cs.CL 论文

摘要

本文通过模拟两个Moshi模型实例之间的对话,利用CKA测量表征对齐并使用LSTM探针预测话轮边界,分析了全双工语音对话模型中的同步与话轮转换动态。

arXiv:2605.20356v1 公告类型:新 摘要:全双工语音对话模型(SDMs)可以同时听和说,从而实现比基于话轮的系统更接近人类对话的交互动态。受人类交流中神经耦合的启发,我们研究了此类模型在交互过程中如何协调其内部表征。我们模拟了两个预训练的\textit{Moshi}模型实例在受控条件下的全双工对话,操纵信道噪声和解码偏差。使用中心核对齐(CKA)在时间滞后上测量同步,同时使用因果LSTM模型从延迟的内部激活中探测预期的话轮转换线索,从说话者和听者两个角度进行。我们发现,在无噪声条件下,表征同步强烈,在零滞后附近达到峰值,并随噪声而退化,并且我们表明内部状态编码了预期信息,支持提前进行话轮转换预测。
查看原文
查看缓存全文

缓存时间: 2026/05/21 06:32

# 全双工语音对话模型中的同步与话轮转换
来源:https://arxiv.org/html/2605.20356
Riera Brusco Kuo Sancinetti Branavan

###### 摘要

全双工语音对话模型能够同时进行听和说,从而能够实现比基于话轮的对话系统更接近人类对话的交互动态。受人类交流中神经耦合现象的启发,我们研究了此类模型在交互过程中如何协调其内部表征。我们在受控条件下模拟了两个预训练Moshi模型实例之间的全双工对话,并操控了信道噪声和解码偏置。我们使用跨时间延迟的中心核对齐方法来测量同步性,同时使用基于LSTM的因果模型从说话者和听者两个视角,从延迟的内部激活中探测预期的话轮转换线索。我们发现,在无噪声条件下存在强烈的表征同步性,在零延迟附近达到峰值,并随着噪声增加而退化;我们还发现,内部状态编码了有助于提前预测话轮转换的预期性信息。

###### 关键词:

全双工语音对话,语音大语言模型,语言耦合,同步,话轮转换,神经耦合,模拟对话

## 1 引言

人类对话的特点是丰富的时空调制,参与者协调时间、镜像韵律并预期话轮变化[duncan1974structure,stivers2009universals]。这些现象包括所谓的“语言耦合”(entrainment),即对话者在语速、音高和句法结构上趋同的倾向,尽管他们也可能会通过变得更具差异性来适应,同时仍保持响应性,这一过程被称为“去耦合”(disentrainment)[galvez2020empirical]。在语音对话系统中,感知到的交互自然性与是否能再现这些类人模式的程度密切相关[stivers2009universals,skantze2021turn]。

除了可观察的言语特征之外,成功的交流还依赖于说话者和听者之间的“神经耦合”。功能性磁共振成像研究表明,他们的大脑活动在时间和空间上会趋于一致,而当交流失败或语言难以理解时,这种一致性会消失。此外,更强的“预期性耦合”——即听者活动先于说话者活动——与更好的理解能力相关联,这凸显了预测作为交流的核心机制[stephens2010coupling]。

近期在全双工语音对话系统方面的进展,使得建模和评估话轮转换行为重新引起关注。受人类交流中神经耦合发现的启发,我们提出了一种评估框架,用于研究全双工对话模型中的同步和话轮转换。我们使用Moshi这一预训练的全双工语音对话模型来实例化该方法,通过模拟两个模型实例之间的对话并分析其内部动态。同步性通过跨时间延迟的内部表征对齐来量化[stephens2010coupling,wilmer2012time],而话轮转换信息则通过使用基于LSTM的模型探测内部状态来预测话轮边界和转换[brusco2023automatic]。

## 2 相关工作

语音对话系统已从僵化的、基于话轮的半双工架构,转向更接近人类交流的同步全双工交互。传统的级联式流水线(语音识别、语言建模和合成)存在延迟和话轮转换不自然的问题[Yang2025TowardsHE,Peng2025FDBenchAF]。为了解决这些问题,近期工作聚焦于全双工语音对话系统,包括流式端到端模型(如Moshi和Mini-Omni)以及语音活动增强系统(如Freeze-Omni和VITA)[Chen2025FromTT,Ge2025FLEXIBF]。一个关键的里程碑是生成式语音对话语言模型(dGSLM)的引入,它展示了话轮转换、反馈和重叠可以直接从原始音频中学习,而无需文本监督[nguyen2023generative,Wang2025TowardsGA]。

在端到端方法中,*Moshi*[defossez2024moshispeechtextfoundationmodel]是一个预训练的语音-文本基础模型,专为实时双向对话设计。其架构支持同时对用户输入和自生成语音进行条件处理,使得无需显式话轮分割即可实现打断和反馈。虽然先前的工作已经考察了Moshi的可观察行为,但其在交互过程中的内部表征动态仍 largely 未被探索。

随着全双工模型的成熟,基准测试工作越来越多地聚焦于行为评估。诸如Full-Duplex-Bench[lin2025full]和Talking Turns[arora2025talking]等基准测试评估对话时机和反馈适当性,其中[arora2025talking]认为语料库级别的统计量无法捕捉细粒度的交互动态,并提出使用基于人类数据训练的评判模型。

这些基准测试主要依赖人类录音,并且 largely 忽略了语言耦合、同步和内部话轮转换动态。虽然一种选择是分析人机交互,但我们转而通过一个通信信道直接连接全双工系统,从而能够以受控但自然的方式观察涌现的协调。这种方法不仅促进了对语音对话模型的分析,也将其定位为研究人类话轮转换和协调背后原理的计算代理。

## 3 方法

### 3.1 模拟全双工对话环境

为了在受控条件下研究内部表征之间的同步性以及话轮转换动态,我们生成了两个独立的Moshi实例之间持续100秒的对话。由于模型可以在消费音频的同时生成语音,我们通过一个基于直接词级音频路由的通信信道连接两个实例(A和B):模型A输出的音频词作为模型B的输入,反之亦然。我们通过包含随机词变化来操控该信道。对于每一帧,我们使用一个概率值来允许词被改变,当概率为0.7时,语音变得难以理解。

对话通过预先录制的音频提示启动,以诱导模型采用医疗预约场景中代理人或客户的角色。我们使用官方的Moshi检查点:代理人角色使用“Moshika”,客户角色使用“Moshiko”。为了研究任务适应的影响,我们将默认检查点与微调版本进行比较,从而分析预训练与微调对同步和话轮转换动态的影响。

我们进一步通过引入对PAD词(模型静默时发出的词)的解码偏置来操控话轮转换行为。具体地,我们从PAD词对数几率中减去一个常数值,从而增加语音的可能性,并由此促进更频繁的话轮转换。

实验条件包括四个噪声水平(无、低、中、高)、两个模型版本(默认和微调),从而产生四种代理人-客户配对(默认/默认、默认/微调、微调/默认、微调/微调)以及三个PAD偏置水平(无、中、高)。对于每种条件,我们使用不同随机种子生成20个对话,总共得到2880个对话,约80小时的音频。

为了分析内部动态和交互时机,我们提取每一帧时间变压器最后一层的激活值,记为ht∈Rd\mathbf{h}_{t}\in\mathbb{R}^{d}。这些激活值是高度上下文化的,并直接用于在下一个时间步生成语音和文本。对于时间标注,我们计算暂停间单元(IPU)的起始和结束,IPU定义为由至少80毫秒静默分隔的有声片段。IPU边界定义了以下所述IPU结束(EOI)和“保持”与“非保持”任务中的决策点。

### 3.2 内部表征同步

两个模型之间的同步性通过在不同时间延迟下计算其内部表征时间序列之间的线性CKA来量化。CKA是一种对正交变换和各向同性缩放不变的相似性度量[kornblith2019similarity]。线性CKA定义为

CKA(X,Y)=∥Y⊤X∥F2∥X⊤X∥F∥Y⊤Y∥F,
CKA(X,Y)=\frac{\lVert Y^{\top}X\rVert_{F}^{2}}{\lVert X^{\top}X\rVert_{F}\,\lVert Y^{\top}Y\rVert_{F}},

其中XX和Y∈Rd×nY\in\mathbb{R}^{d\times n}是nn帧上激活值的矩阵,维度为dd,∥⋅∥F\lVert\cdot\rVert_{F}表示Frobenius范数。值越高表明表征空间之间的相似性越大。

在典型对话中,一次只有一个说话者活跃;因此,高CKA值表明尽管角色不同(说话与倾听),模型之间仍存在对齐。通过计算跨时间延迟的CKA,我们评估两个模型之间的同步程度[wilmer2012time]。我们预期同步交互的CKA在零延迟附近达到峰值,并随延迟增加而下降。通信信道中增加的噪声预期会降低CKA值。我们还计算了表征时间序列之间的互信息,但观察到相似趋势,因此省略这些结果。

### 3.3 话轮转换探测设置

为了测试话轮转换信息是否编码在模型的内部表征中,我们采用了一个探测框架。我们在每个时间帧tt从时间变压器最后一层提取内部激活值ht∈Rd\mathbf{h}_{t}\in\mathbb{R}^{d},并将其用作预测探针的输入特征,该探针训练用于预测即将到来的话轮转换事件。为了强制执行因果性,我们引入一个时间延迟δ\delta,使得探针在时间tt仅能观察到过去的表征ht−δ\mathbf{h}_{t-\delta}。

话轮转换事件发生在特定的时间点bb,对应IPU边界。对于每个任务,我们使用延迟表征训练单独的探针。我们考虑两个视角:(i) 说话者侧(产生),探针使用模型自身的延迟状态来预测其自身即将到来的话轮转换;(ii) 听者侧(感知),探针使用模型自身的延迟状态来预测伙伴方即将到来的转换。这种区分使我们能够检验话轮转换线索是否同时存在于计划和感知表征中。

我们预期产生设置更容易,因为模型可以直接访问自身的计划状态。感知设置更具挑战性,因为它需要从外部可观察的线索中推断话轮转换意图。然而,如果内部表征是对齐的,我们预期听者侧探针的性能会高于随机水平。

我们考虑两个任务:(i) IPU结束预测;(ii) 保持与(非保持)分类。对于这两个任务,使用打乱标签训练的探针用于估计随机水平性能。

#### 3.3.1 IPU结束预测

该任务评估即将到来的IPU结束边界是否编码在内部表征中。它被公式化为一个连续的帧级预测问题,探针在每个时间帧都会产生一个输出。

正标签仅分配给真实的EOI帧(至少80毫秒静默前的最后一个有声帧),而所有其他帧都标记为负标签。因此,分类器必须基于延迟表征,将真正的话轮结束偏移与语音、微停顿以及IPU内部波动区分开来。图1 (https://arxiv.org/html/2605.20356#S3.F1) 显示了一个示例。

正式地,我们使用一个循环探针,在每个时间索引tt,观察信号到目标前一个时间偏移δ\delta,即隐藏状态ht−δ\mathbf{h}_{t-\delta},并输出该帧对应EOI的概率yty_{t}。

该实验测试内部表征是否编码了关于即将到来的IPU边界的预期性信息,无论说话者最终是继续(保持)还是放弃话轮,以及这些线索能多早被解码。

#### 3.3.2 保持与(非保持)预测

该任务针对更高层次的对话决策。在IPU边界处,说话者要么继续说话(保持),要么发生话轮转换(非保持),此时对话者接管话轮(例如,平滑切换、打断或插话)。

如果到下一个IPU的停顿超过一秒,或者无法做出清楚的保持/非保持决策(定义为双方说话者重叠超过240毫秒),则排除该转换。较短的重叠标记为非保持,这反映了自然人类和全双工交互中常见的重叠现象。较长的重叠被排除。图1 (https://arxiv.org/html/2605.20356#S3.F1) 说明了这些情况,包括后面跟着长停顿的EOI,以及过度重叠的EOI。

探针的输入方式与EOI情况类似,但只在有效的话轮转换点进行预测。我们假设,在说话者侧,保持与(非保持)决策涉及跨越多个IPU的计划,并反映在边界之前的潜在轨迹中。在听者侧,话轮转换线索可以从伙伴语音中的韵律或内容信号中推断出来,指示即将发生的话轮转移。

参见图注
图1: 两个话轮转换预测任务的目标位置。IPU结束预测是一个连续的帧级任务,正标签仅出现在真正的IPU结束帧(三角形)。保持与(非保持)预测发生在离散的IPU边界,分类说话者是否会继续(保持为叉号)还是转换(非保持为圆圈)。

#### 3.3.3 训练细节

我们将探针实现为一个因果LSTM,隐藏大小为H=64H=64,后接一个在每个时间步应用的线性投影。给定一个序列(h1,…,hT−δ)(\mathbf{h}_{1},\dots,\mathbf{h}_{T-\delta}),探针产生每帧的yt\mathbf{y}_{t}对数几率:

yt=W⋅LSTM(ht−δ)+b
\mathbf{y}_{t}=\mathbf{W}\cdot\mathrm{LSTM}(\mathbf{h}_{t-\delta})+\mathbf{b}

使用二值交叉熵损失。对于IPU结束任务,损失在每一帧计算;对于保持与(非保持)任务[brusco2023automatic],损失仅在有效的目标帧计算。我们使用Adam优化器(学习率10−310^{-3},批次大小16)训练固定轮数(200轮)。

这种设置确保严格的因果性:对于任何潜在的边界,模型只能访问过去的内部状态。我们报告AUC-ROC作为主要指标,作为延迟δ\delta的函数进行评估,以量化时间可达范围。

每个对话被视为一个数据实例。为了基于信道噪声、微调和偏置条件(第3.1节 (https://arxiv.org/html/2605.20356#S3.SS1))检验我们的假设,我们为每种组合训练一个探针,每个探针总共得到40个对话,因为一个模型配置将参与与两个不同对话者(默认和微调)以及二十个随机种子的对话。我们用32个对话进行训练,8个进行测试。未执行超参数调整。为了确保探针确实在学习,我们还使用打乱标签训练探针以估计随机水平性能。

## 4 实验结果

我们设计了两组实验来研究同步和话轮转换动态。所有实验均在3节描述的双代理模拟环境中进行。

相似文章

MoshiRAG:面向全双工语音语言模型的异步知识检索

arXiv cs.CL

MoshiRAG 将紧凑的全双工语音语言模型与异步检索增强生成相结合,在保持实时交互性的同时提高事实准确性。该方法利用对话中自然的时空间隙来检索外部知识,而不会打断对话的自然流程。