TurnNat:双人对话中轮流发言自然性的自动评估

arXiv cs.CL 论文

摘要

TurnNat是一种基于似然的框架,用于自动评估双人对话中的轮流发言自然性,它使用在自然对话上训练的因果轮流发言预测模型,通过负对数似然来测量时间异常性。

arXiv:2607.01345v1 公告类型:new 摘要:轮流发言自然性对于全双工对话系统至关重要,但对其自动评估仍十分有限。现有评估通常依赖人工判断或特定行为的时间度量,使得难以在统一框架内比较异质性时间错误。我们提出TurnNat,一种基于似然的框架,用于双通道对话中轮流发言自然性的自动评估。一个在自然对话上训练的因果轮流发言预测模型估计未来两个说话者的语音活动状态,观测到的未来活动的负对数似然(NLL)衡量时间异常性。TurnNat汇集从话语起始和结束提取的轮流发言边界单元(TBU)的帧级NLL,并将TBU的平均分和尾部分数聚合为对话级自然性分数。我们进一步构建了一个受控扰动基准,包含配对的自然和扰动对话片段,并通过人工自然性判断验证。在此基准上的实验表明,TurnNat能够成功识别跨异质性时间错误的不自然轮流发言扰动。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:39

# TurnNat: 双人对话中话轮转换自然度的自动评估
来源: https://arxiv.org/html/2607.01345
Hao Zhang1,†\\dagger, Thomas Thebaud1, Georgi Tinchev2, Venkatesh Ravichandran3, Laureano Moro\-Velázquez1,†\\dagger

###### 摘要

话轮转换自然度是全双工语音对话系统的核心,但其自动评估仍然有限。现有评估往往依赖人工判断或特定行为的时间度量,难以在统一框架内比较异质的时序失败模式。我们提出 TurnNat,一个基于似然的双通道语音对话话轮转换自然度自动评估框架。该框架使用在自然对话上训练的因果话轮转换预测模型,估计未来双说话人语音活动状态,并将观察到的未来活动的负对数似然(NLL)作为时序异常性的度量。TurnNat 从话语起始和偏移中提取的话轮转换边界单元(TBU)上汇集帧级 NLL,并通过汇总 TBU 的均值和尾部分数得到对话级自然度分数。我们进一步构建了一个受控扰动基准,包含成对的自然和扰动对话片段,并由人工自然度判断验证。在该基准上的实验表明,TurnNat 能够成功识别跨异质时序失败的不自然话轮转换扰动。

††footnotetext:代码和数据集已发布:https://github.com/TedZhangHao/turn\-taking\-naturalness

## I 引言

自然的口语对话依赖于流畅的话轮转换和恰当的对话时机。人类对话展现出异常精确的时间协调,话轮转换往往发生在仅几百毫秒的静默之后。这种协调要求参与者持续解读对话线索,预测即将完成的话语,并决定是保持、让出、给予反馈还是接过话轮。相比之下,许多语音对话系统仍然依赖启发式的话轮转换策略,例如固定的静默阈值,这常常导致响应延迟或过早打断,降低对话自然度[4 (https://arxiv.org/html/2607.01345#bib.bib2),25 (https://arxiv.org/html/2607.01345#bib.bib10)]。

随着语音对话系统从命令式语音界面转向实时语音到语音交互,其成功越来越依赖于它们如何自然地参与对话的时间流[13 (https://arxiv.org/html/2607.01345#bib.bib5),6 (https://arxiv.org/html/2607.01345#bib.bib3),9 (https://arxiv.org/html/2607.01345#bib.bib6),33 (https://arxiv.org/html/2607.01345#bib.bib7),32 (https://arxiv.org/html/2607.01345#bib.bib8)]。近年来的全双工语音模型旨在支持低延迟响应、重叠语音、打断和反馈,而不是将对话视为一系列孤立的话轮[6 (https://arxiv.org/html/2607.01345#bib.bib3),17 (https://arxiv.org/html/2607.01345#bib.bib39)]。这些交互行为不仅仅是表面上的时序细节:响应延迟影响感知的响应性和对话自然度[20 (https://arxiv.org/html/2607.01345#bib.bib32),23 (https://arxiv.org/html/2607.01345#bib.bib37)],而处理打断和反馈的能力会影响用户对语音助手的控制感、信任以及依赖意愿[19 (https://arxiv.org/html/2607.01345#bib.bib33),3 (https://arxiv.org/html/2607.01345#bib.bib34)]。这些特性对于部署在医疗支持、教育和客户服务等场景中的对话系统尤为重要,因为用户参与度和信任是有效交互的核心[5 (https://arxiv.org/html/2607.01345#bib.bib35),26 (https://arxiv.org/html/2607.01345#bib.bib36)]。近期的基准测试开始评估互动式口语对话行为,如停顿处理、反馈、话轮转换和打断管理[17 (https://arxiv.org/html/2607.01345#bib.bib39),2 (https://arxiv.org/html/2607.01345#bib.bib25)]。这些努力为口语对话模型提供了有价值的诊断,但其度量通常与特定的交互任务或行为类别绑定。这激发了一种互补的评估形式:在一个单一评分框架内自动度量话轮转换自然度,而不是用每个任务特定的度量来评估每个交互行为。

话轮转换预测模型为这种评估提供了一个自然的起点。这类工作从对话语境中估计即将发生的对话行为,包括话轮转换、停顿、重叠和反馈[29 (https://arxiv.org/html/2607.01345#bib.bib9),7 (https://arxiv.org/html/2607.01345#bib.bib21),8 (https://arxiv.org/html/2607.01345#bib.bib12)]。模型所使用的信号各不相同,从语言语境到语音和多模态线索[7 (https://arxiv.org/html/2607.01345#bib.bib21),8 (https://arxiv.org/html/2607.01345#bib.bib12),18 (https://arxiv.org/html/2607.01345#bib.bib23),30 (https://arxiv.org/html/2607.01345#bib.bib24)]。最近的工作如 DualTurn 也探索了双通道生成式语音预训练,其中模型通过预测双说话人未来的音频来学习对话动态[22 (https://arxiv.org/html/2607.01345#bib.bib29),31 (https://arxiv.org/html/2607.01345#bib.bib30)]。这类模型对于自然度评估很有用,因为它们被训练用于学习自然话轮转换动态的规律性。特别是,语音活动投影(VAP)将话轮转换公式化为未来双说话人语音活动预测,为评分对话时机提供了一个直接的概率目标[8 (https://arxiv.org/html/2607.01345#bib.bib12)]。因此,我们采用基于似然的话轮转换自然度观点。一个仅在自然对话上训练的模型定义了未来双说话人语音活动状态的分布。局部不自然的时序模式应使观察到的未来活动在该分布下变得不太可能。我们将话轮转换自然度定义为在自然对话动态下观察到的局部双说话人活动模式的似然。

在操作上,我们的评估框架 TurnNat 计算未来双说话人语音活动状态的帧级负对数似然。然后,我们在自动提取的话轮转换边界单元(TBU)上汇集这些值,以获得整体自然度分数。由于该分数在测试时不需要事件类型标签,相同的程序可以应用于不同的不自然事件,如延迟响应、过早进入、话轮转移错误和过多的反馈,所有这些都在一个共享的基于似然的评估框架内。我们构建了一个人工验证的话轮转换扰动基准,包含成对的自然和局部扰动对话片段。然后,我们用话轮转换预测模型实例化 TurnNat,并展示它能够成功识别跨异质时序失败的不自然话轮转换扰动。

我们的贡献有三点:

- • 我们提出 TurnNat,一个统一的基于似然的话轮转换自然度自动评估框架,使用在 TBU 上汇集的未来双说话人语音活动似然。
- • 我们构建了一个人工验证的话轮转换扰动基准,涵盖了自然人人双人口语对话中的五种局部话轮转换扰动。
- • 我们使用基于 VAP 和 DualTurn 的预测器实例化该框架,表明未来活动似然能够成功区分自然与扰动的时序模式,跨越异质的话轮转换失败。

## II 相关工作

### II\-A 话轮转换预测

话轮转换作为口语交互的核心机制已被长期研究,涉及话轮转换和保持、停顿、打断、重叠和反馈[29 (https://arxiv.org/html/2607.01345#bib.bib9)]。早期的计算方法通常关注特定的话轮转换决策,例如一个停顿应导致当前说话人保持话轮还是让给另一个说话人[27 (https://arxiv.org/html/2607.01345#bib.bib13),21 (https://arxiv.org/html/2607.01345#bib.bib14),14 (https://arxiv.org/html/2607.01345#bib.bib15)]。Skantze 后来提出了一个更一般的连续公式,使用递归神经网络随时间预测未来的语音活动,而不是仅做局部的保持或转换决策[28 (https://arxiv.org/html/2607.01345#bib.bib16)]。基于这种预测观点,最近的模型使用更丰富的对话语境和输入信号进行话轮转换预测。TurnGPT 从语言语境预测话轮转换,并显示句法和语用完整性为话轮转换预测提供了有用的线索[7 (https://arxiv.org/html/2607.01345#bib.bib21)]。基于语音的方法则直接从音频信号对对话时机进行建模。VAP 引入了未来双说话人语音活动预测作为话轮转换建模的自监督目标,使用语音活动检测(VAD)标签[8 (https://arxiv.org/html/2607.01345#bib.bib12)]。

后续工作将话轮转换预测模型扩展到跨语言、交互设置和输入模态。VAP 风格的模型已应用于多语种话轮转换、提示引导的对话时机,以及从流式立体声信号进行实时预测[11 (https://arxiv.org/html/2607.01345#bib.bib20),10 (https://arxiv.org/html/2607.01345#bib.bib22),12 (https://arxiv.org/html/2607.01345#bib.bib27)]。多模态和音频文本模型进一步整合视觉、声学和词汇线索用于话轮转换和反馈预测[24 (https://arxiv.org/html/2607.01345#bib.bib18),18 (https://arxiv.org/html/2607.01345#bib.bib23),30 (https://arxiv.org/html/2607.01345#bib.bib24)]。最近,DualTurn 探索了用于话轮转换预测的双通道生成式语音预训练,从双说话人音频中学习双人对话动态[22 (https://arxiv.org/html/2607.01345#bib.bib29)]。

总而言之,这些研究表明话轮转换预测模型可以学习关于双说话人对话行为的时序结构化期望。我们的工作将这些模型重新用于评估,使用未来活动似然作为话轮转换自然度的自动信号。我们通过 VAP 和适应相同未来活动预测目标的 DualTurn 来实例化这个想法。

### II\-B 话轮转换与口语对话自然度的评估

对话时机通常通过人工听测实验或用户研究进行评估,尤其是当目标是确定系统响应是否在合适的时间发生时。例如,Roddy 和 Harte[23 (https://arxiv.org/html/2607.01345#bib.bib37)] 对对话响应偏移进行建模,并通过离线实验和人工听测评估生成的时机,表明感知的时机自然度取决于对话语境。此类评估提供了直接的感知证据,但收集成本高昂,且难以作为开发阶段的度量。

近期针对全双工口语对话系统的基准测试引入了用于交互式话轮转换行为的自动诊断。Full-Duplex-Bench[17 (https://arxiv.org/html/2607.01345#bib.bib39)] 使用特定任务度量评估具体能力,如停顿处理、反馈、顺畅话轮转换和打断管理,包括接管率、反馈频率、时序分布和响应延迟。其后续基准将这一设置扩展到重叠密集的场景,测量系统如何响应用户的打断、反馈、旁白和周围语音[16 (https://arxiv.org/html/2607.01345#bib.bib40)]。Talking Turns[2 (https://arxiv.org/html/2607.01345#bib.bib25)] 采用以时机为中心的事件决策方法:它在人人对话上训练一个监督判断器来预测离散的话轮转换事件标签,然后应用特定事件的阈值来评估对话系统在人机交互中是否在适当时刻发言、继续、反馈、打断或让出话轮。

这些基准提供了系统能力的有用诊断,但其度量围绕单独的行为、事件决策或交互场景来组织。我们的工作则在共享的连续评分空间中评估整体话轮转换自然度。我们不是为每个事件类型定义不同的阈值化决策规则,而是使用相同的未来双说话人语音活动似然公式来评分异质时序失败。

## III 方法

参见图注图1: TurnNat 框架概述。TurnNat 首先从双通道对话中提取基于 VAD 的话轮转换边界单元,然后使用因果话轮转换预测模型在这些单元内的帧上为未来双说话人语音活动状态分配似然。得到的帧级 NLL 通过均值和尾部项进行汇总,得到对话级话轮转换自然度分数,然后校准到人类偏好判断。

### III\-A 问题形式化

我们研究双通道口语对话中话轮转换自然度的自动评估。设 x=\(x^{(1)},x^{(2)}\) 表示一个对话片段,其中 x\(^{1}\) 和 x\(^{2}\) 分别对应说话人 1 和说话人 2 的音频通道。

设 f\_θ 表示一个参数为 θ 的话轮转换预测模型。对于每个帧 t,模型利用可用的对话语境 x\_{≤t} 来估计观察到的未来双说话人语音活动状态 c\_t 的似然。TurnNat 将此似然转换为帧级负对数似然值,并将它们汇集成一个对话级的话轮转换自然度分数 m\_θ(x) ∈ ℝ,其中较高的值表示更自然的通话轮转换。TurnNat 在推理时不需要人工判断、扰动标签或手动标注的话轮转换事件。图 1 (https://arxiv.org/html/2607.01345#S3.F1) 详细展示了整个 TurnNat 框架。

### III\-B 话轮转换边界单元

TurnNat 通过话轮转换边界单元(TBU)对局部时序行为进行评分,这些单元是从清理后的双说话人语音活动序列中提取的。我们首先识别每个说话人通道中的连续活跃区域,并将其视为话语候选。为去除虚假的 VAD 片段同时保留短反馈事件,我们只保留时长至少为 200ms 的区域,以保留简短的反馈。

对于每个保留的话语候选,我们定义两个 TBU:一个关联于话语起始,一个关联于话语偏移。对于一个边界时间 τ\_j,相应的 TBU u\_j 包含前边界区间 [τ\_j - L, τ\_j] 内的帧,其中 L = 2s。

对于一个对话片段 x,我们提取所有 TBU U(x) = {u\_j}\_{j=1}^{J},其中 J 是总数。设 T(u\_j) 表示单元 u\_j 中包含的帧的集合。我们定义所有 TBU 帧的集合如下:

TTBU(x) = ⋃\_{u\_j ∈ U(x)} T(u\_j). (1)
尽管评分帧是在边界之前选择的,但每个帧随后通过一个未来时间范围内的双说话人语音活动预测进行评估。因此,一个 TBU 覆盖了起始或偏移周围的局部话轮转换区域。

相似文章

Context-Agent: 用于非线性对话的动态话题树

arXiv cs.CL

Context-Agent提出了一种新颖框架,将多轮对话历史建模为动态树结构而非扁平序列,更好地捕捉自然对话的层级性和分支性特征。该论文引入NTM基准来评估非线性对话场景,并展示了在各种LLM上的任务完成率和令牌效率的提升。

Hy-MultiTurn:面向深度多轮对话理解的六维基准

arXiv cs.CL

介绍了 Hy-MultiTurn,一个用于深度多轮对话理解的中文基准,评估了 22 个前沿模型,涵盖六种受控模式(约束记忆、精确执行、约束合成、对象定位、动作抑制、指代消解),共 209 个任务,对话轮次从 12 轮到 76 轮不等。即使是最强的模型 GPT-5.5,也仅能满足 41.1% 的响应要求。