人类与分类模型在语码转换语音中的协同行为跨语言比较

arXiv cs.CL 论文

摘要

本文对普通话-英语、印地语-英语和西班牙语-英语的语码转换对话中的协同行为进行了跨语言分析,发现词汇协同具有泛化性,而声学韵律和风格协同则表现出差异。同时评估了分类模型捕捉这些行为的能力,结果显示模型优先考虑的特征与人类不同。

arXiv:2607.25202v1 公告类型:新 摘要:对话协同在单语和书面语境中已有充分研究,但在口语语码转换(CSW)中仍探索不足。我们提出了一种针对普通话-英语、印地语-英语和西班牙语-英语对话中协同行为的跨语言分析,结果表明,虽然词汇协同在语言对间具有泛化性,但声学韵律和CSW风格方面的协同表现出上下文特定的差异。我们进一步探究分类模型是否能捕捉这些人类行为模式。通过特征重要性和消融分析,我们发现基于经典和Transformer的分类器能够较好地检测协同,但它们始终优先考虑与人类协同行为最相关的特征不同的其他特征。我们的方法引入了一个以人为基础的框架,用于评估多语言风格语境中的模型决策,并为开发能够生成自然语码转换语音的对话代理提出了未来的挑战。
查看原文
查看缓存全文

缓存时间: 2026/07/29 09:54

# 代码转换语音场景中人类与分类模型协同行为的多语言比较
来源: https://arxiv.org/html/2607.25202

Siying Ding¹, Alayna Nguyen²(本科毕业于哥伦比亚大学), Julia Hirschberg¹  
¹ 哥伦比亚大学计算机科学系  
² Instagram  

###### 摘要  
会话协同在单语和书面语境中已被广泛研究,但在口语代码转换(CSW)中仍探索不足。我们首次对普通话-英语、印地语-英语和西班牙语-英语对话中的协同进行跨语言分析,结果表明:词汇协同在不同语言对之间具有普遍性,但声学-韵律和代码转换风格方面的协同则表现出语境特定差异。基于这些发现,我们进一步探究分类模型是否捕捉到了这些人类行为模式。通过特征重要性和消融分析,我们发现经典分类器和基于Transformer的分类器虽能较好检测协同,但始终优先关注那些对人类协同行为最不突出的特征。我们的方法引入了一个以人类行为为基准的框架,用于评估模型在多语言风格语境中的决策过程,并为未来开发能生成自然代码转换语音的对话智能体提出了挑战。

# 代码转换语音场景中人类与分类模型协同行为的多语言比较
Debasmita Bhattacharya¹††thanks:通讯作者:[email protected], Siying Ding¹, Alayna Nguyen²(本科毕业于哥伦比亚大学), Julia Hirschberg¹  
¹ 哥伦比亚大学计算机科学系  
² Instagram  

## 1 引言  
当说话者相互"协同"时,每个人都会下意识地将对话者的交流风格特征融入自己的语言产出中,协调用词、句法、语速、音质、停顿甚至面部表情和手势等方面。这一交互式多模态现象塑造了对话动态,通过确保相互理解、建立融洽关系并给对话者留下良好印象,从而促进成功沟通。虽然大多数现有协同研究聚焦于单语(尤其是英语)交流,但过去十年中,越来越多研究开始关注其他语言和多语言环境中的协同。在代码转换协同研究中(说话者交替使用至少两种语言变体时进行适应),大多数分析仅涉及少数语言对,最常见的是西班牙语-英语。尽管一些研究纳入了更多语言语境并对书面代码转换中的词汇协同进行了跨语言比较,但在口语领域此类研究仍然很少,这促成了本工作。我们探索普通话-英语、印地语-英语和西班牙-英语口语代码转换对话的会话动态,通过跨语言比较验证并拓展先前工作(如Bhattacharya等人2024a),将其置于更广泛的语言语境中。我们首先询问口语代码转换中的协同模式是否在不同语系、不同类型距离和文化背景的语言对之间保持一致。在此基础上,我们进一步询问协同检测模型是否关注人类在自然代码转换交流中使用的相同协同特征。我们发现:(1)跨语言对的协同模式总体上具有一致性多模态特征,但存在反映语言和文化特性的细微差异;(2)分类器模型虽然能较好检测不同会话粒度和语言对下的协同,但相对于人类而言,它们似乎没有使用最相关的协同特征。我们的方法表明,经验验证的人类行为模式为探究分类模型为何以及如何检测风格现象提供了有价值的视角,这对理解协同之外的风格任务也有启示。本工作是首次跨语言验证口语代码转换(CSW)协同模式,并利用这些模式作为评估分类器行为的人类基准框架。总之,我们的贡献如下:

- • 我们将Bhattacharya等人(2024a)在西班牙语-英语中应用的协同方法扩展到新的普通话-英语和印地语-英语环境中,并通过三个语料库的统计协同模式进行跨语言比较。
- • 我们分析模型的特征重要性归因和消融行为,不仅评估模型是否能检测协同,还突出它们在检测时的依据。
- • 我们发布了MaSaC语料库的手动标注版本,新增代码转换风格标签,以支持口语代码转换的进一步研究。

## 2 相关工作与研究问题  

#### 代码转换语境中的协同。  
我们的工作直接建立在Bhattacharya等人(2024a)的研究基础上,他们研究了Bangor Miami(BM)语料库中自然西班牙语-英语会话的词汇、声学-韵律和多语言风格协同。作者应用了Levitan和Hirschberg(2011)的分析框架,该框架区分了话轮级和会话级协同,并将接近度、收敛性和同步性定义为口语协同行为的独特表现(定义见附录A.3)。Bhattacharya等人调整了这一框架以研究代码转换方面和声学-韵律特征的协同,同时采用基于显著词类和困惑度的方法来检验BM语音中的词汇协同。他们发现单语领域的协同趋势出现在代码转换语言产出中,并出现了口语CSW特有的新模式,但未检验这些发现是否适用于西班牙语-英语以外的语言对。其他工作如Bawa等人(2018)和Parekh等人(2020)分别研究了印地语-英语代码转换环境中的协同,前者关注语音转录本的词汇表征,后者关注人机生成的书面交流。虽然这两项研究都与西班牙语-英语CSW中的协同模式进行了比较,但仅限于书面模态,这引出了我们的第一个研究问题:

**RQ1:口语代码转换的协同模式在多大程度上可跨不同语言对进行泛化?**

为回答RQ1,我们基于BM中西班牙语-英语的现有工作,并额外关注普通话-英语和印地语-英语;这四种语言共同代表了世界上使用最广泛的语言。

#### 人类与多语言模型行为的比较。  
近期研究提出了解释多语言语言模型分类(并生成)类似人类语言风格和交互动态能力的框架。我们特别强调Havaldar等人(2023)的工作,他们创建了多语言礼貌词汇表,并将模型编码产生的特征重要性值与人类产出进行了比较。这类工作指导了我们的第二个研究问题:

**RQ2:分类器模型在多大程度上关注人类在代码转换语音中进行协同所使用的协同特征?**

为回答RQ2,我们检查了一系列经典和基于Transformer的机器学习分类器,通过跨语言对的二元协同检测来分析每种环境下的特征重要性。

## 3 语料库  

表1:每个数据集相关语料库统计摘要。  

我们检查三个非正式多语言语音语料库。第5.1节聚焦于SEAME语料库(自然普通话-英语对话)和MaSaC语料库(印地语-英语情景喜剧电视语音),并与Bangor Miami语料库(西班牙语-英语自然对话)进行比较。¹¹¹参见附录A.1了解每个语料库的许可细节。第5.2节分析所有三个语料库,它们包含来自两个或多个说话者之间对话的录制并转录的单语和代码转换语句。语料库覆盖共同主题,例如日常生活、人际关系和学术/职业问题。与SEAME和BM不同,MaSac不是自然发生的语音。然而,剧本式电视对话旨在听起来自然,因此适合作为研究协同等自然现象的代表,尤其是在缺乏其他体裁匹配、公开可用的印地语-英语语言对语音数据的情况下。BM和SEAME都包含语句级标注,用于识别代码转换和单语语句,并区分简单插入型(I)代码转换、复杂交替型(A)代码转换和“其他”(O)策略(类似于标签转换)。我们为MaSaC添加了相同类型的标签。首先,我们使用微软的开源语言识别工具²²²https://github.com/microsoft/LID-tool 获取MaSaC语音转录中罗马化印地语和英语的令牌级LID标签,并据此推断语句级语言标签:代码转换 vs. 单语英语或印地语。然后,我们为多语言语句添加CSW策略的手动标注。所有策略标签由第一作者创建并由一名志愿硕士生核实,未出现分歧。两位均具备英语母语水平;前者具备中级印地语理解能力,后者是印地语母语者。我们发现MaSaC中92%的代码转换语句使用插入型CSW,14%使用交替型,不到1%使用“其他”类型。这一策略分布与BM(72% I, 13% A, 18% O)和SEAME(89% I, 12% A, 7% O)相当。我们在表1中总结了其他语料库统计信息。为便于直接与BM中39个对话的已知双人协同模式进行比较,我们将SEAME和MaSac过滤为仅包含两个说话者之间、且两人都有语音音频和对应转录本的对话。我们仅保留包含4个或更多话轮的对话,以确保会话长度足以进行会话级协同计算(第4.1节)。因此,我们在后续分析中使用了SEAME的40%(34个对话中的42,893个语句)和MaSac的25%(334个对话中的1,623个语句)。

## 4 方法  

### 4.1 计算代码转换协同  

为对普通话-英语和印地语-英语CSW进行协同的统计分析,我们复现了Bhattacharya等人(2024a)的方法,此处总结并在附录A.3中详细说明。  
词汇特征集包括四类已知在自然对话中常被使用和协同的词类:语料级最高频词(前100和前25)、会话级最高频词(前25)、肯定提示词和填充语(附录A.2列出了每个语料库的肯定提示词和填充语)。此外,通过基于每个说话者转录本、使用KenLM工具训练的Kneser-Essen-Ney平滑三元语言模型的困惑度,来操作化说话者之间整体语言使用的广泛相似性。  
声学-韵律特征集涵盖语句级的音高、强度、抖动、闪烁、谐噪比(HNR)以及以每秒音节数计量的语速。所有声学-韵律特征通过Parselmouth提取,使用默认参数值,并按说话者进行z-score归一化。  
语句级CSW风格指标包括:CSW存在(二元标志)、连续CSW比率(通过语句长度归一化切换频率),以及正在使用的CSW策略(I、A或O)的分类标签(如有)。  
我们通过话轮级和会话级的接近度、收敛性和同步性来研究声学-韵律和CSW风格特征的协同,遵循Levitan和Hirschberg(2011)的操作化定义,经Bhattacharya等人(2024a)改编。

相似文章

面向中英文混合语音识别的音频大语言模型直接偏好优化

arXiv cs.CL

本文应用直接偏好优化(DPO)来对齐音频大语言模型,以转录中英文混合语音,在分布内实现了高达89.6%的MER降低,在分布外实现了20%的降低。它识别出三种失败模式——语言遗漏、翻译替代转录以及幻觉——并表明基于偏好的对齐能有效激发多语言音频大语言模型的正确混合转写行为。

大型语言模型中的句子级上下文夹带

arXiv cs.CL

本文将上下文夹带从标记级扩展到句子级,表明提示中的反事实句子在推理时也会增加其概率。该效应随模型规模增大而减弱,且由2-4%的注意力头驱动,这些注意力头可被消融而不影响性能。