Real-TurnTurk:一个用于话轮转换预测的多模态土耳其语语料库
摘要
本文介绍了Real-TurnTurk,这是一个用于话轮转换预测的多模态土耳其语对话数据集,包含同步的视频、音频和转录文本。它使用遗传算法来优化可解释的决策规则,以预测自然对话中的话轮转换。
arXiv:2608.22071v1 公告类型:新
摘要:话轮转换是人类对话的一个基本组织特征,在自然、同步的对话系统中仍然难以建模。尽管现有研究已经探索了多模态方法和大语言模型在预测话轮结束方面的应用,但专门针对土耳其语话轮转换动态的自然对话语料库仍然缺乏。本研究引入了一个多模态土耳其语对话数据集,包含未经编排的双向互动,该数据集由同步的正面视频、可将重叠语音归因于单个说话者的每位说话者音频通道,以及时间对齐的转录文本组成。话轮转换预测被表述为一个二元分类问题,并采用遗传算法(GA)来优化从视觉、声学和语言特征中得出的可解释决策规则。所提出的框架采用了混合AND-OR规则表示法,以表示在话轮转换之前的替代线索组合。
查看缓存全文
缓存时间: 2026/08/25 04:24
# Real-TurnTurk:一个用于轮次交接预测的多模态土耳其语语料库
来源:https://arxiv.org/html/2608.22071
\[\]
Ahmet Tuğrul Bayrak所属机构:土耳其伊斯坦布尔Ata Technology Platforms数据科学与创新部门 tugrul\.bayrak@atptech\.com Fatma Nur Korkmaz所属机构:土耳其伊斯坦布尔Ata Technology Platforms数据科学与创新部门 fatmanur\.korkmaz@atptech\.com Bekir Berker Türker所属机构:土耳其伊斯坦布尔Ata Technology Platforms数据科学与创新部门 berker\.turker@atptech\.com Mustafa Sertaç Türkel所属机构:土耳其伊斯坦布尔Ata Technology Platforms数据科学与创新部门 sertac\.turkel@atptech\.com Alper Kaplan所属机构:卢森堡国家研究基金数字运营与数据部 alper\.kaplan@fnr\.lu
###### 摘要
轮次交接是人类对话的一项基本组织特征,在自然、同步的对话系统中建模仍然困难。虽然现有研究已探索了用于结束轮次预测的多模态方法和大语言模型,但缺乏专门针对土耳其语轮次交接动态的自然对话语料库。本研究引入了一个多模态土耳其语对话语料库,包含即兴的双人交互数据,其构成包括:同步的正面视频、可用于将重叠语音归因于特定说话者的每说话人音频通道,以及时间对齐的转录文本。轮次交接预测被表述为一个二元分类问题,并采用遗传算法(GA)来优化从视觉、声学和语言特征中提取的可解释决策规则。在所提出的框架中,采用了一种混合的AND-OR规则表示法,以表示轮次转换前可能出现的多种线索组合。
###### 索引术语:
轮次交接预测、预测建模、多模态、数据生成、规则优化、遗传算法
已被INTCEC 2026接收。此为作者预印本版本。最终认证版本将通过会议论文集提供。
## I 引言
基于大语言模型(LLMs)构建的口语对话系统现已广泛部署,然而,几个交互层面的问题仍未得到解决。许多当前系统依赖静音检测来判断轮次完成:系统在预设的静音时段后假定用户已停止说话。其核心局限在于人类语音的多样性:有些说话者快速连续发言,停顿极少,而另一些则需要更长时间的间隔来组织思维,同时并不让出轮次。当系统误判这些线索并过早转换时,就会出现语音重叠,对话同步性随之下降。
Sacks等人[1 (https://arxiv.org/html/2608.22071#bib.bib1)]引入了轮次构建单位(TCUs)和转换关联位置(TRPs),这一框架至今仍指导着计算和实证研究。静音时长和轮次偏移承载着副语言意义,并反映了个人的对话风格,简单的声学阈值无法可靠地区分保持/转换[2 (https://arxiv.org/html/2608.22071#bib.bib2), 3 (https://arxiv.org/html/2608.22071#bib.bib3)];对话上下文和任务类型也会进一步改变轮次交接动态,这表明从结构化引导任务中得出的指标可能无法推广到自然对话[4 (https://arxiv.org/html/2608.22071#bib.bib4)]。
在计算建模方面,标准指标通常无法捕捉响应延迟与误打断之间的实时权衡[5 (https://arxiv.org/html/2608.22071#bib.bib5)],而综述则强调缺乏标准化的多语言基准测试仍然是一个重大限制[6 (https://arxiv.org/html/2608.22071#bib.bib6), 7 (https://arxiv.org/html/2608.22071#bib.bib7)]。连续、帧级的公式正日益被用于替代静音阈值:多尺度循环模型从多模态流中预测即将发生的语音活动[8 (https://arxiv.org/html/2608.22071#bib.bib8)],而Voice Activity Projection则从未来的语音活动中以自监督方式学习轮次交接事件,其实时变体现已嵌入增量对话系统[9 (https://arxiv.org/html/2608.22071#bib.bib9), 10 (https://arxiv.org/html/2608.22071#bib.bib10)];全双工语音基础模型将轮次管理集成到了生成模型本身中[11 (https://arxiv.org/html/2608.22071#bib.bib11)]。虽然语言模型和词汇句法特征改进了文本场景下的结束轮次预测[12 (https://arxiv.org/html/2608.22071#bib.bib12), 13 (https://arxiv.org/html/2608.22071#bib.bib13)],但据报告,音频、文本和手势的多模态融合优于单模态基线[13 (https://arxiv.org/html/2608.22071#bib.bib13), 14 (https://arxiv.org/html/2608.22071#bib.bib14)]。参与特征和用户能力等社会动力学因素进一步影响了对话公平性,这促使了自适应模型的出现[15 (https://arxiv.org/html/2608.22071#bib.bib15), 16 (https://arxiv.org/html/2608.22071#bib.bib16)]。
土耳其语的对话资源已扩展到情感分析和合成轮次交接数据集[17 (https://arxiv.org/html/2608.22071#bib.bib17), 18 (https://arxiv.org/html/2608.22071#bib.bib18)];然而,具有主要轮次交接标注的自然主义土耳其语语料库仍然存在空白。本研究引入了这样一个包含即兴双人交互的语料库,其特点是包含同步视频、大多数交互中的每说话人音频通道以及时间对齐的转录文本,并使用遗传算法优化基于每种模态特征的规则,以检测轮次转换点。
## II 数据
该数据集包含11段即兴的双人交互,总时长4.23小时(253.6分钟),包含同步的VTT文本、WebM音频和MP4视频。交互录制使用每说话人一个48 kHz的WebM文件,这使得重叠语音能够可靠地归因于单个说话者。视频分辨率为1920×1080,帧率为16 fps,两位参与者分别占据画面的左半部分和右半部分。转录文本包含5,383个语音片段和35,728个单词,带有毫秒级精度的时间戳和说话者标签。
在总时长中,222.1分钟(87.6%)是语音,31.5分钟(12.4%)是非语音。由于重叠语音对双方都进行了计数,因此说话者的总发言时间为231.4分钟;这是计算表II (https://arxiv.org/html/2608.22071#S2.T2)百分比所依据的参考总量,而同一表格中的单词百分比则是基于35,728个单词的总量计算。根据II-A节 (https://arxiv.org/html/2608.22071#S2.SS1)的标准,共标注了1,750个轮次交接实例(排除了反馈信号作为正例),以及3,500个采样的负例。每次对话的统计数据见表I (https://arxiv.org/html/2608.22071#S2.T1),每位说话者的统计数据见表II (https://arxiv.org/html/2608.22071#S2.T2)。
说话者代表性并不均衡。如表II (https://arxiv.org/html/2608.22071#S2.T2)的“对话次数”列所示,有两位作为重复的对话者:user_01参与了5次对话,user_03参与了6次。这两位从未与对方对话,且每次对话中恰好包含他们中的一人;他们两人共同占据了60.8%的单词和60.1%的发言时间。其余人中,user_04和user_06各出现两次,其他人出现一次。这种录音设计(两位说话者作为重复的对话者)造成了说话者层面的不平衡,并直接制约了交叉验证方案(第IV-C节 (https://arxiv.org/html/2608.22071#S4.SS3))。数据集的一个子集可在Hugging Face上获取:https://huggingface\.co/datasets/tugrulbayrak/Real\-TurnTurk。
表 I:按对话统计
### II-A 轮次标注
轮次转换是指当前说话者结束、下一位开始说话的时刻。轮次转换通过VTT转录文本的半自动程序识别:解析线索、将携带相同说话者标签的连续线索合并为单个连续轮次、检测合并后轮次之间的说话者转换,并应用基于规则的过滤器将真正的轮次与反馈信号分离。合并是必要的,因为来自同一说话者的顺序线索是分割的人为产物,不应计为转换。如图1 (https://arxiv.org/html/2608.22071#S2.F1)所示,只有当同时满足四个标准时,一次转换才被视为轮次转换:
TurnChange\(t\)=1⇔\(Si≠Si\+1\)∧\(di\+1≥0\.5s\)∧\(Ti\+1∉FillerWords\)∧\(len\(Ti\+1\)\>3\)\\text\{TurnChange\}\(t\)=1\\iff\\begin\{aligned\} &\(S\_\{i\}\\neq S\_\{i\+1\}\)\\\\ &\\land\(d\_\{i\+1}\\geq 0\.5s\)\\\\ &\\land\(T\_\{i\+1\\notin\\text\{FillerWords\}\)\\\\ &\\land\(\\text\{len\}\(T\_\{i\+1\}\)\>3\)\\end\{aligned\}\(1\)
其中,t表示片段i\+1的起始时间;Si和Si\+1分别表示当前片段和后续片段的说话者;di\+1是后续片段的持续时间;Ti\+1是其文本内容,len(⋅)以字符数计。
- 说话者:后续片段必须来自不同的说话者。
- 持续时间:应用0.5秒阈值,因为土耳其语中最小的反馈信号(如“hıhı”、“mm”)通常持续时间低于0.5秒,而真正的轮次发起则更长。
- 内容:文本为土耳其语填充词,或表面形式为三个字符或更少的片段,被排除为确认信号。
- 时间:时间戳固定在新说话人片段的起始点,为特征提取提供精确的参考点。
图 1:轮次标注流程。标注的两个标准(持续时间和填充词状态)与优化器可用的语言特征(word\_duration, is\_filler)重叠,这可能使规则能够复现标注函数而非对话结构。然而,两者是在不重叠的语音上计算的:公式(1)在*进入的*片段i\+1上评估,而特征则覆盖t之前2.0秒的窗口,即*当前说话人*的部分。这也是为什么is\_filler可以作为一个积极的预测因子,尽管填充词被排除在正标签之外:这些出现指的是不同的说话者。
3,500个负例是从所有满足特征提取要求但未被标注为轮次转换的点中均匀随机选取的,每个正例周围都有±1.0秒的排除缓冲区,以确保相邻窗口不会跨类别泄露信息。采样按对话比例分层,比例依据持续时间,随机种子为42。反馈信号的起始点通过公式(1)从正例中排除;它们可以作为负例。由于语料库的12.4%是非语音,大多数负例位于持续的语音段内,而非停顿中。1:2的比例是预先固定而非调整的。
重叠语音并未被排除在分析之外。81.4%的标注转换包含某些重叠,这可以在九个具有分离通道的交互中按说话者进行测量。
表 II:说话者贡献统计
## III 特征生成
总共从每个候选轮次转换点之前的2秒分析窗口中提取了28个特征。表III (https://arxiv.org/html/2608.22071#S3.T3)列出了所有特征及其单位和观察到的范围。所有28个特征描述的都是当前说话者,即在t之前2.0秒窗口内持有轮次的参与者。
表 III:特征详情
### III-A 视觉特征
9个特征捕捉面部活动、凝视行为、头部运动和表现力:面部标志点运动幅度、动作单元(AU)强度变化、眨眼率、凝视方向变化率、嘴部张开度变化、头部旋转、头部平移、眉毛位移和嘴角拉伸。说话者通常在让出轮次之前表现出预期信号,例如移开视线、点头或面部活动强度下降。
### III-B 声学特征
12个特征代表韵律和频谱特性:平均基频(F0)及其变异系数和范围缩放变体;均方根能量的平均值、标准差和每秒平均绝对变化;频谱质心、85%滚降点、带宽和对比度;有声帧比率;以及起始率。能量的突然下降或音高轮廓的变平通常与完成的轮次相关。
### III-C 语言特征
7个特征捕捉词汇、句法和语篇属性:窗口内的平均词长和平均每词音节数;三个二元指示符用于判断最后一个词是否为填充词、窗口是否包含疑问词、以及是否包含肯定词;一个指示即时单词重复的二元指示符;以及一个句法完整性评分。填充词和不完整的结构通常伴随着继续发言,而疑问句和完整的结构则标志着潜在的转换。
### III-D 提取工具与窗口化
每一帧被分割为对应两位参与者的左半部分和右半部分,并且每个裁剪区域独立处理。使用MediaPipe Face Mesh [19 (https://arxiv.org/html/2608.22071#bib.bib19)]获取面部标志点、头部姿态、眼睛长宽比和嘴部长宽比,使用Py-Feat [20 (https://arxiv.org/html/2608.22071#bib.bib20)]获取AU强度;16 fps的帧值通过均值和标准差进行聚合。视觉特征仅从当前说话者的裁剪区域计算。不使用倾听者的裁剪区域是一个局限,因为倾听者的凝视和点头是公认的转换线索。声学特征是eGeMAPSv02集 [21 (https://arxiv.org/html/2608.22071#bib.bib21)],使用openSMILE [22 (https://arxiv.org/html/2608.22071#bib.bib22)]在每位说话者自己的通道上以10毫秒帧提取,该工具也提供F0;起始点和结束点由Silero VAD [23 (https://arxiv.org/html/2608.22071#bib.bib23)]获得,单词时间对齐由wav2vec 2.0强制对齐 [24 (https://arxiv.org/html/2608.22071#bib.bib24)]提供。每个窗口覆盖t之前的2.0秒;在t时刻或之后的信息不进入特征向量。未应用特征缩放。阈值直接从训练分区上每个特征的观察范围中采样,这避免了测试分区统计数据进入搜索过程。遗传算法使用DEAP [25 (https://arxiv.org/html/2608.22071#bib.bib25)]实现。
## IV 方法
### IV-A 问题表述
该任务是一个二元分类问题:给定对话事件前两秒窗口的特征向量,判断当前说话者是即将让出轮次(1)还是继续发言(0)。该框架针对的是可解释且评估成本足够低廉、可用于实时系统的规则,并且优先考虑透明度,而非与黑盒分类器进行基准比较。轮次转换并非假定遵循单一线索:说话者可能在完成一个问题后、在某种特征性韵律模式后、或在特定视觉行为后让出轮次。因此,模型必须表示多种替代路径,这促成了下文所述的混合AND–OR表示法。
### IV-B 基于遗传算法的规则优化
遗传算法是基于种群的进化搜索方法 [26 (https://arxiv.org/html/2608.22071#bib.bib26), 27 (https://arxiv.org/html/2608.22071#bib.bib27)],非常适合于规则学习所引发的特征–阈值–算子组合的组合空间。每个个体将一条完整的规则编码为一个条件序列;每个条件贡献一个特征、一个数值阈值、一个比较算子(≥, ≤, ==)和一个逻辑算子(∧, ∨)将其与相似文章
TurnNat:双人对话中轮流发言自然性的自动评估
TurnNat是一种基于似然的框架,用于自动评估双人对话中的轮流发言自然性,它使用在自然对话上训练的因果轮流发言预测模型,通过负对数似然来测量时间异常性。
从文本到多模态交互的多轮对话人工智能:数据、模型、评估与开放挑战
本文综述了涵盖文本、音频和多模态系统的多轮对话人工智能,分析了数据集、建模范式和评估方法,同时强调了关键挑战,如持久记忆和跨轮次对齐。
When2Speak: 面向大语言模型的多方对话时序参与与话轮转换数据集
When2Speak是一个合成数据集及流程,用于训练LLM在多方对话中决定何时发言。在该数据集上微调显著改善了话轮转换,强化学习将漏干预率从50%降至约20%。
MoganColBERT-TR:一个用于土耳其语的后交互多向量检索模型
本文介绍了MoganColBERT-TR,一个用于土耳其语的后交互多向量检索模型,通过从先前编码器进行蒸馏训练,在土耳其语BEIR数据集上实现了具有竞争力的零样本性能。
利用轮次交替动态增强多方对话中的意图识别
本文提出了一种多任务学习方法,通过利用轮次交替动态来增强多方对话中的意图识别,其性能优于忽略交互模式的现有方法。