使用嵌入预测普通话单音节词的口语时长和音高
摘要
本研究探讨了来自大型语言模型的上下文嵌入是否能预测普通话单音节词的口语时长和音高轮廓,结果表明其预测能力高于随机水平,并能将归一化基频轮廓反变换回毫秒时间尺度。
arXiv:2607.02002v1 公告类型:新
摘要:时间归一化的普通话词语在会话语音中的基频轮廓已被证明部分可由其上下文嵌入(CEs)预测。本研究探讨了CEs是否能预测从普通话自发音语语料库中提取的7470个普通话单音节CV词的口语时长。我们表明,CEs确实能预测时长,且高于随机水平,不仅在类型层面,而且在单个词例层面,通过按类型和按词例的置换基线获得的结果也证实了这一点。我们还表明,预测的时长足够精确,可以将预测的[0,1]归一化时间基频轮廓反变换到毫秒时间尺度。最终获得的预测轮廓接近经验轮廓,并且优于置换基线。
查看缓存全文
缓存时间: 2026/07/03 05:42
# 使用嵌入预测普通话单音节词的口语持续时间和音高 来源:https://arxiv.org/html/2607.02002 Jin, Ernestus, Baayen ###### 摘要 研究表明,会话语音中普通话词汇的时间归一化 f0 轮廓部分可以从其上下文嵌入 (CEs) 中预测。本研究探讨了从普通话自发言语语料库中提取的 7470 个普通话单音节 CV 词汇的 CEs 是否也能预测其口语持续时间。我们表明,CEs 确实对持续时间具有预测能力,且高于随机水平,这不仅体现在类型层面,也体现在单个词汇层面——这一结论由类型层面和词汇层面的排列基线结果所支持。我们还表明,预测的持续时间足够精确,可以将 [0,1] 归一化时间内的预测 f0 轮廓反向转换为毫秒时间尺度上的轮廓。由此得到的预测轮廓接近经验轮廓,并且也优于排列基线。 ###### 关键词: 持续时间,普通话音高,上下文嵌入,判别型词汇模型 ## 1 引言 韵律涉及词汇元音和辅音之外的语音特性,例如口语持续时间、f0 轮廓和突出度[cole2015prosody]。韵律特征的实现受多种因素影响,如相邻词的韵律特性[shen1990prosody]、内部和外部变调过程[shih1986prosodic,niebuhr2011segment]、使用频率[gahl2008time]、词类[lohmann2018cut]、语速[tseng2004speech]、形态句法功能[plag2015homophony]以及说话者的情绪状态[frick1985communicating]。 关于口语持续时间,先前工作[gahl_time_2024]表明,英语同音词的口语持续时间(一种典型的韵律特征)在很大程度上可以从这些同音词的意义中预测,同时控制了其他多种韵律变量以及固有音段持续时间。该研究使用分布语义学中的嵌入来操作化词义,并利用判别型词汇模型 (DLM)[Heitmeier:Chuang:Baayen:2025] 量化了词汇音段从其嵌入中获得的支撑量,报告称这种支撑是口语持续时间的强预测因子,独立于词频和概率度量。 基于英语的这些结果,本研究探讨普通话中词义是否也具有预测口语持续时间的能力。与使用标准词嵌入来代表同音词类型意义[gahl_time_2024]不同,本研究将这一研究方向向前推进了一步:考虑使用大型语言模型获得的上下文嵌入(作为词汇在话语语境中意义的近似表示)是否也能预测词汇的口语持续时间。 已有报告指出,嵌入不仅对(英语的)口语持续时间具有预测能力,也对普通话[Chuang:Bell:Tseng:Baayen:2024,lu2025realization] 和英语[chuangwords] 的 f0 轮廓具有预测能力。这些研究使用广义加性模型 (GAM)[wood2017generalized] 将经验语料中提取的音高轮廓分解为与多种语言变量(包括说话者、语速、相邻声调、句子位置以及停顿的有无)相关的成分轮廓。在这些研究中,出现了与词汇类型相关的强 f0 成分,表明词汇在 f0 轮廓中可能拥有自己特有的声调特征。完整的经验轮廓还携带了一系列与其他韵律因素相关的成分特征[Chuang:Bell:Tseng:Baayen:2024,lu2025realization]。 上述研究利用 DLM 表明,这些词汇特有的音高特征可以从其词汇的上下文嵌入中预测。给定一个 n×k 矩阵 S,代表 n 个词汇的 k 维上下文嵌入,以及一个 n×m 矩阵 C,包含词汇的时间归一化 f0 轮廓,通过解 SW=C 估计出线性映射 W,从而获得预测音高轮廓 Ĉ。当将映射 W 应用于某个词汇类型所有词汇的上下文嵌入的中心点时,就得到了该类型特有的 f0 特征(由 GAM[wood2017generalized] 估计)。在更高聚合层面上,当将所有共享相同普通话声调的词汇类型的上下文嵌入中心点作为映射 W 的输入时,得到的结果是该声调的预测声调模式,与 GAM 重建的声调模式高度相似。 这一研究路线聚焦于词汇音高轮廓的形状,对意义(以上下文嵌入近似)与归一化时间内的音高之间的关系进行建模。音高轮廓的持续时间在 GAM 中被作为协变量处理,因为声调轮廓和词汇持续时间并非独立[ho1976acoustic]。因此,在本研究中,我们还探讨词汇的 f0 轮廓是否可以从上下文嵌入中预测,不是在归一化时间内,而是在实时时间中。如果从上下文嵌入中预测的持续时间质量足够高,那么这些持续时间就可以用于将归一化时间内的预测 f0 轮廓反向转换为实时时间内的预测 f0 轮廓。 ## 2 方法 ### 2.1 数据 本研究使用的语料库是台湾普通话自发言语语料库[fon2004preliminary],该语料库提供了使用繁体中文的词汇级转录。我们遵循语料库中的转录,并根据词汇转录所使用的汉字来区分词汇类型。 在普通话中,单字词总是对应一个口语音节。音节的最大结构是 CGVN:一个声母 (C)、一个介音 (G)、一个韵腹 (V) 和一个韵尾 (N)。根据普通话的音位配列限制,韵尾必须是鼻音[duanmu2007phonology]。在普通话中,韵腹可以是七个单元音之一,也可以是八个双元音之一[yi1920lectures]。本研究仅限于包含元音 /a/、/i/、/u/、/ə/ 且无韵尾和介音的词汇,以便控制音段对持续时间的影响[wu2015duration]。 我们的数据集包含 699 个词汇类型的 53,139 个词汇,这些词汇包含 /a/、/i/、/u/ 和 /ə/,其中 6,481 个词汇的声母为空。这 53,139 个词汇中约 85% 属于仅 32 个高频词,例如“的 de0”(属格)、“你 ni3”、“他 ta1”。为了防止模型预测受到最高频词的严重偏差,我们对于词汇频率高于 220 的词,从 55 位说话者中随机抽取了 220 个词汇(55 位说话者 × 4 个词汇)。作为进一步确保统计分析中每个词汇类型有足够词汇的措施,我们还排除了词汇频率低于 10 的词,最终剩下 8,187 个词汇。 我们使用蒙特利尔强制对齐器[mcauliffe2017montreal]来确定所研究 CV 词汇中辅音和元音的边界。在 8,187 个词汇中,有 408 个词汇未被分配音段边界,通常是因为这些词汇持续时间极短。因此,我们在 Praat[boersma19922022] 中对强制对齐的文本栅格进行了人工审核,以确保音段边界放置正确。由于元音发音不清(由元音弱化或背景噪声引起),人工验证期间排除了 304 个词汇,最终剩下 102 个词汇类型的 7,476 个词汇。 也就是说,对于每个词汇,我们计算了一个上下文敏感嵌入,作为其在语境中意义的近似。我们使用的上下文嵌入是通过 GPT-2 获得的(技术细节见[Chuang:Bell:Tseng:Baayen:2024]以及 CKIP¹[ckiplab/gpt2-base-chinese])。将 GPT-2 应用于台湾普通话自发言语语料库[fon2004preliminary]中的话语,得到一个 7,476×768 的矩阵 S,其中包含上下文嵌入。 对于每个词汇,我们提取了元音的持续时间(得到 7,476×1 的元音持续时间矩阵 C_v)以及词汇的持续时间(得到 7,476×1 的词汇持续时间矩阵 C_w)。我们还按照文献[jin2025]中详细记录的程序为每个词汇计算了时间归一化的音高轮廓。在此分析中,排除了 9 个持续时间极短或出现八度跳跃的 f0 的词汇类型。所得数据集包含 93 个词汇类型的 6,118 个词汇,是本研究考虑的数据点的子集。对于每个词汇,在归一化时间内保留了 100 个音高测量值,得到一个 6,118×100 的矩阵 C_p。 ### 2.2 过程 我们通过解方程 S W_v = C_v、S W_w = C_w 和 S W_p = C_p 来获得预测的持续时间和音高轮廓,并计算: Ĉ_v = S W_v (1) Ĉ_w = S W_w Ĉ_p = S W_p 为了评估预测质量,我们使用了 10 折交叉验证。对于每次运行,数据被分成 90% 的训练数据和 10% 的测试数据,使得任何词汇类型的词汇数量在训练和测试数据中按比例得到代表。对于给定的响应变量,此过程产生训练数据的 10 个质量值和保留数据的 10 个质量值。对于元音和词汇持续时间响应变量,我们使用观测值与预测值的皮尔逊相关性来评估预测质量。对于归一化时间内的预测音高轮廓,我们使用最近邻准确率度量来评估质量。对于每个词汇,我们使用均方误差来寻找具有最相似经验音高轮廓的词汇。如果该最相似词汇的音高轮廓属于同一词汇类型的词汇,则判断该词汇的预测音高轮廓正确。对于训练数据(或测试数据)中的所有词汇,此过程得到一个准确率度量(正确百分比)。 元音和词汇持续时间以及 f0 轮廓受除词义之外的许多因素共同决定。诸如局部语速、说话者在说话时的情绪状态以及相邻停顿的存在等因素,不太可能强烈体现在由大型语言模型获得的上下文嵌入中——这些模型基于大量书面文本训练,并且代表了给定局部前文语境下词汇意义的平均、与说话者无关的估计。词类在嵌入空间中有所反映,但程度很弱,而词义在二维 t-SNE[maaten2008visualizing] 图中表现出强烈的聚类,如[Chuang:Bell:Tseng:Baayen:2024]所示。在本研究中,我们对照消除了上下文嵌入与持续时间或 f0 轮廓之间关系的排列基线来评估预测质量。通过这种方式,我们可以确定从经验嵌入中得出的预测是否比形式与意义关系被随机化后的预测更精确。在一般讨论中,我们将回到嵌入中呈现韵律因素的程度问题。 我们考虑了两种不同的排列基线:一种宽松的,一种严格的。宽松的排列基线(下文称为“全局基线”)是通过随机排列词汇标识符获得的。嵌入被随机重新与词汇及其持续时间和音高轮廓关联。如果嵌入中不包含关于持续时间和 f0 的信息,那么打破形式与意义之间的关系应该不会造成差异。如果语义空间和形式空间存在某种对齐,那么经验交叉验证的结果应该优于全局排列基线的结果。 如果全局排列基线的表现不如经验结果,则词汇的上下文嵌入与自身类型的持续时间和 f0 轮廓的对齐程度优于与其它类型的对齐程度。但是我们可以问,词汇特有的持续时间和 f0 轮廓是否与其自身词汇特有的嵌入的对齐程度优于与同一类型其它词汇的嵌入的对齐程度?为了评估在单个词汇层面是否存在信号,我们实现了第二种排列基线,下文称为“类型层面排列基线”。对于此基线,我们不在类型之间进行排列,而仅在类型内部进行排列。对于任何给定类型,我们随机排列属于该类型的词汇的嵌入。如果这种严格的排列基线表现不如经验结果,则表明即使在词汇内词汇层面也存在形式与意义的某种对齐。 ## 3 结果 ### 3.1 训练数据 在 10 折交叉验证下,训练中元音持续性的平均相关性为 0.535,全局排列基线的平均相关性为 0.339,类型层面排列基线的平均相关性为 0.506,低于经验平均相关性 (t(9) = -18.473, p < 0.0001)。 关于词汇持续时间,经验平均相关性为 0.557。全局排列基线为 0.334。类型层面排列基线对词汇持续时间的相关性为 0.527,低于经验相关性 (t(9) = -23.493, p < 0.0001)。对于 f0 轮廓,经验平均准确率为 0.184,全局排列基线准确率为 0.021,低于经验准确率 (t(9) = -121.09, p < 0.0001)。然而,类型层面排列基线的平均准确率为 0.195,高于经验平均准确率 (t(9) = 5.587, p = 0.0003)。 ### 3.2 保留数据 对于保留数据,元音持续性的平均相关性为 0.366,全局排列基线的平均相关性为 -0.011,类型层面排列基线的平均相关性为 0.309,低于经验平均相关性 (t(9) = -4.314, p < 0.0020)。 对于词汇持续时间,经验平均相关性为 0.399。全局排列基线再次接近零 (0.000),类型层面排列基线相关性为 0.341,低于经验相关性 (t(9) = -5.839, p = 0.0002)。 对于 f0 轮廓,经验平均准确率为 0.170,全局排列基线准确率为 0.026,低于经验准确率 (t(9) = -35.758, p < 0.0001),但类型层面排列基线的平均相关性为 0.180,高于经验准确率,但并未显著高于 (t(9) = 2.180, p = 0.057)。 这些结果表明,元音
相似文章
自监督语音模型中音调上下文的感知补偿
本文研究wav2vec2.0架构在汉语普通话中是否表现出对音调上下文的感知补偿,发现与人类听众相比,自监督模型中的证据有限,并表明监督微调可能是实现此类音系抽象所必需的。
面向中国方言的语音驱动端到端语言辨识
本文研究了用于中国方言细粒度辨识的语音驱动特征,采用了一种端到端模型,通过卷积神经网络结合基于MFCC的特征与词级嵌入,性能优于文本驱动方法。
野外探测:无监督发音分析下自监督语音表示在普通话次方言中的案例研究
本文通过无监督发音探测进行案例研究,探讨自监督语音模型如何在普通话次方言中编码语音特征,发现唇音性等显著特征保持稳定,而更精细的频谱区别则表现出方言依赖的变化。
使用大语言模型自动标注汉语叙事转录文本
本文评估了使用大语言模型自动标注汉语口语叙事宏观结构的效果,发现最佳模型在降低65%标注时间的同时,达到了接近人类水平的可靠性,但在语义复杂或词汇多样的叙事文本上性能有所下降。
UOL@IDEM在BEA 2026共享任务1中的提交:融合神经与丰富特征建模的L1感知词汇难度预测
本文描述了UOL@IDEM在BEA 2026 L1感知词汇难度预测共享任务中的封闭赛道提交方案,结合多语言上下文表示与工程化特征。该系统在西班牙语、德语和中文上取得了有竞争力的RMSE分数,其中词频是最稳定的预测因子。