面向汉语语言的跨语言罗马字生态系统:普通话与粤语配对案例研究

arXiv cs.CL 论文

摘要

本文提出了一种针对汉语语言的跨语言罗马字生态系统,为普通话和粤语开发了具体方案,并在语音到罗马字任务中显示出比基线方法更优的性能。

arXiv:2608.29170v1 公告类型:新 摘要:本文提出汉语罗马字生态系统,这是一个跨语言的汉语罗马字设计框架,配有支持性数字基础设施和社区驱动的开源工作流。该设计框架通过四个设计原则解决汉语语言间系统性跨语言罗马字对齐的缺失:语音对应(用相似的罗马字表示相似的声音)、历史音韵对应(对齐同源罗马字字符串)、一音素一符号,以及基础拉丁字母使用,并在这些原则之间进行权衡考虑。对于主要的配对案例研究,我们分别开发了CantRomZJ1和MandRomZJ1,即遵循该设计框架的粤语和普通话罗马字方案。我们还遵循相同设计框架,为其他几种汉语语言开发了方案,包括Meixian Hakka、Shanghai Wu和Nanjing Jianghuai Mandarin。为了将罗马字方案投入实际使用,我们开发了开源基础设施,用于结构化罗马字存储、转换、解析、词典构建和输入法生成。最后,我们通过基于Meta的Massively Multilingual Speech (MMS)微调的语音到罗马字实验来评估设计框架。与Pinyin+Jyutping基线相比,我们的MandRomZJ1+CantRomZJ1条件分别将粤语WER和CER降低了7.80%和10.61%。这些结果表明,跨语言罗马字对齐可以改善低资源汉语语音技术中的迁移学习。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:18

# 汉语系语言的跨语系罗马化生态系统:以普通话与粤语配对案例研究为例  
来源:https://arxiv.org/abs/2608.29170  
查看PDF (https://arxiv.org/pdf/2608.29170)

> 摘要:本文提出“汉语系罗马化生态系统”,这是一个跨语系的汉语罗马化设计框架,配套数字化基础设施及社区驱动的开源工作流程。该设计框架通过四项设计原则,解决汉语系语言间缺乏系统性跨语系罗马化对齐的问题:包括用相似罗马化符号表示相似音的“语音对应原则”,对齐同源词罗马化字符串的“历史音韵对应原则”,“一音素一符号”原则,以及“基本拉丁字母使用原则”,并考虑了这些原则之间的权衡平衡。在主要配对案例研究中,我们依据该框架分别开发了粤语罗马化方案CantRomZJ1和普通话罗马化方案MandRomZJ1。同时,我们还为梅县客家话、上海吴语、南京江淮官话等其他汉语系语言制定了相同框架下的罗马化方案。为实现这些方案的实际应用,我们开发了开源基础设施,支持结构化罗马化存储、转换、解析、词典构建及输入法生成。最后,我们通过基于Meta大规模多语种语音(MMS)微调的语音-罗马化转换实验评估了该设计框架。与拼音+粤拼基线方案相比,MandRomZJ1+CantRomZJ1方案使粤语的词错误率和字错误率分别降低了7.80%和10.61%。这些结果表明,跨语系罗马化对齐能提升低资源汉语语音技术的迁移性能。

## 投稿历史

作者:Zijie Zhang \[查看邮箱 (https://arxiv.org/show-email/1b7e3707/2608.29170)\] **\[v1\]** 2026年8月29日 星期六 09:35:14 UTC \(3,867 KB\)

相似文章

DialectS2S:面向低资源中文方言的端到端语音对话建模

arXiv cs.CL

DialectS2S是一个面向低资源中文方言的端到端语音对话模型,引入了可扩展的数据合成流程和一种带有自对齐语音监督的两阶段后训练策略。实验表明,在方言一致性、响应质量和可懂度方面均有提升,并且模型、数据和代码全部开源。

在英中语音到语音翻译中评估和保留词汇重音

arXiv cs.CL

一篇研究论文,提出了一种新的评估指标和重音感知系统,用于在英中语音到语音翻译中评估和保留词汇重音,实验表明在保持翻译质量的同时,其重音翻译能力显著优于现有方法。

面向中国方言的语音驱动端到端语言辨识

arXiv cs.CL

本文研究了用于中国方言细粒度辨识的语音驱动特征,采用了一种端到端模型,通过卷积神经网络结合基于MFCC的特征与词级嵌入,性能优于文本驱动方法。

高效适配口语语言模型至新加坡语境

arXiv cs.CL

本文提出一种策略,利用LoRA微调、替代文本问答数据集以及多任务目标,将开源口语语言模型适配至新加坡内政团队语境,在新加坡四种官方语言的五项语音任务上实现了具有竞争力的性能。