标签
本文提出了一种基于分类器的框架,用于审计多语言TTS系统的音系忠实性,以阿萨姆语ATR元音和谐为案例研究。结果显示,Meta的MMS TTS频繁错误生成舌根前伸元音,而这种偏差在人类语音中不存在。
YOMI-Bench 是一个旨在评估大语言模型在日语汉字读音和语音理解方面的基准测试。它包含四项任务,并揭示即使是专门针对日语的模型在需要汉字读音知识的生成任务上也表现不佳。
本文采用逐层探测的方法,研究wav2vec 2.0和Whisper如何编码非裔美国人英语中的辅音丛简化现象,发现这两个模型均能区分简化形式和规范形式,并保留了底层塞音的线索。
本文提出了一种模块化框架,用于生成可发音、类型学上合理且语义结构化的工词汇,该框架使用来自PHOIBLE的音位清单和概率语法,优于确定性基线方法。
本文分析了《回通官话译语》这一明代多语词汇集,将其视为一种结构化的跨语言转录系统,该系统使用汉字来代表非汉语语言,揭示了汉语音韵范畴如何被灵活扩展用于语音近似。