CyrillicQA:语音编码秘密语言对LLM性能的影响
摘要
本文研究大型语言模型(LLMs)是否能够对语音编码的语言进行解码,例如用西里尔字母书写的德语,以评估其在标准拉丁字母训练数据之外的抽象能力和性能。
arXiv:2608.21462v1 发布类型:新
摘要:由于训练数据的选择,大型语言模型(LLMs)在标准拉丁字母语言(使用大量说话人口)的输入上表现最佳,而对其他语言变体不利。尽管如此,它们也可以成为保存这些濒危语言的多用途工具。但它们是否具备人类那样的创造力和抽象能力来解码语音编码的语言?
查看缓存全文
缓存时间: 2026/08/25 04:12
# CyrillicQA:语音编码密语对大语言模型性能的影响 来源:https://arxiv.org/html/2608.21462 作者:Erik Thureck(柏林洪堡大学,德国柏林,隶属关系:学生,ORCID: 0009-0002-1994-5648) Leo S. Rüdian(柏林洪堡大学,德国柏林,隶属关系:导师,ORCID: 0000-0003-3943-4802) ###### 摘要 由于训练数据的选择,大型语言模型(LLM)在使用拉丁字母、使用者众多的标准化语言输入上表现最佳,而对其他语言变体则处于劣势。尽管如此,它们也可以成为保护这些濒危语言的多才多艺的工具。但它们是否也具备与人类相同的、解码语音编码语言所需的创造力和抽象能力? ###### 摘要(德语) Aufgrund der Auswahl ihrer Trainingsdaten sind Large Language Modelle (LLMs) bei hochsprachlichen Eingaben sprecherreicher Sprachen des lateinischen Alphabets am performantesten, während sie sonstige Sprachvarietäten benachteiligen. Dennoch bieten sie auch vielseitige Möglichkeiten, eben solche gefährdeten Sprachen zu erhalten. Doch verfügen sie auch über die nötige Kreativität und das Abstraktionsvermögen, phonetisch kodierte Sprache zu entschlüsseln, wie es Menschen tun? ###### 索引术语: LLM, 音韵学, 语音编码, 拉丁语, IPA, 西里尔文, 西里尔化 ## I 引言 据估计,互联网上约50%的网站使用英语[18]。这种语言主导地位也反映在大型语言模型的训练数据集中,这不仅因为它们主要由美国公司开发,还因为它们现在包含了大量开放互联网的内容。此外,超过85%的互联网内容使用拉丁字符书写[18],进一步增强了西方对通用大型语言模型的影响。 基于其获取的知识,人类可以解决新的、以前未见过的任务[2]。例如,一个能阅读西里尔字母并理解德语的人,也能理解用西里尔字母书写的德语单词。但是,大型语言模型是否也具备这种语音抽象能力,即使它们从未接受过相关训练? ## II 相关工作 先前的研究表明,大型语言模型对相同的问题——甚至纯粹的事实性问题——用不同语言会给出不同的答案:Ifergan等人的一项研究发现,不同的字母表特别会导致大型语言模型中不同语言的知识库分离。例如,大约一半使用西里尔文字的语言知识也存在于使用拉丁文字的语言中,但反向情况仅对10-20%成立[8]。此外,大型语言模型对同一种标准语的变体也很敏感[1],甚至导致对英语方言的处理效果较差[9, 17, 10, 7],在某些情况下甚至出现歧视性行为[3]。 Maksymenko和Turuta指出,处理乌克兰语西里尔文字提示比处理英语提示需要显著更多的token和每个单词的处理时间[13]。此外,根据Chen等人的研究,阿拉伯文和西里尔文特别容易受到嵌入反转攻击[4]。 将词语从一个书写系统映射到另一个可以按字母逐个进行(音译),也可以基于发音逐词进行(转写)。由于避免了变音符号的使用,转写文本更容易处理,尤其是对于非专家而言;但与音译不同,由于字符层面的歧义性,转写无法无损地逆转回原文[19]。 Ma等人在2024年发表的一项研究发现,与原始书写系统的提示相比,大型语言模型在音译为拉丁文字的提示上表现提升了高达25%[12]。然而,在同一年,Partanen表明,大型语言模型也能为濒危语言生成高质量的音译,尽管这些语言在它们的训练数据集中可能代表性不足[14]。 然而,它们对语音的“理解”以及面对编码或密语1111在另一项无关研究中,de Knock等人训练大型语言模型解码极端组织的暗语[5]。查询时的行为,仍有待探索。 因此,本文研究了大型语言模型如何应对将西方标准语言语音编码为西里尔文字(西里尔化)的情况:它们是否能够从语法形式中抽象出这些西里尔化提示,即使它们可能并未在这些内容上训练过,也能解决指定的任务? ## III 方法论 为了以尽可能高的现实适用性进行研究,本研究使用了ChatGPT-5.2222版本为gpt-5.2-2025-12-11的默认设置。一个Python脚本使用英语TruthfulQA数据集[11]的全部790个问题查询其API,这些问题用于测试大型语言模型在多大程度上复制错误观念:问题保持原始形式、转换为使用eng_to_ipa库[15]的国际音标(IPA),并基于此转写为西里尔文字。所有零样本提示均由相应问题、随机顺序的两个多选答案选项333根据该基准测试使用建议的修订版[6]、以及所需的输出格式(见表II和III)组成。为了量化评估,除了答案准确性外,还测量了大型语言模型消耗的token数量和处理所需的时间。 由于不仅数据集的书写系统,而且各个问题本身也影响结果,因此采用了混合效应模型:对于连续变量“时间”,使用线性混合模型(LMM);对于二元变量“准确性”,使用广义线性混合模型(GLMM)。由于“时间”测量数据不是正态分布,在分析前进行了对数转换。使用似然比检验(χ²)在包含该效应的模型与不包含该效应的模型之间测试“书写系统”效应变量的显著性。在结果显著的情况下,计算了使用Holm校正的事后成对比较。对于“准确性”,报告了95%置信区间的优势比(OR)作为效应量度量。显著性分析在R中进行[16]。 ## IV 结果 表I:TruthfulQA数据集三种变体概述。如表I所示,转写的查询明显比原始查询和IPA查询短。然而,与基线相比,大型语言模型处理它们所需的每个字符的输入token数几乎是原来的两倍,而处理IPA查询所需则几乎是三点五倍。回答所有2370个查询,每个查询需要输出4个token。 分析显示,“书写系统”对答案准确性有显著影响(χ²(2)≈96.6148, p<0.001)。事后测试确认,与西里尔化查询相比,原始查询(OR≈14.586 800, 95% CI [6.347 996, 33.518 403], p<0.001)和IPA查询(OR≈11.448 654, 95% CI [5.070 475, 25.849 978], p<0.001)的准确性显著更高。然而,在拉丁文和IPA变体之间未发现显著差异(OR≈1.274 106, 95% CI [0.604 436 8, 2.685 717], p≈0.436 749 1)。 关于处理时间,三种“书写系统”变体之间未发现显著差异(χ²(2)≈1.470 473, p≈0.479 392),尽管IPA查询的变异性略低(见表I)。 ## V 讨论 ChatGPT-5.2在标准化语言输入上取得了最高的准确性,这与其假设的训练数据一致。然而值得注意的是,西里尔化查询和国际音标查询也达到了非常高的准确性(超过80%),后者在统计上并不比原始查询表现差。这表明大型语言模型在所有情况下都很好地理解了任务以及正确回答所需的现实背景——特别是因为观察到的准确性接近TruthfulQA数据集报告的94%的人类基线(参见[11])。 此外,观察到西里尔化查询但非IPA查询表现较差的现象,可能归因于文献中描述的不同书写系统之间知识库的差异(参见[8])。 支持这一假设的另一个论点可能是测得的输入token效率差异,这似乎与它们各自书写系统在训练数据集中的普遍程度相关。因此,IPA字符与token之间近乎1:1的关系可以解释为:IPA仅在语言学小众领域使用,而西里尔文至少被一些主要语言使用,因此在训练数据中更频繁地出现。或者/此外,可能使用了更高比特的分词方法。 尽管在本研究中“处理时间”并未因“书写系统”选择而受到显著影响,但这可能是由于提示——平均少于300个字符——以及仅需输出一个字符的要求相对较短所致。 ## VI 局限性与未来工作 不能排除与文献相比实现的高准确性也可能源于ChatGPT在那时已经直接或间接地在TruthfulQA数据集上进行了训练。此外,本研究未探讨大型语言模型对双射音译(而非仅简化转写)的反应。同样,值得研究的是类似语音编码但更复杂、文本更冗长的问题陈述(包括所需的处理时间)的结果。 ## VII 结论 作为本研究的一部分,进行了一项对照研究,以调查大型语言模型是否能够对其输入进行语音抽象。为此,将英语TruthfulQA数据集的对抗性提示同时转换为国际音标和西里尔文字。结果显示,ChatGPT-5.2在语音编码输入上也达到了较高的基准准确性,而非主要复制错误观念,并且不需要更多时间来完成。原始查询与IPA查询之间的准确性差异甚至被发现不显著,这表明大型语言模型对这类语音编码具有鲁棒性。 ## 透明度与可重复性 ## 参考文献 - [1] M. M. I. Alam and A. Anastasopoulos (2025). 大型语言模型作为音译和方言翻译的归一化器。发表于第12届针对相似语言、变体和方言的NLP研讨会论文集,Y. Scherrer, T. Jauhiainen, N. Ljubešić, P. Nakov, J. Tiedemann, and M. Zampieri (Eds.), 阿联酋阿布扎比,第39-67页。外部链接:链接。引用:§II, §II。 - [2] J. D. Bransford and D. L. Schwartz (1999). 第三章:重新思考迁移:一个具有多重含义的简单提议。《教育研究评论》24(1),第61-100页。外部链接:文档,链接。引用:§I, §I。 - [3] M. D. Bui, C. Holtermann, V. Hofmann, A. Lauscher, and K. von der Wense (2025). 大型语言模型歧视德语方言使用者。发表于2025年EMNLP会议论文集,C. Christodoulopoulos, T. Chakraborty, C. Rose, and V. Peng (Eds.), 中国苏州,第8223-8251页。外部链接:链接,文档,ISBN 979-8-89176-332-6。引用:§II, §II。 - [4] Y. Chen, R. Biswas, H. Lent, and J. Bjerva (2024). 尽管困难重重:克服多语言嵌入反转攻击中的类型、文字和语言混淆。外部链接:2408.11749,链接。引用:§II, §II。 - [5] C. de Kock, A. Riabi, Z. Talat, M. S. Schlichtkrull, P. Madhyastha, and E. Hovy (2025). IYKYK:使用语言模型解码极端主义密语。外部链接:2506.05635,链接。引用:脚注1,脚注1。 - [6] O. Evans, J. Chua, and S. Lin (2025). 新型改进的多选TruthfulQA。注:最后访问于2025年11月27日。外部链接:链接。引用:脚注3,脚注3。 - [7] F. Faisal and A. Anastasopoulos (2025). 测试大型语言模型的边界:方言和语言变体任务。发表于第12届针对相似语言、变体和方言的NLP研讨会论文集,Y. Scherrer, T. Jauhiainen, N. Ljubešić, P. Nakov, J. Tiedemann, and M. Zampieri (Eds.), 阿联酋阿布扎比,第68-92页。外部链接:链接。引用:§II, §II。 - [8] M. Ifergan, L. Choshen, R. Aharoni, I. Szpektor, and O. Abend (2024). 表面一致性之下:探索大型语言模型中的跨语言知识表征共享。外部链接:2408.10646,链接。引用:§II, §II, §V, §V。
相似文章
论词汇性在大语言模型中的持续影响
本文研究了词汇重叠(而非语义内容)如何影响跨层和跨架构的大语言模型表示,并证明即使在为语义相似性训练的模型中,这种词汇效应依然存在,导致下游任务性能下降。
大型语言模型有多像人类?一个关注语域的语言评估框架
本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。
MameLoshnLM:意第绪语语言模型与评估基准
本文介绍了 MameLoshnLM,这是首个开源的 8B 参数意第绪语语言模型,同时还包括 Oytser 预训练语料库和 Kashes 评估基准。研究表明,在高质量意第绪语数据上进行持续预训练的表现优于通用多语言模型,凸显了专门进行低资源语言建模的价值。
大型语言模型中的类人回指消解
本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。
小大脑,大成就:探索紧凑型语言模型
本文对17个紧凑型语言模型(1B-8B参数)在俄语RAG系统中作为生成器进行了基准测试,仅使用CPU推理,发现Qwen系列模型在私有、无GPU部署中提供了出色的质量-延迟权衡。