LLM对越南方言的鲁棒性如何?
摘要
本文介绍了VialectBench,这是一个评估LLM在六种越南方言群体和四项任务上鲁棒性的基准,发现平均性能下降2.82%,且没有模型完全不受方言影响。
arXiv:2608.10414v1 公告类型:新
摘要:大型语言模型(LLM)通常在标准书面越南语上进行评估,然而日常交流经常涉及保留语义但表层形式不同的地区方言。现有的越南语方言工作主要通过方言到标准的规范化来解决这一问题,而不是衡量模型在越南语方言输入下的失败模式。为弥补这一空白,我们首次系统评估了LLM在多项任务中对越南语方言变化的鲁棒性,量化了性能下降和失败模式。我们引入了VialectBench(越南语方言基准测试),这是一个受控基准,用于测试模型决策在六种越南语方言群体中是否保持稳定。VialectBench包含400条标准越南语源实例和2,400条人工撰写的方言改写,涵盖情感识别(ER)、自然语言推理(NLI)、问答(QA)和多项选择问答(MCQA)。使用固定参考语言模型进行的数据集评估表明,方言改写引发了可测量的模型相对似然偏移,同时其长度与标准版本几乎相等。在十个指令微调模型中,方言输入使平均性能下降2.82%,且没有任何被评估模型完全不受方言影响。所有四项任务都受到影响,其中QA的平均下降幅度最大。鲁棒性在不同方言群体之间也存在显著差异:PNT3和PNT2造成的平均性能下降最大,分别为6.17%和4.73%,而PNB略微提高了平均性能0.42%。中部方言群体(PNT1-PNT4)在所有模型中也产生了最高的平均有害翻转率,为6.54%。这些发现表明,在标准越南语上的强劲表现并不能保证在保留语义的地区性变化下具有可靠的行为。
查看缓存全文
缓存时间: 2026/08/12 08:34
# LLM 对越南语方言的鲁棒性如何? Minh Tran1\通讯作者,Trinh Chau2,Thanh-Nhan Le3,Nam Tran4,Luan Thanh Nguyen5,Cuong Dang6,Duc Hoang7 ###### 摘要 大型语言模型(LLMs)通常在标准书面越南语上进行评估,然而日常交流经常涉及保留意义但表面形式不同的地区方言。现有的越南语方言研究主要通过方言到标准的归一化来解决这一问题,而不是衡量模型在越南语方言输入下如何失效。为填补这一空白,我们提出了第一项系统评估 LLM 在多种任务中对越南语方言变化的鲁棒性的研究,量化了方言引起的性能下降并分析了其背后的失败模式。我们引入了 VialectBench(越南语方言基准测试),这是一个受控基准,用于测试当任务内容以六个越南语方言群表达时,模型决策是否保持稳定。VialectBench 包含 400 条标准越南语源实例和 2,400 条人工撰写的方言改写,涵盖情感识别(ER)、自然语言推理(NLI)、问答(QA)和多项选择问答(MCQA)。使用固定参考语言模型进行的数据集评估表明,方言改写会导致可衡量的模型相对似然偏移,同时其长度与标准版本几乎相同。在十个指令微调模型中,方言输入使平均性能下降 2.82%,且没有评估的模型完全不受方言影响。四个任务均受到影响,其中 QA 的平均下降幅度最大。鲁棒性在不同方言群之间也有很大差异:PNT3 和 PNT2 分别造成最大的平均性能下降,分别为 6.17% 和 4.73%,而 PNB 使平均性能略微提升了 0.42%。中部方言群(PNT1–PNT4)在所有模型中的平均有害翻转率也最高,为 6.54%。这些发现表明,在标准越南语上的强性能并不能保证在保留意义的地区变体下具有可靠的行为。 ## 1 引言 参见图 1:越南语方言变化如何影响 LLM 的解释并导致不忠实的回答。 大型语言模型(LLMs)已成为自然语言处理(NLP)中的主导范式,在广泛的任务上取得了最先进的性能 [Zhao et al., 2026](https://arxiv.org/html/2608.10414#bib.bib1)。然而,它们在自然输入变化下的可靠性仍然脆弱,包括措辞、风格和语言形式的变化,这可能导致性能下降 [Zhu et al., 2024](https://arxiv.org/html/2608.10414#bib.bib2)。在这些自然变化形式中,方言变化尤其重要。与合成扰动不同,方言变化反映了真实社区的语言使用,但仍可能改变模型预测并加剧公平性或安全问题 [Hofmann et al., 2024](https://arxiv.org/html/2608.10414#bib.bib3);[Faisal et al., 2024](https://arxiv.org/html/2608.10414#bib.bib15)。最近的基准测试已经在英语、阿拉伯语和多语言环境中研究了这一问题 [Ziems et al., 2022](https://arxiv.org/html/2608.10414#bib.bib16);[Mousi et al., 2025](https://arxiv.org/html/2608.10414#bib.bib20);[Faisal et al., 2024](https://arxiv.org/html/2608.10414#bib.bib15);[Lin et al., 2025](https://arxiv.org/html/2608.10414#bib.bib13);[Gupta et al., 2025](https://arxiv.org/html/2608.10414#bib.bib14),一致表明在标准化语言上表现良好的模型在处理地区变体时可能仍然不可靠。 这个问题对越南语尤其重要,因为越南语在北部、
相似文章
从基准测试到推理能力:大语言模型在越南法律文本上的双维度大规模评估
为大语言模型在越南法律文本简化任务上提出了一个综合的双维度评估框架,结合了定量基准测试(准确性、可读性、一致性)和跨 GPT-4o、Claude 3 Opus、Gemini 1.5 Pro 和 Grok-1 的定性错误分析。
DiaLLM:英语方言适应中鲁棒性与生成能力差距的研究
本文介绍了DiaLLM,一个将LLMs适应英语方言的框架,揭示了方言鲁棒性(理解)与生成(产生方言文本)之间的差距,并表明明确的变体目标对齐能改进生成,但不一定符合人类偏好。
VLegal-Bench: 越南法律推理认知基础基准测试
VLegal-Bench 是一个认知基础基准测试,用于评估大语言模型在越南法律推理任务中的表现,包含 10,450 个专家标注样本,旨在填补民法系统法律基准的空白。该基准通过问答、多步推理和场景问题解决来评估多个层次的法律理解,为在非英文、成文法律背景下评估大语言模型提供了一个可复现的框架。
越南语音中方言变化的语音建模
本文提出了一种方言感知的语音框架,用于建模越南语自动语音识别(ASR)中的语音变化,将音节分解为结构化组件,并将其映射到特定方言的国际音标(IPA)表示。该方法在UIT-ViMD多方言数据集上,以更少的参数且无需外部预训练,匹配了预训练基线的性能。
探索大语言模型在中文抽象语言掌握中的能力边界
本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。