VIVID:一个植根于文化的基准,揭示越南语自然语言处理中的比喻语言差距

arXiv cs.CL 论文

摘要

本文介绍了VIVID,这是首个系统评估越南语中植根于文化的比喻语言理解的基准,包含1,636条习语和谚语。对八个最先进模型的评估揭示了显著差距:越南语专用模型的表现远逊于多语言系统,即使顶尖模型平均正确率也不到50%。

arXiv:2608.03095v1 Announce Type: new 摘要:我们提出了VIVID(越南语成语验证与解释深度),这是首个系统评估越南语中植根于文化的比喻语言理解的基准。VIVID包含1,636条习语和谚语,标注了五个复杂性特征(字面表达、语用细微差别、汉越词、生僻词汇、民间知识)和七个语义主题。我们建立了一个结合生成式和判别式任务的评估框架,提出了一种基于方面的提示的LLM-as-a-Judge方法,并与人类判断进行了验证(Cohen's kappa = 0.792)。对八个最先进模型的评估揭示了关键差距:越南语专用模型的表现远逊于多语言系统(VinaLLaMA-7B:0.13 vs. GPT-4o:2.46),即使顶尖模型也只达到最高分的不到50%。值得注意的是,少样本提示并非普遍提升性能,GPT-4o因风格过拟合而出现性能下降。我们的分析揭示了系统性失败,包括过度字面解释、词汇缺口和语用扁平化,表明当前模型缺乏对细微比喻解释的文化能力。VIVID为在文化丰富的语境中推进比喻语言理解提供了重要工具。
查看原文
查看缓存全文

缓存时间: 2026/08/05 07:43

# VIVID:一个基于文化语境的基准,揭示越南语 NLP 中的比喻语言差距

###### 摘要

我们提出了 VIVID(Vietnamese Idioms for Validation and Interpretation Depth,越南语成语验证与解释深度基准),这是首个用于系统评估越南语中植根于文化的比喻语言理解的基准。VIVID 包含 1,636 条成语和谚语,注释了五个复杂度特征(字面表达、语用细微差别、汉越词、生僻词汇、民间知识)和七个语义主题。我们建立了一个结合生成式与判别式任务的评估框架,提出了一种基于方面的提示的 LLM-as-a-Judge 方法,该方法与人工判断的验证达到了 Cohen's κ = 0.792。对八种最先进模型的评估揭示了关键差距:越南语专用模型的性能远低于多语言系统(VinaLLaMA-7B:0.13,而 GPT-4o:2.46),即使是最先进的模型平均正确率也不到 50%。值得注意的是,少样本提示并非普遍提升性能,GPT-4o 因风格过拟合而出现性能下降。我们的分析揭示了系统性的失败模式,包括字面过度解读、词汇空缺和语用扁平化,表明当前模型缺乏对细腻比喻解释所需的文化能力。VIVID 为在文化丰富语境中推进比喻语言理解提供了重要工具。我们在 https://github.com/ReML-AI/VIVID 发布代码和数据集。

**关键词:** 越南语基准、比喻语言评估、成语与谚语

Tu Tran Do¹∗, Nhat Ngoc Nguyen¹∗, Khanh-Tung Tran², Hoang D. Nguyen², Tu Minh Phuong¹, Long Hoang Dang¹

¹ 越南邮电技术学院(PTIT)
² 爱尔兰科克大学计算机科学与信息技术学院

\{tudt.b22kh109, nhatnn.b22at208\}@stu.ptit.edu.vn
[email protected]
[email protected]
\{phuongtm, longdh\}@ptit.edu.vn

∗ 这些作者贡献相同。

## 1. 引言

比喻语言理解仍然是自然语言处理中的一个关键挑战,要求模型整合语言知识、文化语境和语用推理([Liu 等人,2022](https://arxiv.org/html/2608.03095#bib.bib37))。在越南语语言学中,成语被定义为一种固定的多词表达,其含义无法从组成词的表面含义直接推断出来。相比之下,谚语则是简短的、往往带有韵律的句子,浓缩了民间知识、生活经验或道德教训([Phê,2021](https://arxiv.org/html/2608.03095#bib.bib18))。越南语成语和谚语因包含古汉越词、微妙的语用含义(讽刺、反讽)以及与传统文化习俗相关的民间知识,构成了独特的解释困难。尽管越南语已经拥有相当丰富的 NLP 资源,包括自然语言推断([Huynh 等人,2022](https://arxiv.org/html/2608.03095#bib.bib40))、情感分析([Ho 等人,2019](https://arxiv.org/html/2608.03095#bib.bib41))和多跳推理([Le 等人,2022a](https://arxiv.org/html/2608.03095#bib.bib42))等基准,但尚无系统评估框架来评估植根于文化的比喻语言理解。

这一空白引出了两个研究问题。首先,当前最先进的语言模型在越南语比喻语言上的表现如何?现有基准主要关注英语([Chakrabarty 等人,2022](https://arxiv.org/html/2608.03095#bib.bib21))、韩语([Wang 等人,2024](https://arxiv.org/html/2608.03095#bib.bib25))或埃塞俄比亚语言([Azime 等人,2025](https://arxiv.org/html/2608.03095#bib.bib24))等高资源语言,评估的是二元习语性检测,而非文化理解。没有越南语基准,我们就无法评估越南语专用模型或多语言模型是否能准确解释成语,也无法确定是哪些语言特征给这些系统带来了挑战。其次,我们如何可靠地评估比喻语言理解?BLEU 等传统指标无法捕捉语义细微差别([Tang

相似文章

VLegal-Bench: 越南法律推理认知基础基准测试

arXiv cs.CL

VLegal-Bench 是一个认知基础基准测试,用于评估大语言模型在越南法律推理任务中的表现,包含 10,450 个专家标注样本,旨在填补民法系统法律基准的空白。该基准通过问答、多步推理和场景问题解决来评估多个层次的法律理解,为在非英文、成文法律背景下评估大语言模型提供了一个可复现的框架。

IdioLink:在习语与字面表达间检索超越字词的意义

arXiv cs.CL

介绍了IdioLink,一个包含10,700篇文档和2,140个查询的检索基准,覆盖107个习语,测试模型是否能够将习语表达与概念上等价的字面或释义含义联系起来。评估显示,当前的嵌入模型在此任务上表现不佳,突显了习语感知语义检索方面的空白。

LLM对越南方言的鲁棒性如何?

arXiv cs.CL

本文介绍了VialectBench,这是一个评估LLM在六种越南方言群体和四项任务上鲁棒性的基准,发现平均性能下降2.82%,且没有模型完全不受方言影响。