VakyArth: 评估LLMs在印度语言中的语用能力
摘要
本文介绍了VakyArth,这是首个针对印度语言的语用基准,评估LLMs在印地语、旁遮普语、泰米尔语和马拉雅拉姆语中的文化和上下文推理能力。研究发现模型在语用意义方面存在持续性失败,且在不同语言和任务间存在系统性差异。
arXiv:2609.01788v1 Announce Type: new
摘要:现实世界的交流通常需要语用推理:解释通过上下文和文化惯例隐含的意义,而不是字面陈述。现有的语用评估主要局限于英语和高资源语言,忽视了印度语言的丰富性和文化多样性。我们推出了VakyArth,这是首个针对印度语言的语用基准,设计为涵盖印地语、旁遮普语、泰米尔语和马拉雅拉姆语的诊断评估。VakyArth评估模型在五种现象上的表现:指示语、言语行为、含义、社会语用和连贯性;通过多项选择题、自然语言推理和翻译任务,所有项目均由母语者编写。在不同系列和规模的多语言大型语言模型(LLMs)中,我们发现模型在基于印度语言和文化惯例的语用意义上存在持续性失败。我们的分析显示,语言和任务间存在系统性差异:在所有模型-语言组合中,多项选择题的准确率高于自然语言推理的准确率,翻译性能不能可靠地反映语用理解水平,且印欧语系语言在翻译上优于达罗毗荼语系语言。我们进一步表明,自动翻译指标可能会忽略流畅但语用不忠实的输出,尤其是在含义和指示语方面。
查看缓存全文
缓存时间: 2026/09/03 05:47
# 印度语言大型语言模型语用能力评估研究 来源:https://arxiv.org/html/2609.01788 作者:Poorvaja Veera Balaji Kumar(佐治亚理工学院)、Parth Nanda(佐治亚理工学院)、Anand Madhusoodanan(佐治亚理工学院)、Geyang Guo(佐治亚理工学院)、Wei Xu(佐治亚理工学院)、Junyi Jessy Li(德克萨斯大学奥斯汀分校) *usingh68@gatech\.edu ###### 摘要 现实世界的交流常常需要语用推理:通过语境和文化惯例解读隐含意义,而非仅理解字面表达。现有的语用评估主要局限于英语和高资源语言,尽管印度语言具有丰富的语言和文化多样性,却尚未得到充分探索。我们推出了VakyArth——首个针对印度语言的语用基准测试,该诊断性评估涵盖印地语、旁遮普语、泰米尔语和马拉雅拉姆语。VakyArth通过多项选择题、自然语言推理和翻译任务评估模型在五种现象上的表现:指示现象、言语行为、会话含义、社会语用和连贯性;所有题目均由母语使用者创作。在测试不同系列和规模的多语言大型语言模型(LLM)时,我们发现它们在基于印度语言和文化惯例的语用意义理解上存在持续性失误。我们的分析显示,不同语言和任务间存在系统性差异:在所有模型-语言组合中,多项选择题准确率均高于自然语言推理准确率;翻译表现不能可靠反映语用理解水平;印度-雅利安语系语言的翻译表现优于达罗毗荼语系语言。我们还发现,自动翻译指标可能无法检测到流畅但语用不忠实的输出,尤其在会话含义和指示现象方面。 参见标题图1:VakyArth中的印地语指示现象题目。顾客要求“beech wala”(中间那个),指的是价格居中的西装(5000卢比)。任何印地语使用者都会通过价格排序而非提及顺序来解读此处的“beech wala”。而评估的模型却选择了3000卢比的选项,未能理解“beech wala”在此处锚定的是价格而非语序。## 1引言 随着大型语言模型(LLMs)的广泛应用,其影响力不仅体现在专业任务支持上,还体现在帮助用户在不同语言文化环境中进行日常交流。印度提供了这样的场景:其人工智能用户基数全球第二,但使用主要集中在软件开发等专业领域,日常生活和个人任务中的应用则明显不足(Appel, 2026)。因此,要在印度扩大人工智能的影响,就必须超越工作相关应用,转向能够支持日常使用的系统。 印度语境下的日常交流往往依赖于超越字面形式的、植根于文化的意义。例如,如图1所示,当讲印地语的顾客在服装店对话中要求“beech wala”时,该短语字面意思是“中间那个”。但在语境中,它指的是价格居中的西装,而非空间上位于中间的商品,许多现有模型(如Gemma-4-31B)都未能捕捉到这种区别。此处需要语用推理:从语境、文化惯例和说话者意图中恢复意义(Ma et al., 2025)。 现有语用评估主要关注英语或高资源语言(Ma et al., 2025; Park et al., 2024b)。据我们所知,目前尚无针对印度语言的语用评估。此外,印度语用极具多样性:印度各地语言横跨多个语系、书写系统和社会语言群体,语用线索的编码方式各不相同。 我们推出了VakyArth(注:VakyArth结合了梵语中的Vakya(话语)和Arth(意义),反映了该基准测试关注话语之下的意义),这是首个针对印度语言的语用基准测试。VakyArth是一项诊断性基准,涵盖印地语、旁遮普语、泰米尔语和马拉雅拉姆语,这些语言代表了印度多样化的语言和地区背景。它从五种语用现象评估多语言LLMs:指示现象、言语行为、会话含义、社会语用和连贯性(参见图2中的示例)。每种现象均以相应语言构建,并通过三种任务格式进行评估:多项选择题、自然语言推理和翻译,使我们能够在不同显性程度上评估语用理解能力。所有题目均由母语使用者创作,并包含自然的语码混合实例以反映真实使用模式。 我们评估了五个多语言LLMs,涵盖不同模型系列和规模(从8B到111B),发现了植根于印度语言和文化惯例的一致性失误模式。模型在应对文化特定的讽刺和夸张、间接拒绝和请求、如“kal”(昨天/明天)和“parso”(前天/后天)这类可转换的指示锚点,以及涉及亲属称谓和社会性别的社交线索时表现挣扎。我们的定量分析进一步揭示了不同任务、现象和语言间的系统性差异。印度-雅利安语系语言在翻译方面表现出优于达罗毗荼语系语言的优势,这可能反映了预训练数据覆盖范围的差异(Naous and Xu, 2025)。在所有模型-语言组合中,多项选择题准确率均高于自然语言推理准确率,这表明语用解释受益于选项选择的引导。翻译表现与多项选择题或自然语言推理得分并不相关,这表明识别语用意义与在跨语言中忠实表达它是截然不同的能力。有趣的是,Gemma-4-31B尽管规模较小且缺乏印度语言特化,却取得了最高性能。自动指标也未能对会话含义和指示现象中流畅但语用不忠实的输出进行有效惩罚。 ## 2相关工作 #### LLM的语用评估 对LLM语用能力的评估日益受到关注。Ma et al. (2025)提供了一项综合调查,指出大多数资源涵盖的现象范围狭窄,且严重偏向高资源语言。早期诊断性工作包括IMPPRES(Jeretic et al., 2020),一个针对会话含义和预设的定向自然语言推理数据集,以及Ruis et al. (2023),他们表明经过指令微调的模型在会话含义解析上显著优于基础模型。此后出现了更全面的基准:PUB(Sravanthi et al., 2024)涵盖十四个多项选择任务中的会话含义、预设、指称和指示现象,Yu et al. (2026)则聚焦于基于替代方案的语用推理。所有这些基准均为英语。 #### 多语言和跨文化语用基准 将语用评估扩展到英语之外的工作一直有限。MultiPragEval(Park et al., 2024b)使用格莱斯准则评估英语、德语、韩语和中文的模型,但仅涵盖欧洲和东亚语言。Park et al. (2024a)和Koo et al. (2025)推出了针对韩语的语用基准,后者报告了人类与模型在间接言语行为表现上的巨大差距。相关工作路线评估的是文化知识而非语用能力(Chiu et al., 2024; Shaikh et al., 2023)。与这些测试模型是否了解文化事实的研究不同,我们的工作评估模型是否能在语境中推理隐含意义。先前尚无研究评估任何印度语言的语用能力。 #### LLM在印度语言上的评估 印度自然语言处理评估已从基础基准发展到更具文化根基的基准,但语用能力仍未得到解决。早期工作如IndicNLP Suite(Kakwani et al., 2020)和IndicXTREME(Doddapaneni et al., 2023)为分类和命名实体识别建立了基线。近期工作涵盖生成:IndicGenBench(Singh et al., 2024)评估29种语言的翻译和摘要,MILU(Verma et al., 2025)引入文化特定知识任务。最具文化根基的工作是PARIKSHA(Watts et al., 2024),它评估了10种印度语言中的30个模型,发现LLM评估器在文化细微响应上与人类判断一致性差——这一发现与我们关于语用翻译中人类-COMET分歧的观察相吻合。尽管如此,这些基准均不要求语用推理:理解隐含意义、解析指称或解释间接言语行为。VakyArth首次填补了这一空白。 参见标题图2:VakyArth基准测试概览。题目涵盖五种语用现象:会话含义、指示现象、言语行为、社会语用和连贯性,涉及印地语、旁遮普语、泰米尔语和马拉雅拉姆语,通过自然语言推理、翻译和多项选择题格式进行评估。在所有情况下,正确的标签或翻译都无法仅从表面形式得出。 ## 3评估设计 我们的评估设计围绕三个指导原则:现象覆盖范围(测试应涵盖语用能力的核心维度,而非单一类别)、任务多样性(评估应在多个显性程度上探究理解)和文化真实性(题目应反映印度语言的实际使用情况,包括语码混合和文化特定的语用惯例)。 ### 3.1语用现象 我们评估五种现象,它们共同捕捉了日常交流中核心的非字面、依赖语境的意义(参见图2)。这些类别遵循Ma et al. (2025)的分类,但通过源自母语者文化知识的、独特的印度语言实例具体化。 (1) 指示现象指那些指称完全依赖于话语语境、说话者、地点和时间的词语(Webber, 1988)。印度语言呈现特定的指示现象挑战:时间词如“kal”(昨天/明天)和“parso”(前天/后天)是双向的,仅通过语境确定过去或未来;近指-远指对比(如“intha-antha”)承载着翻译会扁平化的意义;以及文化历法参照。例如: 一个泰米尔语题目展示说话者比较两个南瓜:“intha poosani paaka pinjaa irukku, antha poosani nallaa irukku”(“这个南瓜看起来不太熟,那个看起来更好”),说明了近指-远指对比(intha vs. antha)如何承载整个交际重点。将两者都扁平化为“这个南瓜”的翻译在语法上没问题,但完全丢失了比较。 我们还添加了多方对话以增加复杂性。例如,在一个旁遮普语的车站对话中,说话者B说“tussi edher aa jao”(“你来这边”),而说话者A正走向错误的检票口。正确解析“edher”(“这里”)需要追踪每个说话者所在的检票口——这是一个模型常常忽略的指称链。 (2) 言语行为指执行请求、提供、拒绝和警告等行为的表述,其言外之意常常与其表面形式大相径庭(Austin, 1975)。南亚的交际规范尤其频繁地使用间接言语行为作为礼貌策略。例如: 一位母亲在上午11点进入儿子的房间,问道(印地语)“Beta, kya aaj chutti hai kya?”(“儿子,今天放假吗?”),她并非在询问日历信息。她是在发出间接的命令,要求起床并开始工作。 同样,一位旁遮普语主人一边将食物摆到客人面前,一边说“kuch khaas nahi baneya”(“没做什么特别的”),这是在进行仪式性的款待,而非真诚的自我批评。 (3) 会话含义指传达但未明确陈述的意义,要求听者超越字面内容进行推理(Bach, 2006)。在印度语言中,会话含义常常通过植根于文化的、缺乏文化知识则难以理解的表达来传达。例如: 一位老师对拉胡尔说“Tumne toh iss pareeksha mein pass hokar kila jeet liya”(“你通过这次考试,就像赢得了一座堡垒”),这是使用常见的印地语夸张手法表达赞扬。处理字面意义的模型会预测拉胡尔赢得了一座真实的堡垒;正确的推论是老师仅仅是在祝贺他通过考试。 同样,在泰米尔语中,母亲对即将离开的客人说“kai nenachu po”(“湿着手走吧”),这不是在发出卫生指令,而是在热情地、保全面子地邀请他们留下吃饭。这种仪式性的间接性正是该表达的社会意义所在。 (4) 社会语用捕捉了社会因素(如亲属关系、性别规范、权力动态和关于面子的文化惯例)如何塑造语言使用(Ma et al., 2025)。这些题目要求模型运用超越语言能力的文化世界知识。例如: 在旁遮普语中,拥抱男性朋友而对其妻子则合十行礼(hath jodna)并说“Sat Sri Akal”,这是混合性别拜访的文化恰当规范。缺乏文化基础的模型可能错误地解读为对妻子的不同态度。 在马拉雅拉姆语中,称呼朋友的姐姐需要将她的名字与亲属尊称“chechi”结合:“Anjana chechi”是礼貌形式,单独说“Anjana”显得不尊重,而单独说“Chechi”则过于疏远。 (5) 连贯性要求推理话语在一个更大语篇单元中如何相互关联,超越任何单句所传达的内容(Van Dijk et al., 1997)。现有工作大量依赖句子排序或叙事完形填空任务(Barzilay and Lapata, 2008; Mostafazadeh et al., 2016; Beyer et al., 2021)。相比之下,我们的题目测试印度语言段落内的语篇级推理,其中主题相关但语篇不连贯的干扰项要求模型跟踪论证结构,而非依赖关键词重叠。例如: 一个泰米尔语段落按顺序描述了一顿传统的香蕉叶餐...热米饭、扁豆、酥油、Kootu、Poriyal,最后是Payasam。最合适的响应是补充像Vadai和Appalam这样完善盛宴的配菜。像“香蕉叶餐不再常见”或“很难在叶子上供应”这类选项虽然主题相关,但与语篇无关。
相似文章
SurakshaEval:面向多语言大语言模型的印度语言安全基准
介绍了 SurakshaEval,一个涵盖十种印度语言和英语的大语言模型安全基准,包含跨越七种危害类型的人工编写提示词。对多语言大语言模型进行基准测试,并发现了过度拒绝、在印度语言语境中遗漏隐含偏见等问题。
你的LLM评判者有多虚伪?大型语言模型语用能力中的听者-说者不对称性
本文通过比较LLM作为语言恰当性评判者与作为语用恰当语言生成者的表现,研究了LLM语用能力中的不对称性。研究发现,许多模型作为语用听者的表现显著优于作为说者的表现,表明评估能力与生成能力之间存在错位。
Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。
前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。
重排中迷失:语义保持扰动下多语言大语言模型的结构敏感性
本文研究了多语言大语言模型在印地语和马拉雅拉语中对语义保持扰动的结构敏感性,结果显示在数学推理性能上有显著下降,并引入了IndicReStruct基准进行评估。