Indi-RomCoM:评估LLM在罗马化印度语-英语混合指令上的代码混合基准
摘要
介绍了Indi-RomCoM,这是一个用于评估LLM在四种印度语言罗马化代码混合(RCM)指令上的基准,发现LLM在RCM任务上表现不佳,且性能随代码混合密度增加而下降。
arXiv:2606.30790v1 公告类型:新
摘要:罗马化代码混合(RCM),即双语使用者将本地语言与英语在罗马字母中流畅混合,已成为多语言社区中主要的交流形式。虽然大型语言模型(LLM)在单语和本地脚本基准上表现强劲,但它们在RCM内容上遵循指令和推理的能力仍然很大程度上未被探索。为此,我们引入了Indi-RomCoM基准,以促进对印度罗马化代码混合指令的系统性评估。我们的基准涵盖七个指令遵循任务、四种广泛使用的印度语言,以及三种受控的代码混合强度等级。我们在零样本和少样本设置下全面评估了一系列LLM,包括专有模型、开源权重模型和针对印度语的模型。LLM在RCM指令上始终表现不佳,且性能随代码混合密度增加而下降。此外,推理任务比检测任务(如毒性检测)退化更少,因为生成的解释提供了必要的上下文。我们相信Indi-RomCoM有助于社区开发包容性的多语言系统。
查看缓存全文
缓存时间: 2026/07/01 05:31
# Indi-RomCoM: 用于评估大语言模型在罗马化印度语-英语混合指令上的代码混合基准 来源:https://arxiv.org/html/2606.30790 Avisha Das¹, Mihir Parmar², Mohana Ramnath¹, 和 Pulkit Verma³ ¹金奈希夫·纳达尔大学,²Google Cloud AI Research,³印度理工学院马德拉斯分校 avishadas@snuchennai\.edu\.in, mihirparmar@google\.com, mohana23110098@snuchennai\.edu\.in, pulkitv@cse\.iitm\.ac\.in ###### 摘要 罗马化代码混合(Romanized Code Mixing,RCM)是指双语使用者将当地语言与英语在罗马字母文本中自然融合,这已成为多语言社区中的主流沟通形式。尽管大型语言模型(LLMs)在单语和原生文字基准上表现强劲,但它们对基于 RCM 内容进行指令遵循和推理的能力在很大程度上尚未得到探索。为此,我们引入了 Indi-RomCoM 基准,旨在促进对罗马化印度语-代码混合指令的系统评估。我们的基准涵盖了七项指令遵循任务、四种广泛使用的印度语言以及三个受控的代码混合强度等级。我们在零样本和少样本设置下,对涵盖专有模型、开源权重模型和印度语专注模型的一系列 LLM 进行了全面评估。LLMs 在 RCM 指令上的表现持续不佳,性能随着代码混合密度的增加而下降。此外,推理任务的性能下降程度低于检测任务(例如,毒性检测),因为生成的解释提供了必要的上下文。我们相信 Indi-RomCoM 能帮助社区开发更具包容性的多语言系统。 [bengali] rm[BoldFont=NotoSansBengali-Regular.ttf] NotoSansBengali-Regular.ttf [tamil] rm[BoldFont=NotoSansTamil-Regular.ttf] NotoSansTamil-Regular.ttf [hindi] rm[BoldFont=NotoSansDevanagari-Regular.ttf] NotoSansDevanagari-Regular.ttf [gujarati] rm[BoldFont=NotoSansGujarati-Regular.ttf] NotoSansGujarati-Regular.ttf # Indi-RomCoM: 用于评估大语言模型在罗马化印度语-英语混合指令上的代码混合基准 Avisha Das¹, Mihir Parmar², Mohana Ramnath¹, 和 Pulkit Verma³ ¹金奈希夫·纳达尔大学,²Google Cloud AI Research,³印度理工学院马德拉斯分校 avishadas@snuchennai\.edu\.in, mihirparmar@google\.com, mohana23110098@snuchennai\.edu\.in, pulkitv@cse\.iitm\.ac\.in ## 1 引言 确保大型语言模型(LLMs)能够遵循日常地区语言风格的指令,是其全球部署的关键要求 (Gupta et al. 2024 (https://arxiv.org/html/2606.30790#bib.bib16);Deuchar 2020 (https://arxiv.org/html/2606.30790#bib.bib13))。印度是这一挑战的典型例子,因为它拥有极其多样化的语言环境,包括22种官方语言,由超过14亿人口使用。在这种多语言环境中,英语与当地语言混合,产生了一种自然且规律性的现象,称为罗马化代码混合(RCM) (Sengupta et al. 2024 (https://arxiv.org/html/2606.30790#bib.bib37);Winata et al. 2023 (https://arxiv.org/html/2606.30790#bib.bib42))。受字符限制、智能手机上按音打字以及会话便利性的驱动,数百万双语用户将地区性印度语词汇、英语术语和当地语法流畅地混合在单个句子中,且完全使用拉丁字母。 参见图注 **图1:示例 (LLaMa-7B-Instruct) 显示未能理解罗马化的“Tanglish”。** 例如,一个印地语-英语使用者问:“Yeh loan ke liye mujhe kya karna padega?” 这翻译成“我该怎么做才能得到这笔贷款?”这些句子是高度结构化的日常语域,主导着南亚的数字文本。然而,尽管生成式AI模型在标准的单语言测试集上表现良好,但在处理这些混合语言设置时,其准确性会急剧下降,如图1所示(泰米尔语-英语)。专为印度次大陆构建的开源权重 LLM,例如 Airavata (Gala et al., 2024 (https://arxiv.org/html/2606.30790#bib.bib14))、TamilLLaMA (Balachandran 2023 (https://arxiv.org/html/2606.30790#bib.bib5)) 和 Sarvam-1 (Sarvam AI, 2024 (https://arxiv.org/html/2606.30790#bib.bib36)),虽然提高了在原生文字上的表现,但当面对罗马化文本时,它们的能力就会失效。一个主要障碍是 NLP 社区缺乏系统诊断这些失败模式的基准测试系统。像 GLUECoS (Khanuja et al., 2020a (https://arxiv.org/html/2606.30790#bib.bib22)) 这样的传统代码混合数据收集仅限于低级别的逐词分类任务,例如标注词性,无法评估高级推理。相反,像 CodeMixBench (Yang and Chai, 2025a (https://arxiv.org/html/2606.30790#bib.bib45)) 这样的较新生成式基准则仅限于原生文字。这实际上使它们无法捕捉到表征人与模型交互的拼写和语音变化。关于不同最先进代码混合基准的比较,请参见表1 (https://arxiv.org/html/2606.30790#S2.T1)。 为了弥补这一评估空白,我们引入了 Indi-RomCoM,这是一个旨在对大型语言模型在罗马化印度语-英语指令上进行压力测试的系统性基准。我们的框架涵盖四种主要地区语言,跨越七种核心任务类型,利用一个语言受控的生成管线将输入划分为精确的代码混合强度层级。通过这个过程,我们构建了一个大规模评估套件,并由母语双语标注员验证,以确保强大的语义保留和语境自然性。使用 Indi-RomCoM,我们在零样本和少样本设置下评估了19个突出的语言模型。我们的实验表明,无论是通用型还是专门的印度语专注开源权重架构,随着代码混合强度的增加,性能都会出现严重且单调的下降。框架的全面结构分解在第3节 (https://arxiv.org/html/2606.30790#S3) 中提供。 总之,我们引入了 Indi-RomCoM,这是一个使用新颖的受控词汇选择框架开发的多任务基准,用于评估 LLMs 在 RCM 上的表现。此外,我们对广泛使用的 LLMs 进行了全面的实证分析,并引入了语域偏离率(Register Defection Rate,RDR)来量化推理过程中的语言切换失败。 ## 2 先前工作 **表1:与现有资源的对比。缩写含义:NS = 原生文字,RS = 罗马化原生文字,Clf. = 分类。密度列跟踪基准是否评估不同语言混合百分比的性能。我们的框架独特地支持多个独立的密度层级,分别代表25%、50%和75%词汇切换强度的文本集。** 参见图注 **图2:Indi-RomCoM 创建框架概览。管线通过初始翻译(第一阶段)处理纯英语和印度语原生任务,应用基于分类法的生成引擎创建受控的25%、50%和75%强度的代码混合(第二阶段和第三阶段),最后通过文字罗马化生成最终的多层级基准(第四阶段)。** #### 代码混合 NLP 的基准 早期的代码混合(CM)语篇计算建模主要集中在词元级分类任务或合成文本生成上。像 GCM Toolkit (Rizvi et al., 2021 (https://arxiv.org/html/2606.30790#bib.bib34)) 这样的框架通过计算化地操作结构语言学约束(例如等价约束和矩阵语言框架理论)来从平行语料库合成数据,奠定了早期基础。类似地,Sravani and Mamidi (2023 (https://arxiv.org/html/2606.30790#bib.bib38)) 利用神经机器翻译(NMT)架构,采用代码混合指数(CMI)和 M-index 等过滤器来优化合成输出。虽然这些方法推动了局部语言建模和单独数据集(如 GLUECoS (Khanuja et al., 2020b (https://arxiv.org/html/2606.30790#bib.bib23)) 或 LinCE (Aguilar et al., 2020 (https://arxiv.org/html/2606.30790#bib.bib2)))的发展,但它们严重依赖于正式的原生文字,针对分类管线,并且缺乏探索多任务指令遵循的框架。如表1 (https://arxiv.org/html/2606.30790#S2.T1) 所述,最近的生成式评估方法,如 CodeMixBench (Yang and Chai, 2025a (https://arxiv.org/html/2606.30790#bib.bib45)) 和 ChiEngMixBench (Yang et al., 2026 (https://arxiv.org/html/2606.30790#bib.bib44)),强调了 LLMs 在 CM 输入上的显著性能下降,特别是在数学推理和对话方面。 #### 印度语 LLMs 与资源 针对印度语的模型和数据集开发已加速进行,以应对南亚的语言多样性。大规模资源项目,如 IndicLLMSuite (Khan et al., 2024a (https://arxiv.org/html/2606.30790#bib.bib20)) 和 UPDESH (Chitale et al., 2025 (https://arxiv.org/html/2606.30790#bib.bib7)),提供了涵盖13至22种语言的广泛预训练语料库,而专门的开放权重架构,包括 Airavata (Gala et al., 2024 (https://arxiv.org/html/2606.30790#bib.bib14))、Tamil-Llama (Balachandran, 2023 (https://arxiv.org/html/2606.30790#bib.bib5)) 和 Sarvam-1 (Sarvam AI, 2024 (https://arxiv.org/html/2606.30790#bib.bib36)),则最大化地提升了本地化句法表示。尽管取得了这些进展,但仍存在关键差距。首先,这些套件仍然局限于原生文字,导致 CM 验证在官方评估循环中缺失。通过众包收集的音译或 CM 提示(例如,Airavata 的 Anudesh¹ 管线)很少被分离出来用于正式的行为验证或在不同密度阈值下进行基准测试。最近的评估进一步强调了这一紧迫性:IndicDB (Dawar et al., 2026 (https://arxiv.org/html/2606.30790#bib.bib12)) 揭示了在罗马化 Hinglish 指令下执行能力的急剧下降,而 IndicSafe (Pattnayak and Chowdhuri, 2026 (https://arxiv.org/html/2606.30790#bib.bib32)) 尽管在审核南亚安全模型,却忽视了现实世界双语打字中固有的形态混合。少数确实涉及罗马化的本地化研究范围狭窄,例如 Choudhary et al. (2026 (https://arxiv.org/html/2606.30790#bib.bib8)) 将其分析限制在印地语-英语对中的动词层级屈折变化。Indi-RomCoM 弥补了这些差距,提供了首个经过人工验证的多任务、多层级基准,用于评估罗马化代码混合指令遵循,并对一系列 LLM(闭源、开源权重以及印度语专注模型)针对非正式印度语书写中自然语言漂移的表现进行了全面评估。 ## 3 Indi-RomCoM 基准 图2 (https://arxiv.org/html/2606.30790#S2.F2) 展示了 Indi-RomCoM 基准的所有阶段。 ### 3.1 任务设计与选择 我们评估 LLM 在罗马化代码混合指令上的表现,涵盖七个任务,横跨三个能力维度:逻辑推理、语义理解和内容审核。所有任务均来源于经过充分验证的公开数据集,具有平衡的标签分布,确保观察到的性能差异反映真实的代码混合敏感性,而非数据伪影 (Bai et al. 2024 (https://arxiv.org/html/2606.30790#bib.bib4);Kwan et al. 2024 (https://arxiv.org/html/2606.30790#bib.bib25))。对于逻辑推理,我们包含了来自 Super-NaturalInstructions 的词语类比和问题分解任务 (Wang et al. 2022 (https://arxiv.org/html/2606.30790#bib.bib41)),以及来自 GSM8K 的数学推理任务 (Cobbe et al. 2021 (https://arxiv.org/html/2606.30790#bib.bib9))。对于语义理解,我们从 AI4Bharat IndicXtreme 集合中选取了释义检测、情感分析和自然语言推理任务 (Kunchukuttan et al. 2020 (https://arxiv.org/html/2606.30790#bib.bib24);Aggarwal et al. 2022 (https://arxiv.org/html/2606.30790#bib.bib1))。毒性检测任务改编自 IndicAlign-Toxic Matrix (Chitale et al. 2025 (https://arxiv.org/html/2606.30790#bib.bib7))。表2 (https://arxiv.org/html/2606.30790#S3.T2) 总结了完整的任务清单;详细描述和数据集统计信息见附录A (https://arxiv.org/html/2606.30790#A1)。 #### 语言 我们评估了四种主要印度语言的罗马化印度语-英语代码混合设置:印地语、孟加拉语、古吉拉特语和泰米尔语,涵盖了印度-雅利安语系和达罗毗荼语系。这些语言捕捉了双语印度语-英语交流中常见的多样化语言结构、资源水平和代码混合模式 (Chitale et al. 2025 (https://arxiv.org/html/2606.30790#bib.bib7);Jaavid et al. 2024 (https://arxiv.org/html/2606.30790#bib.bib18))。 **表2:Indi-RomCoM 任务清单。所有实例均来源于经过验证的源数据,具有分层标签分布。任务类型:GEN = 生成,CLF = 分类。** ### 3.2 代码混合框架 我们开发了一个四步框架,用于为 Indi-RomCoM 基准生成受控的印度语-英语 RCM 实例。基于等价约束 (Poplack 2001 (https://arxiv.org/html/2606.30790#bib.bib33)) 和矩阵语言框架 (Myers-Scotton 1993 (https://arxiv.org/html/2606.30790#bib.bib30)) 双语切换理论,我们系统性地改变混合强度,同时保持语义一致性。完整的实现细节和提示策略等见附录B (https://arxiv.org/html/2606.30790#A2)。 #### 英语到印度语的翻译 纯英语任务(词语类比、问题分解 (Wang et al. 2022 (https://arxiv.org/html/2606.30790#bib.bib41)) 和 GSM8K (Cobbe et al. 2021 (https://arxiv.org/html/2606.30790#bib.bib9)))通过机器翻译和精炼的两步管线翻译成印度语版本。其他任务直接来源于其现有的印度语数据集:IndicXNLI (Aggarwal et al. 2022 (https://arxiv.org/html/2606.30790#bib.bib1))、IndicAlign-Toxic (Chitale et al. 2025 (https://arxiv.org/html/2606.30790#bib.bib7))、IndicXParaphrase (Khan et al. 2024b (https://arxiv.org/html/2606.30790#bib.bib21)) 和 IndicSentiment (Gala et al. 2024 (https://arxiv.org/html/2606.30790#bib.bib14))。 #### 词汇选择分类法 每个可切换的单词或短语被划分到五个语言学动机类别之一 (Poplack 2001 (https://arxiv.org/html/2606.30790#bib.bib33);Winata et al. 2023 (https://arxiv.org/html/2606.30790#bib.bib42)),并记录其类别标签、印度语替换词以及语言学理由,以确保替换反映自然的双语行为,而非任意替换。附录中的表9 (https://arxiv.org/html/2606.30790#A2.T9) 总结了五个类别、它们的切换策略以及跨语言示例。 #### 代码混合强度等级 通过逐步激活类别子集来产生三个强度等级(25%、50%、75%),代码混合指数(CMI) (Srivastava and Singh 2021 (https://arxiv.org/html/2606.30790#bib.bib39)) 量化了被替换的英语词元比例。 #### 印度语文字的罗马化 所有印度语文字输出使用 Aksharantar (Madhani et al. 2023b (https://arxiv.org/html/2606.30790#bib.bib27)) 和 Aksharamukha 转换为拉丁字母,端到端的罗马化可用的地方则源自 IndicLLMSuite (Khan et al. 2024b (https://arxiv.org/html/2606.30790#bib.bib21))。自然音译变异性被有意保留,以反映多语言南亚用户在现实世界中使用罗马化代码混合的习惯。 ### 3.3 基准验证与统计分析 #### 数据集大小 我们从七个任务中的每一个任务中抽取100个实例作为样本。
相似文章
Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。
MultiSoc-4D:用于诊断孟加拉语社交媒体封闭集大语言模型标注中指令诱导标签崩溃的基准
本文介绍了 MultiSoc-4D,这是一个用于诊断大语言模型在标注孟加拉语社交媒体数据时出现的指令诱导标签崩溃问题的基准测试。研究揭示,大语言模型系统性地倾向于使用默认标签,导致对仇恨言论和讽刺等少数类别的检测不足。
按我说的做,不是按我做的做:LLM中的指令-归纳冲突
本文研究了LLM中指令遵循与模式补全之间的冲突,发现指令遵循在归纳压力下较为脆弱,且在不同模型间差异显著,而输出多样性是鲁棒性的主要因素。
语言塑造多语言大语言模型中指令层级遵循度
本文介绍了XIH-Bench,一个用于评估多语言大语言模型中指令层级遵循度的基准,揭示了语言依赖的不对称性以及语言边界效应,即跨语言冲突比同语言冲突产生更高的遵循度。
新LLM协调基准 - 在语言智能体中评估开放式多智能体协调 [R]
介绍了一个用于评估LLMs中多智能体协调的新基准,发现大多数模型在处理长期开放式任务时表现不佳,但Gemini 3.1 Pro在最具挑战性的设置下表现与经过训练的MARL智能体相当。