L3Cube-IndicQuest v2: 用于评估大型语言模型在印度语言中事实知识的大规模多语言基准测试
摘要
文章介绍了L3Cube-IndicQuest v2,这是一个大规模多语言基准测试,旨在评估大型语言模型在印度语言中的事实知识,并展示了六个模型的评估结果。
查看缓存全文
缓存时间: 2026/08/18 10:10
# 评估跨印度语言大语言模型事实知识的大规模多语言基准测试
来源:https://arxiv.org/html/2608.15535
## L3Cube\-IndicQuest v2:评估跨印度语言大语言模型事实知识的大规模多语言基准测试
Rinit JainTirthraj Mahajan所属机构:\[4pt\] Pune计算机技术学院,Pune所属机构:L3Cube实验室,PuneAdvait Joshi所属机构:\[4pt\] Pune计算机技术学院,Pune所属机构:L3Cube实验室,PuneRaviraj Joshi所属机构:L3Cube实验室,Pune所属机构:印度理工学院马德拉斯分校\[4pt\]\{rinitjain9, tirthraj2004, advaitkjoshi, ravirajoshi\}@gmail\.com
###### 摘要
我们提出L3Cube\-IndicQuest v2,这是一个大规模、黄金标准的多语言问答基准测试,用于评估大型语言模型(LLM)的印度特定事实知识。该基准包含3,471个基于课程的英语问答对,涵盖九个领域,内容精选自教育课程、竞赛考试材料和领域参考书籍。我们引入了一种实用的混合构建策略,结合基于上下文的、基于LLM的问题生成与验证、语义去重和人工验证,从而在保持标注质量的同时实现基准数据的规模化创建。该基准被翻译成19种印度语言,最终生成了一个公开发布的多语言数据集,包含20种语言的69,420个问答对。我们使用三种协议评估了六个LLM:LLM-as-a-judge(大语言模型作为评委)以及两种确定性词法标准:精确子串匹配和词重叠匹配。这三种方法得出的模型排名几乎一致,表明结果不依赖于评委模型的选择。领先的商业模型遥遥领先,而在开源模型中,Gemma4 31B在所有评估的印度语言中均优于专门针对印度语的Sarvam 30B。
## 1引言
大型语言模型发展迅速,但其对印度特定知识的表示仍然薄弱。在通用英语基准测试上表现良好的模型,在回答关于印度历史、法律、地区文化或课程水平知识的问题时常常出错。印度语言在大多数多语言模型的预训练语料库中代表性不足,且广泛使用的知识基准测试仍以英语为中心。
00101020203030404050506060707080809090100100Gemini 2\.5 FlashGemma4 31BGPT\-5\.4 MiniSarvam 30BGemma2 9BLlama 3\.1 8B86\.986\.962\.262\.260\.160\.148\.748\.741\.141\.135\.435\.4626237\.337\.337\.837\.827\.727\.721\.921\.918\.218\.2英语子集准确率(%)LLM\-as\-a\-judge精确子串图1:在LLM评委(Gemma 3 12B)和精确子串匹配下,英语子集的准确率。Gemma4 31B和GPT\-5\.4 Mini在两种协议下交换了位置。短形式的事实问答是衡量此类知识的标准方式。SimpleQA设定了格式:简短的问题只有一个正确答案,这使得评分可控。SimpleQA Verified后来表明,此类基准测试仍然需要去重和标签检查。两者都是纯英语,且都不涵盖区域知识,因此都无法衡量模型对国家或文化特定事实的了解程度。针对印度语言的基准测试主要测试阅读理解或翻译,而非开放域知识召回。L3Cube\-IndicQuest v1是首个针对跨20种语言的印度特定事实知识的基准,每种语言包含200个手工策划的问答对,涵盖五个领域,但其规模和对Wikipedia的依赖限制了其测量能力。
手工扩展这项工作不切实际。因此,IndicQuest v2将任务分割:LLM智能体负责大量工作,人工标注员负责判断工作。一个智能体从分块的课程文本中生成候选问答对,第二个智能体对它们进行评分并交叉检查答案,一个去重引擎合并近乎相同的问题,三个标注员审查所有通过筛选的内容。图1总结了该基准和主要结果。我们的贡献包括:
- • 一个混合的智能体-人工流程,用于大规模构建基于课程的问答数据。我们在一个可扩展的框架中结合了智能体生成与验证、语义去重和人工验证,以产生高质量的基准数据。
- • IndicQuest\-v2,一个公开发布的、针对印度特定事实知识和幻觉评估的基准,涵盖20种语言,包含3,471个英语问答对(跨九个领域)和总共69,420个多语言问答对。
- • 关于自动验证局限性的证据:人工审查删除了已经通过两个自动关卡的20–25%的问答对。
- • 使用三种协议评估了六个LLM,涵盖商业、通用开源权重和印度语专用模型:LLM评委(Gemma 3 12B)、精确子串匹配和词重叠匹配。第一种接受释义;后两种是确定性的,不需要评委模型。排名在所有三种方法中都保持一致。
## 2相关工作
#### IndicQuest v1。
L3Cube\-IndicQuest v1是本工作的直接前身:包含英语和19种印度语言的4,000个问答对,涵盖文学、历史、地理、政治和经济学。使用Llama\-3\.1\-405B\-Instruct作为评委,英语的表现优于所有印度语言,其中曼尼普尔语、奥里亚语和乌尔都语表现最弱。表1总结了v2如何扩展了它。
参考标题
图2:IndicQuest v2数据集构建流程:PDF提取和分块、智能体1生成、智能体2验证、语义去重、人工专家审查以及翻译成19种印度语言。
#### 多语言问答基准测试。
TyDi QA涵盖十一种类型多样化的语言。XQuAD和MLQA提供了源自SQuAD的跨语言阅读理解集合,MEGA涵盖16个数据集和70种语言。所有这些都提供了上下文段落或迁移现有任务,而IndicQuest则针对没有段落的开放域知识召回。
表1:IndicQuest v1与v2的关键属性对比。
#### 短形式事实性基准测试。
SimpleQA Verified通过去重和主题平衡改进了SimpleQA,发现标签噪声和冗余会影响测量的准确率。IndicQuest v2使用相同的短答案设计来评估印度特定知识,并以20种语言发布。
#### 文化和区域特定评估。
BLEnD和INCLUDE测试日常文化和区域知识。对于印度,MILU涵盖考试式理解,IndicGenBench涵盖生成任务,PARIKSHA研究人类与LLM评估者的一致性。而IndicQuest v2则将开放域事实问答植根于印度课程文本。
#### 印度NLP数据集和模型。
IndicQA使用Wikipedia上下文段落涵盖十一种印度语言,提出了一个封闭式问答基准,IndicSQuAD从SQuAD构建了九种印度语言的抽取式集合。这三者都评估在提供段落上的理解能力,而IndicQuest v2衡量的是闭卷知识召回。IndicNLPSuite提供基础的单语语料库,Airavata表明了印地语指令微调带来的收益,Sarvam的30B模型将其扩展到更广泛的印度语言预训练。
#### LLM\-as\-a\-Judge。
建立了范式,使用MT\-Bench和Chatbot Arena,AlpacaEval添加了长度控制评分以减少冗长偏见,而综述了其失败模式。由于评委的怪癖可能影响报告分数,我们在评委之外还报告了两种确定性标准(第5.2节)。
## 3数据集构建
表2:来自IndicQuest v2英语子集的代表性问答对,每个领域一个。每个标准答案是一个到五个词,并且逐字出现在源文本中。### 3\.1来源材料
IndicQuest v2借鉴了正式的印度教育和参考书籍,这是与v1中使用的网络来源的一个刻意转变:
- • 学校课程:NCERT(6-12年级)、SSC马哈拉施特拉邦委员会(4-10年级)、CBSE、ICSE和HSC的历史、地理、科学和社会研究教科书。
- • 竞赛考试材料:涵盖印度政体、历史、经济学和常识的UPSC和MPSC备考书籍。
- • 领域参考书籍:关于印度法律和宪法的书籍,以及关于印度科学史和体育史的专业书籍。
印度体育史和印度对科学的贡献在很大程度上不在学校课程范围内,这使得它们成为v2中最具新意的领域。构建
### 3\.2问题设计原则
每个问题都受三个约束条件的支配,两个智能体都强制执行这些约束。
#### 简短答案。
简短答案长度为一个到五个词,并且逐字出现在源文本中:一个名称、一个日期、一个地点或一个术语,绝不是句子或解释。这使得评估更简单。一个简短的短语要么与标准答案匹配,要么不匹配,因此与比较长的开放式答案相比,歧义很少,并且回答也可以通过简单的字符串比较来评分,而不需要评委模型(第4.3节)。
#### 无歧义性。
每个问题的设计使得只有一个答案是正确的。第3.3节中描述的流水线的两个智能体从两端强制执行这一点:生成智能体避免模糊或指向性的措辞,使用完整的专有名称,而验证智能体拒绝任何允许超过一个可辩护答案的问答对。有歧义的问答对被丢弃而不是修复。
#### 自包含性和印度特定性。
问题必须能在没有源段落的情况下回答,并且不得引用源段落,因为在评估时不提供上下文。每个问题必须涉及印度历史、地理、政体、法律、文化、科学或体育。表2给出了每个领域的一个示例。
### 3\.3构建流程
上述原则通过一个六阶段流水线强制执行(图2);提示词在附录C中。
- • 提取:将源书籍转换为文本,分割成段落大小的块。
- • 智能体1:从每个块生成候选问答对。
- • 智能体2:对每个问答对进行评分并交叉检查答案。
- • 去重:合并来自重叠书籍的近乎相同的问题。
- • 验证:三个标注员审查每一个存活下来的问答对。
- • 翻译:经过验证的英语集合被翻译成19种印度语言。
### 3\.4智能体1:问答生成
智能体1在Gemini 2\.5 Flash上运行,接收来自源PDF的分块文本并生成事实性、自包含的问答对。其提示词(附录C\.1)强制执行第3\.2节的约束,并确保足够的难度以区分模型。
### 3\.5智能体2:质量验证
智能体2同样在Gemini 2\.5 Flash上运行(附录C\.2),从九个维度(每项0-10分,总分90分)对每个候选进行评分:正确性、相关性、难度、整体质量、印度特定性、上下文丰富性、答案质量、语法和结构以及专业知识。它还设置一个二元correctness\_flag和一个来自外部来源的google\_search\_confidence评级。标记为FALSE的问答对被丢弃;其余的根据分数排序并传递下去。
### 3\.6语义去重
涵盖相同主题的书籍会产生不同措辞的等效问题。该引擎根据句子嵌入相似度对排序后的问答对进行聚类,并保留每个簇中得分最高的成员。表3显示了一个真实案例:来自四本书的四个关于Qutbuddin Aibak的问题聚集在一起,只有得分最高的一个被保留。大多数簇是单例,直接通过不变。
状态问题答案分数来源簇19 — 婆罗米文(4个变体)保留哪些在印度南部发现的十二处阿育王铭文使用了何种书写体?婆罗米文90NCERT七年级历史丢弃在印度次大陆大部分地区发现的多数阿育王铭文是用何种书写体书写的?婆罗米文88SSC九年级历史丢弃在斯里兰卡发现的、可追溯至公元前第二和第一世纪的短篇铭文使用了哪种古印度书写体?婆罗米文85UPSC丢弃阿育王主要使用哪种书写体来书写他的大部分皇家信息和铭文?婆罗米文81MPSC历史簇20 — 单个代表,未发现重复保留当成吉思汗接近印度河时,德里哪位苏丹礼貌地拒绝了贾拉鲁丁的避难请求?伊勒图特米什90NCERT七年级表3:实际语义去重情况。绿色行保留为簇代表;红色行作为重复项丢弃。簇19将来自四本源书的四个等效问题合并;簇20显示了常见的单例情况,直接进入人工验证阶段不变。
### 3\.7领域划分与人工验证
英语数据集包含3,471个问答对,跨越九个领域:文化(534)、历史(510)、地理(499)、法律(494)、政治学(450)、科学(325)、体育(273)、艺术(233)和商业研究(153)。规模反映了可用的源材料。接下来,三个标注员独立审查了每个问答对,标记事实错误、措辞模糊、内容过于简单或印度特定性弱的内容。任何被一个审查员标记的问答对在讨论后都会被移除。这删除了20-25%的数据集:智能体1的输出中有一部分通过了所有自动检查,但未能通过专家审查。
### 3\.8翻译与发布
经过验证的问答对被翻译成19种印度语言:阿萨姆语、孟加拉语、多格拉语、古吉拉特语、印地语、卡纳达语、孔卡尼语、迈蒂利语、马拉雅拉姆语、马拉地语、梅泰语(曼尼普尔语)、尼泊尔语、奥里亚语、旁遮普语、梵语、信德语、泰米尔语、泰卢固语和乌尔都语,使用GPT\-5\.4 Mini通过批量API调用完成。最初尝试了Google Cloud和Gemini Translation,但处理法律和政治学术语时表现不一致。问题和答案分批输入相似文章
Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。
介绍 IndQA
OpenAI 推出了 IndQA,这是一个包含 2,278 个问题的新基准,涵盖 12 种印度语言和 10 个文化领域,旨在评估 AI 模型对现有基准无法捕捉的文化细微差别和推理密集型任务的理解能力。IndQA 由 261 位领域专家创建,针对 MMMLU 等现有多语言基准的饱和问题,重点关注真实世界的文化理解,而不是翻译或多选题任务。
COILD:一个以印度语言为中心的平行语料库与跨语言机器翻译基准
本文介绍了COILD,这是一个以印度语言为中心的平行语料库,包含超过116万对句子,覆盖20对印度语言,并提供了一个以领域为中心的基准。研究结果表明,在微调多语言模型时,机器翻译性能得到了显著提升。
FACTS基准测试套件:系统性评估大语言模型的事实性
Google DeepMind与Kaggle联合推出了FACTS基准测试套件,这是一套涵盖参数化知识、检索增强、多模态和 grounding 的综合评估体系,用于系统性衡量大语言模型的事实性。
IndicTalk:面向印度语言的基于角色的大规模多语言对话语料库
IndicTalk 是一个大规模多语言对话语料库,涵盖9种印度语言,包含代码混合对话,通过自动化流水线生成,结合新闻基础(news grounding)和角色条件(persona conditioning),旨在推动面向代表性不足语言的对话AI发展。