Inspect India Evals:面向印度语言文化语境的大语言模型开放评估框架
摘要
介绍Inspect India Evals,一个用于在印度语言文化语境中评估大语言模型的开源框架,包含六项基准测试,涵盖多语言能力、偏见、安全性和文化知识。对五个模型的测试显示,Sarvam-M 24B和Gemma 2 27B表现领先。
arXiv:2607.25375v1 公告类型:新
摘要:印度是一个拥有超过14亿人口的广阔国家,拥有数百种多样且具地方特色的传统和文化,以及22种官方认可的语言。大语言模型(LLM)现已在印度本土乃至偏远乡村大规模部署。然而,常见的基准测试——MMLU、BIG-Bench和TruthfulQA——几乎完全是英语和西方中心化的。它们无法识别印度语境中特有的安全、公平和准确性缺陷。这正是Inspect India Evals试图填补的空白。它是一个基于英国AISI的Inspect AI平台构建的开源框架,包含六项基准测试:涵盖16种印度语言的多语言MMLU、BharatBBQ(我们对BBQ的改编,用于印度社会偏见)、数字公共基础设施安全评估、使用印度语言有害提示的多语言安全测试、多轮越狱抵抗测试,以及使用LLM-as-judge评分标准评估的印度文化知识基准。在本研究中,我们测试了五个参数规模从8B到32B的开源模型。Sarvam-M 24B和Gemma 2 27B表现最佳,在综合印度公平指数上均获得80%的分数,其中Sarvam-M在印度文化知识和数字公共基础设施安全合规性上甚至击败了更大的32B模型。所有模型在多语言安全测试中均达到100%拒绝率,而数字公共基础设施安全得分则在20%到100%之间。该框架是公开的,可与英国AISI注册表配合使用。任何人都可以复现或扩展这项工作。
查看缓存全文
缓存时间: 2026/07/29 09:55
# Inspect India Evals:在印度语言和文化背景下评估大语言模型的开放基准框架 来源:https://arxiv.org/abs/2607.25375 查看 PDF (https://arxiv.org/pdf/2607.25375) > 摘要:印度是一个拥有超过14亿人口的广阔国家,其特点在于数百种多样化且具有地方特色的传统与文化,以及22种官方认可的语言。大语言模型(LLMs)如今正大规模部署在印度本土乃至偏远村庄。然而,常见的基准测试——MMLU、BIG-Bench 和 TruthfulQA——几乎完全以英语和西方为中心。它们未能识别出印度背景下特有的安全、公平和准确性方面的失败。这正是 Inspect India Evals 旨在填补的空白。它是一个开源的框架,构建于英国 AISI 的 Inspect AI 平台之上。该框架包含六个基准测试:涵盖十六种印度语言的多语言 MMLU、BharatBBQ(我们对 BBQ 针对印度社会偏见的改编)、面向数字公共基础设施的安全评估、使用印度语言中有害提示的多语言安全测试、多轮越狱抵抗测试,以及使用 LLM 作为评委的评分规则进行评分的印度文化知识基准。在本研究中,我们测试了五个开源权重模型,参数规模从 8B 到 32B 不等。Sarvam-M 24B 和 Gemma 2 27B 表现最佳,两者在综合印度公平指数上均获得 80% 的分数,其中 Sarvam-M 在印度文化知识和 DPI 安全合规性方面甚至超越了更大的 32B 模型。所有模型在多语言安全测试中均达到 100% 拒绝率,而 DPI 安全合规性则从 20% 到 100% 不等。该框架是公开的,设计用于与英国 AISI 注册表配合使用。任何人都可以复现或扩展这项工作。 ## 提交历史 来自:Abhishek Singh [查看邮件 (https://arxiv.org/show-email/a7477d01/2607.25375)] **[v1]** 2026年7月28日 星期二 07:30:12 UTC (1,132 KB)
相似文章
@SarvamAI:我们开源两套评估印度语 ASR 的框架,并发布覆盖 22 种语言的完整评测指南。WER(…
SarvamAI 发布开源评估框架与指南,专为 22 种印度语言设计,解决传统 WER/CER 指标在该场景下的局限。
前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。
介绍 IndQA
OpenAI 推出了 IndQA,这是一个包含 2,278 个问题的新基准,涵盖 12 种印度语言和 10 个文化领域,旨在评估 AI 模型对现有基准无法捕捉的文化细微差别和推理密集型任务的理解能力。IndQA 由 261 位领域专家创建,针对 MMMLU 等现有多语言基准的饱和问题,重点关注真实世界的文化理解,而不是翻译或多选题任务。
当英语改写本地知识:大语言模型中的全球叙事主导
本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。
Voice of India:面向印度真实场景的大规模语音识别基准
研究者发布 Voice of India,一个包含 536 小时、覆盖 15 种印度语言和 139 个区域集群的即兴电话对话闭源基准,揭示地理与人口统计学层面的 ASR 性能差异。