MSQA: 一个原生来源的多语言多文化SimpleQA基准测试
摘要
本文介绍了MSQA,这是一个包含1,064个原生来源问题的基准测试,覆盖11个语言组和5个文化维度,用于评估多语言大语言模型的文化知识。它揭示了一种系统性的“文化对齐幻觉”,即模型能够流利地输出多语言内容,但缺乏真正的文化理解。
arXiv:2607.00724v1 公告类型:新
摘要:多语言流利性往往带来一个更强的假设:能够说用户语言的模型也必须理解该语言所编码的文化。我们将此称为“文化对齐幻觉”。为了直接检验这一假设,我们引入了MSQA,这是一个包含1,064个原生来源问题的基准测试,覆盖11个语言组、5个文化维度和3个难度等级。与翻译后的基准测试不同,MSQA针对本地化知识,并减少了来自以英语为中心的跨语言迁移的捷径。对18个大语言模型的评估显示,存在显著的文化退化以及明显的“局部效应”:文化能力与预训练暴露程度的关系比与一般推理能力的关系更密切。我们进一步表明,常见的推理时补救措施并不能消除这种幻觉。模型对不熟悉的文化问题仍然过于自信,重复采样产生不稳定而非可靠的正确性,检索增强对长尾事实的帮助也不均衡。这些发现表明,文化对齐不能仅从多语言能力推断,并且需要比推理时的校准、采样或检索更深入的干预。
查看缓存全文
缓存时间: 2026/07/02 05:38
# MSQA:一个原生来源的多语言和多文化 SimpleQA 基准测试 来源:https://arxiv.org/html/2607.00724 Yukai Huang2††footnotemark:Mingxiang Chen2††footnotemark:Xinping Lei![[未标注图像]](https://arxiv.org/html/2607.00724v1/x1.png),3††footnotemark: Fangbing Deng1通讯作者\.Jin Chen1222通讯作者\.Ge Zhang![[未标注图像]](https://arxiv.org/html/2607.00724v1/x2.png)222通讯作者\.Wenhao Huang![[未标注图像]](https://arxiv.org/html/2607.00724v1/x3.png)222通讯作者\.Jiaheng Liu![[未标注图像]](https://arxiv.org/html/2607.00724v1/x4.png),3222通讯作者\.![[未标注图像]](https://arxiv.org/html/2607.00724v1/x5.png)M\-A\-P1字节跳动 Seed2北京邮电大学3南京大学 GitHub:https://github.com/huayuankou333/MSQA 网站:https://huayuankou333.github.io/MSQA 数据集:https://huggingface.co/datasets/m-a-p/MSQA ###### 摘要 大型语言模型(LLMs)的多语言流利性引发了一个诱人的假设:一个会说你的语言的模型一定理解你的文化。我们将其称为*文化对齐幻觉*,并证明这在系统上是错误的。为了揭示这种幻觉,我们引入了 MSQA,这是一个包含 1,064 个原生来源问题的基准测试,涵盖 11 个语言组、五个文化维度和三个难度等级,其设计使得从英语进行的跨语言迁移无法替代真正的文化知识。通过评估 18 个领先的 LLMs,我们发现强大的多语言表现掩盖了严重的文化退化,并且一种显著的地域效应表明,文化能力与预训练分布绑定,而非通用推理。我们进一步描述了维持这种幻觉的三种机制:*过度自信*,即在陌生的文化领域中的高确定性使用户失去不可靠性信号;*随机能力*,即重复采样产生的知识不稳定而非可靠;以及*不平等检索*,即检索增强生成在最需要的长尾文化事实中恰恰失败。这些发现表明,这种差距是结构性的,无法仅通过推理时干预来解决。 11footnotetext:同等贡献。## 1 引言 参考图注图 1:MSQA 数据集概览。信息面板总结了基准测试的文化维度、语言组覆盖范围和类别构成。当用户用泰语询问当地丧葬习俗或用韩语询问敬语规则时,一个流利的回答暗含着一个承诺:模型理解该语言背后的文化背景。这个承诺很难仅从表面形式验证,因为一个回答可能很地道,但仍然缺少使其正确的本地事实、规范或历史参考。我们将这种失败模式称为**文化对齐幻觉**:多语言 LLMs 通过表面流利性投射文化能力,同时掩盖了文化基础知识的差距。 ##### 多语言≠跨文化。 这种区别很重要,因为多语言能力和跨文化能力不是同一种能力。一个*多语言*模型可以跨语言处理和生成文本;一个*跨文化*模型可以推理这些语言中蕴含的信仰、规范、历史和交际惯例。当前的 LLMs 通常实现了前者而缺少后者[click,nativqa]。它们学习了跨语言 token 映射,但这些 token 所承载的文化知识——本地社会等级、区域性的重要历史、制度实践和惯用表达——仍然分布不均。 ##### 为什么现有基准测试强化了这种幻觉。 基于翻译的多语言评估可能强化同样的幻觉。将 MMLU 等英语基准翻译成其他语言,问的是模型能否用*另一种语言表达*西方中心的问题,而不是模型是否拥有该语言文化背景*原生*的知识。因此,一个模型可能看起来在多种语言上都很强大,同时却依赖于从英语主导数据继承的文化知识。如图 2 (https://arxiv.org/html/2607.00724#S1.F2) 所示,当评估从英语来源的事实性 (SimpleQA) 转向原生文化 QA 时,排名发生急剧变化,表明多语言表现并不是跨文化能力的可靠代理。 参考图注图 2:模型排名在 SQA (SimpleQA;英语中心的事实性)、CSQA (中文 SimpleQA;中文事实性) 和 MSQA (原生文化 QA) 之间的变化。剧烈的重新排序表明多语言流利性并不等同于跨文化能力——这是文化对齐幻觉的核心表现。 ##### 揭开幻觉:MSQA 基准测试。 为了直接衡量这一差距,我们引入了 **MSQA**,一个多语言和多文化的 SimpleQA 基准测试,包含 1,064 个原生来源问题,涵盖 11 个语言组:英语、中文、葡萄牙语、泰语、俄语、韩语、法语、日语、马来语、印度尼西亚语和西班牙语。每个项目都有一个基于本地文化证据的可验证答案,被组织到五个文化维度之一,并分为三个难度等级。这种设计使得模型更难仅通过英语中心迁移来成功,同时保留了客观评分。图 1 (https://arxiv.org/html/2607.00724#S1.F1) 总结了该基准测试。我们的代码、交互式项目网站和数据集都已公开。***代码:https://github.com/huayuankou333/MSQA;项目网站:https://huayuankou333.github.io/MSQA;数据集:https://huggingface.co/datasets/m-a-p/MSQA。 ##### 幻觉的三个维度。 在 MSQA 上评估 18 个 LLMs,我们首先发现了一个强烈的**地域效应**:模型在其预训练暴露最丰富的地方表现最好,而在文化密集或覆盖率较低的环境中表现急剧下降。然后我们研究了为什么即使在总体性能差距显现之后,这种幻觉仍然持续存在,通过三种机制:**过度自信**,即模型在陌生的文化问题上保持高度确定;**随机能力**,即重复采样偶尔产生正确答案,但不具备稳定知识;以及**不平等检索**,即检索帮助不均,并在长尾事实上失败。这些发现共同表明,这种差距是结构性的,根源于数据覆盖率,而非简单的推理时限制。 ##### 贡献。 本文做出了三项贡献。首先,我们命名并描述了**文化对齐幻觉**作为当前 LLMs 中一个系统性失败模式。其次,我们引入了 MSQA,一个原生来源的基准测试,旨在衡量多语言流利性和跨文化理解之间的差距。第三,我们提供了一个诊断框架,表明基于置信度的过滤、测试时采样和检索增强并不能可靠地弥合这一差距,这表明文化能力需要在数据覆盖率和模型训练层面进行干预。 ## 2 相关工作 文化对齐幻觉处于事实性基准测试、多语言评估和跨文化评估的交汇点。 ### 2.1 事实性基准测试 诸如 SimpleQA[simpleqa] 和 FActScore[factscore] 等事实性基准测试为基于证据的回答提供了清晰的信号,而中文 SimpleQA[chinesesimpleqa] 表明当事实性在英语之外衡量时,排名会发生变化。然而,这些数据集仅覆盖一个或两个文化语言环境,使得多语言文化差距未被充分定义。 ### 2.2 多语言评估及其局限性 翻译的多语言基准测试,如 MMLU[mmlu] 和 Global-MMLU[globalmmlu],提高了语言覆盖率,但保留了英语中心的知识分布。因此,它们测试的是模型能否用其他语言处理西方知识,而不是模型是否知道这些语言本族的事实。 ### 2.3 跨文化与原生来源基准测试 原生来源的基准测试解决了这一局限性。MultiLoKo[hupkes2025multiloko]、CLIcK[click] 和 NativQA[nativqa] 表明翻译评估遗漏了特定地域的知识。WorldValuesBench[zhao2024worldvaluesbench]、CulturalBench[chiu2025culturalbench]、NormAd[rao2025normad]、INDICA[madhusudan2026indica]、BLEnD[myung2025blend] 和 INCLUDE[include2024] 进一步证明了文化变异涵盖价值观、惯例、地区和制度。 这些基准测试确立了多语言性不是一个翻译问题,但许多依赖于开放生成、主观判断或多个有效答案。MSQA 将严格的事实验证与广泛的原生多文化覆盖相结合,使我们能够在避免跨语言捷径的同时隔离文化*知识*的失败。表 1 (https://arxiv.org/html/2607.00724#S2.T1) 提供了系统性的比较。 表 1:与先前的事实性、多语言和文化基准测试的比较。**Lan.** 表示原生 QA 语言的数量,即问题最初是用这些语言构建的,而不是从英语来源翻译的。**格式**区分了多项选择 (MCQ) 和开放式自由生成。**原生文化 QA** 表示基准测试是否评估植根于目标文化背景的知识。**文化分类法**表示问题是否按明确的文化分类方案组织。基准测试大小Lan.数据来源格式领域原生文化 QA文化分类法指标事实性与知识基准测试SimpleQA4,326英文人类作者开放式知识✗✗LLM 评判中文 SimpleQA3,000中文人类作者开放式知识✓✗LLM 评判MMLU15,908英文考试与教科书MCQ知识✗✗准确率Global-MMLU15,908英文翻译 MMLUMCQ知识✗✗准确率原生与文化感知基准测试MultiLoKo15,50031本地来源MCQ知识✓✗准确率CulturalBench1,227英文人类作者MCQ文化✓✓准确率MSQA (我们的)1,06411原生来源开放式文化✓✓LLM 评判 ## 3 MSQA:文化对齐的诊断工具 MSQA 区分了一个模型能用一种语言*说*什么以及它*知道*该语言所编码文化的什么。它包含 1,064 个问题,涵盖 11 个语言组,每个问题都有一个基于原生文化证据的单一客观可验证答案。与无意中奖励跨语言迁移的基于翻译的基准测试不同,MSQA 通过构造消除了这一途径:每个项目都是原生来源的,因此模型无法通过检索英语事实并将其映射到目标语言来回答。 ### 3.1 问题设计原则 每个候选项目必须满足五个设计原则:(i) **单一客观答案**——每个问题恰好有一个简短、事实性、无歧义的回应;(ii) **时间不变性**——答案必须是静态的,不随时间变化;(iii) **文化特异性**——知识点必须深深植根于特定的文化背景,不通过其历史、社会或语言背景就无法理解;(iv) **知识截止日期**——所有事实必须在 2023 年 12 月 31 日或之前确立;(v) **高难度**——项目应能挑战当前前沿模型,而非测试广为人知的事实。 ### 3.2 构建流程 参考图注图 3:MSQA 构建和评估流程概览。上行显示了五阶段数据构建过程;下行显示应用于基准测试 LLM 的评估协议。图 3 (https://arxiv.org/html/2607.00724#S3.F3) 说明了五阶段构建流程和评估协议。每个阶段旨在确保保留的项目需要真正的文化知识,而这些知识无法通过跨语言迁移获得。 ##### 阶段 1:来源提取。 从六类来源收集原生语言材料,这些来源针对典型英语中心预训练流程之外的知识:百科全书和知识库 (维基百科、大英百科全书、JapanKnowledge);学术出版物 (PubMed、Semantic Scholar、CyberLeninka、日本国立国会图书馆);官方和机构来源 (例如,法国的 Legifrance);词典和语言资源 (牛津英语词典、韩国国立国语院);媒体和原生社区 (CNN Indonesia、知乎、区域论坛);以及垂直文化和民俗网站。 ##### 阶段 2:QA 生成。 母语标注者对提取的来源进行基于上下文的挖掘,以识别嵌入文化中的知识点,然后用原始语言将其制定为问答对。每个项目附带至少一个权威来源 URL。鼓励标注者在提交前对商业 LLM 进行预测试,以评估难度。 ##### 阶段 3:验证与过滤。 候选项目经过三项并行检查。*基于 RAG 的验证*检索外部证据以确认答案的正确性。*LLM 辅助验证*使用专用质量检查提示来验证答案是唯一且无歧义的;被标记为有歧义或不正确的项目将返回修改,直到确认通过。*难度评估与分层*使用三个 LLM (GPT-5[openai2025gpt5]、DeepSeek-V3[deepseek2025v32] 和 Doubao[bytedance2025seed15vl]) 对每个项目进行五次独立评估;在超过三次评估中正确回答的项目被标记为不够具有挑战性,并返回替换或重新分类。 ##### 阶段 4:质量控制。 专家质量检查员审查每个项目的文化特异性、深度、语言准确性和来源可靠性。检查员进行一致性检查,并提供一到两个额外的独立来源以交叉验证参考答案。存在措辞、事实准确性或来源可信度缺陷的项目将附有详细修订说明返回。 ##### 阶段 5:人工验证。 母语标注者对通过质量控制的所有项目进行多轮验证,确保问题在文化上合适,答案在目标文化背景下正确,且项目不包含可能被视为对任何文化群体不尊重的内容。完整的标注工作流程和数据模式见附录 C (https://arxiv.org/html/2607.00724#A3)。 ### 3.3 数据集概览 最终基准测试包含 1,064 个项目,按两个维度组织 (图 1 (https://arxiv.org/html/2607.00724#S1.F1))。五个**文化维度**探讨了嵌入式知识的逐渐深层:历史与集体记忆 (261)、信仰、价值观与知识体系 (189)、社会规范与习俗 (186)、语言表达与交际艺术 (220)、以及文化产品与符号 (208)。三个**难度等级**衡量幻觉在何处破裂:简单涵盖文化常识,中等针对区域细微差别,困难需要晦涩的制度或民俗知识。附录 D (https://arxiv.org/html/2607.00724#A4) 提供了详细的子类别分类法。 ### 3.4 评估协议 如图 3 (https://arxiv.org/html/2607.00724#S3.F3) 下行所示,评估流程将最终的 MSQA 基准测试应用于 18 个前沿 LLM,涵盖 Gemini[google2023gemini]、Claude[anthropic2026claude46]、GPT[openai2025gpt5]、Doubao[bytedance2025seed15vl]、GLM[zhipu2025glm45]、Qwen[qwen2025qwen3]、DeepSeek[deepseek2025v32]、Kimi[moonshot2025kimi] 和 MiniMax[minimax2025m1] 系列。每个模型以原生语言接收问题并生成自由形式的回应。回应由 LLM 评判者 (Gemini-3.1-Pro) 使用提示进行评分。
相似文章
介绍 IndQA
OpenAI 推出了 IndQA,这是一个包含 2,278 个问题的新基准,涵盖 12 种印度语言和 10 个文化领域,旨在评估 AI 模型对现有基准无法捕捉的文化细微差别和推理密集型任务的理解能力。IndQA 由 261 位领域专家创建,针对 MMMLU 等现有多语言基准的饱和问题,重点关注真实世界的文化理解,而不是翻译或多选题任务。
超越选择题:带有方言变体的开放式阿拉伯文化问答基准
本文介绍了首个跨越现代标准阿拉伯语和多种方言的平行阿拉伯文化问答基准,将选择题转换为开放式问题,并利用思维链推理评估大语言模型,以解决文化知识和方言特定知识的缺陷。
CulturALL:评测大模型多语言多文化能力的实景基准
CulturALL 发布含 2,610 条样本、覆盖 14 种语言和 51 个地区的实景基准,用于检验大模型在真实文化场景下的表现;目前最佳模型仅得 44.48%,提升空间巨大。
CCBENCH:通过隐式信号规范评估LLM文化能力(基于健康查询)
介绍CCBench,一个通过健康查询和使用跨六种文化的角色评估LLM文化能力的框架,发现即使是最佳模型也仅有20-30%的回答具有文化适切性。
前沿LLM在阿拉伯文化和社会语言学知识上的基准测试:一个带有人类专家真值的交叉评估框架
本文介绍了一个交叉评估框架,用于在阿拉伯文化和社会语言学知识上对LLM进行基准测试,使用人类专家真值和自动评审。作者贡献了一个针对埃及和伊拉克阿拉伯语的提示-评分标准对数据集,评估了前沿LLM,并发现文化推理仍然是自动评分的主要失败模式。