SWORD:基于Wikidata的扭曲揭示了LLM事实错误拒绝中的隐藏跨语言不一致性
摘要
SWORD引入了一个基于Wikidata的基准,用于评估LLM在拒绝事实错误时的跨语言不一致性,揭示模型依赖于分布熟悉度,并在亚洲语言中表现出性能下降。
arXiv:2609.09349v1 公告类型:新
摘要:现代LLMs展示了令人印象深刻的多语言性能,但标准基准主要奖励选择正确答案,而非评估真正的事实理解。我们引入了系统性的基于Wikidata的对象-关系扭曲(SWORD),这是一个基准,用于评估模型是否在不同语言中一致地拒绝事实错误。SWORD通过受控扰动Wikidata三元组,在八种广泛使用的语言中生成语法正确但事实错误的陈述,扰动范围从随机实体替换到语义上合理的基于属性的选择。我们的基于扭曲的评估揭示了两个关键见解,这些见解在传统基准中完全模糊不清。首先,模型在语义上合理的扭曲上的准确性反而高于无意义的随机替换,这表明它们依赖于分布熟悉度而非真正的事实验证。其次,在基线准确性相当的模型中,当呈现扭曲陈述时,在(东亚)语言中表现出显著的性能下降,跨语言性能差距在某些模型中高达28个百分点(相对减少49%)。这些发现证明了多语言事实推理涉及不对称能力,而聚合准确性指标系统性地掩盖了这一点。
查看缓存全文
缓存时间: 2026/09/10 08:10
# SWORD:基于维基数据的扭曲揭示大语言模型事实错误拒绝中的隐藏跨语言不一致 来源:https://arxiv.org/html/2609.09349 **作者**:Sanghyeok Park, Minji Kang **隶属**:松树大学,首尔,大韩民国 **邮箱**:[[email protected]](mailto:) **作者**:Hosung Kwak **隶属**:KAIST,大田,大韩民国 **邮箱**:[[email protected]](mailto:) **作者**:Jinhyuk Yun††thanks: 对应作者。 **隶属**:松树大学,首尔,大韩民国 **邮箱**:[[email protected]](mailto:) ###### 摘要 现代大语言模型展现出令人印象深刻的多语言性能,但标准基准主要奖励选择正确答案,而非评估真正的事实理解。我们引入**基于维基数据的对象-关系系统性扭曲基准**,该基准评估模型在不同语言中是否一致地拒绝事实错误。SWORD通过对维基数据三元组进行受控扰动——从随机实体替换到基于属性的语义合理选择——在八种广泛使用的语言中生成语法正确但事实错误的陈述。基于扭曲的评估揭示了两个关键见解,这些见解被传统基准完全掩盖。首先,模型在语义合理的扭曲上反常地获得比随机无意义替换更高的准确率,这表明其依赖于分布熟悉度而非真正的事实验证。其次,在基线准确率上表现相当的模型,在面对扭曲陈述时,特别是(东亚)语言的性能显著下降,跨语言性能差距在某些模型中高达28个百分点(相对降低49%)。这些发现表明,多语言事实推理涉及不对称能力,而聚合准确性指标系统性地掩盖了这一点。 ## 1 引言 大型语言模型在一系列任务中表现出色,包括多语言问答、编码和推理AI(2024);Google DeepMind(2025);Yang 等人(2025)。近年来,LLM的多语言能力迅速提高,在广泛使用的基准测试中跨语言展现出看似稳定的性能OpenAI(2024);Singh 等人(2025)。然而,系统性的语言不平等依然存在:模型在低资源语言上表现出明显更差的性能,并产生更多问题输出Blasi 等人(2022);Shen 等人(2024)。现有的多语言基准围绕多项选择或答案提取设计Hendrycks 等人(2021);Conneau 等人(2018);Hu 等人(2020);Singh 等人(2025)。虽然这些基准对于自动化评估和量化模型的多语言能力很有效,但在候选选项中选择正确陈述的高基准分数并不能保证其拒绝错误陈述的能力。它们也无法提供关于模型是否在不同语言中一致拒绝错误陈述的深入见解。大多数基准仅计算正确回答的问题,而不比较语言间的响应模式Qi 等人(2023),使得跨语言不一致性(即模型在一种语言中拒绝错误陈述,却在另一种语言中接受它)在很大程度上不可见。 我们提出**基于维基数据的对象-关系系统性扭曲基准**,该基准旨在评估模型对事实错误陈述的多语言响应。SWORD通过改变主题和对象组件系统性地扰动维基数据三元组Vrandečić 和 Krötzsch(2014),生成语法正确但事实错误的陈述。扰动范围从随机实体替换到基于属性的扭曲,这些扭曲通过系统控制与原始实体的语义接近度,并在八种语言中一致应用。本研究重点关注大语言模型在多语言环境中如何响应错误陈述。多语言评估不仅仅是扩展覆盖面的手段,更是检验事实判断是否跨语言一致的关键条件。我们发现,当评估仅限于真实陈述时,特定语言的模式是不可见的,但对错误陈述拒绝的系统评估能清晰地揭示这些模式。我们还分析了不同模型对扭曲事实的响应差异,并考察了在标准基准中几乎不可见、但在基于扭曲的评估下显著出现的跨语言性能差距。 本工作有三方面的贡献。 SWORD揭示了在扭曲条件下特定出现的系统性跨语言差异:基线准确率相当的模型,在拒绝错误陈述时,西方语言与东亚语言之间表现出高达28个百分点(相对降低49%)的性能差距,这种模式在标准多语言基准中不可见(第4.2节和第4.3节)。 SWORD还揭示了反直觉的评估信号:模型在语义合理的扭曲(基于属性)上比在无意义的扭曲(随机)上获得更高的准确率,这表明其依赖于分布熟悉度而非真正的事实验证(第4.1节)。 这些发现得益于一个完全自动化的流程,该流程利用维基数据的结构化约束,通过语义接近度系统性地控制扭曲难度,实现了可扩展的基准生成,无需专家验证(第3节)。 ## 2 相关工作 多语言基准已成为评估LLM跨不同语言能力的关键工具。早期的努力,如GLUEWang 等人(2018)和SuperGLUEWang 等人(2019),建立了标准化的评估框架,随后通过XNLIConneau 等人(2018)和XTREMEHu 等人(2020)扩展到多语言环境。更近期,MMLUHendrycks 等人(2021)及其变体,包括MMLU-ProWang 等人(2024)、多语言MMLUOpenAI(2024)和Global MMLUSingh 等人(2025)已被引入。然而,这些基准评估的是从候选池中选择答案的能力,而不是对陈述真实性的绝对判断,它们衡量的是模型在选项中识别最合理选项的能力,而非真正验证事实Mousavi 等人(2024)。此外,许多基准仍以英语为中心,依赖可能无法反映语言多样化知识的翻译数据Singh 等人(2025);Kassner 等人(2021),或可能引入伪影,掩盖真实的跨语言迁移Rajaee 和 Monz(2024)。 近期研究更直接地考察了跨语言一致性。基于排序的一致性指标评估模型是否在不同语言中对事实陈述产生一致的排名Qi 等人(2023),并扩展到跨15种语言的多模态环境Wang 等人(2025)。其他工作提出了针对30种语言的“翻译后评估”策略Gupta 等人(2025),研究也证实了在多语言输入中保持一致事实预测的困难Fierro 和 Søgaard(2022)。关于多语言幻觉检测的大规模研究,包括Poly-FEVERZhang 等人(2025)和跨语言幻觉率估计Ul Islam 等人(2025),揭示了较小模型和支持更多语言的模型表现出更高的幻觉率。虽然这些研究超越了聚合准确性的衡量,但它们主要测量的是正确信息的检索,而非对错误陈述的一致性拒绝,并且缺乏对扭曲难度的系统控制,从而无法区分明显错误的答案和语义合理的错误陈述。 结构化知识图谱为事实评估提供了更系统的基础。先前的基准从知识库中提取经过专家验证的事实陈述Gupta 和 Srikumar(2021);Augenstein 等人(2019),而其他基准通过自动化维基数据采样构建大规模数据集Veseli 等人(2023)或评估时间敏感的事实知识Mousavi 等人(2024)。受控扰动的重要性也已得到认识:对比集通过最小化标签改变的修改来测试模型的决策边界Gardner 等人(2020),而近期的基准如FACTSCheng 等人(2025)和FactBenchBayat 等人(2025)强调了多维度的事实性评估。然而,现有方法基于模型性能事后评估难度,而非事先控制语义接近度,并且没有评估跨语言错误陈述拒绝的一致性。SWORD通过基于属性的实体替换,结合图结构控制的语义接近度,并系统性地应用于八种语言,填补了这两个空白。 ## 3 SWORD基准构建 SWORD通过衡量模型接受真实陈述和拒绝系统性扭曲错误陈述的能力,来评估LLM的跨语言事实准确性。我们的基准从维基数据SS-PP-OO三元组(SS:主语,PP:谓语,OO:宾语)生成两种类型的三元组:(i) 原始真实关系和 (ii) 系统性扭曲的错误关系(图1(a–c))。每个三元组使用Gemini-2.5-FlashGoogle DeepMind(2025)翻译成八种广泛使用语言(EN、FR、DE、ES、IT、PT、KO、JA)的自然语言句子(图1(d)),然后要求模型将每个陈述分类为真或假(图1(e))。SWORD适用于基于API和开源模型,并且基准规模可根据可用计算资源进行扩展。基准和代码在以下网址公开提供:https://anonymous.4open.science/r/SWORD-EMNLP/ **图1:** SWORD基准流程通过打乱维基数据三元组(主语-谓语-宾语)生成受控的事实扭曲。 (a) 我们从维基数据中提取三元组(真实陈述)并应用四种打乱策略生成错误陈述(SS:主语打乱,PSS:基于属性的主语打乱,OS:宾语打乱,POS:基于属性的宾语打乱;详见方法)。 (b) 概率密度图显示了通过node2vec嵌入计算的每种策略打乱前后实体的余弦相似度。 (c) 随机-原始对与基于属性-原始对的余弦相似度差异。基于属性的打乱倾向于产生与原始实体相似度更高的实体,证明了语义接近度与任务难度直接相关,并能够系统地创建从易到难的评估任务。 (d) 使用Gemini-2.5-Flash将原始和打乱后的三元组转换为8种语言的自然语言陈述。 (e) 然后要求LLM判断每个陈述在事实上是真还是假。 ### 3.1 数据收集与系统性扭曲 我们使用截至2024年9月11日的维基数据转储。我们的提取从每个维基数据实体作为主语开始,通过属性链接到对象以构建SS-PP-OO三元组。该转储包含112,431,677个实体(项目)和12,120个属性,总共构成788,124,878个三元组。我们专注于获取可以翻译成独立事实句子的原始三元组(记为ORG)。为确保公平的跨语言比较,我们仅保留其主语、谓语和宾语在所有八种目标语言中都有自然语言标签的三元组。此约束确保所选实体很可能出现在所有语言的训练语料库中,减少了来自特定语言实体覆盖的潜在偏差。经过此筛选,我们最终的数据集包含2,119,631个三元组。我们随后采样500个三元组来测试我们的基准。 对于每个ORG三元组(S,P,O),我们通过保持谓语P固定,并替换主语S或宾语O,生成四种类型的扭曲三元组(图1(a))。这会产生语法上仍然正确,但在语义合理性上有所变化的错误陈述。 **表1:** 每个ORG三元组的四种扭曲类型。 | 类型 | 描述 | | :--- | :--- | | ORG | 来自维基数据的原始事实三元组 | | SS | 用随机实体S'替换S | | OS | 用随机实体O'替换O | | PSS | 用与相同宾语O共享属性P的S'替换S | | POS | 用与相同主语S共享属性P的O'替换O | 为确保每个扭曲三元组代表错误关系,我们验证生成的三元组是否存在于维基数据中。由于维基数据包含多对多关系,随机打乱可能意外产生现有三元组;在这种情况下,我们重新采样直到获得不存在的三元组,保证所有打乱后的三元组都被标记为False。 为验证基于属性的打乱比随机打乱产生更语义合理的扭曲,我们将node2vecPerozzi 等人(2014);Grover 和 Leskovec(2016)应用于由2,119,631个筛选后的维基数据三元组构建的无向图,使用步行长度为10步,每个节点10个行走者,以及带负采样的skip-gram。然后,我们测量原始实体和打乱后实体之间的余弦相似度,以确认基于属性的策略产生语义上更接近的替换(图1(b,c))。图1(b,c)证实,基于属性的策略(PSS和POS)始终产生...
相似文章
跨语言事实一致性的潜在空间干预:一致性提升而无精度下降
本文提出了一种潜在空间干预方法,用于改善大型语言模型中的跨语言事实一致性,在不损失事实精度的情况下实现更好的对齐。
衡量跨语言理解差距:证据语言如何影响语言模型的理解
本文引入了跨语言理解差距(CLCG)指标,用于衡量当内容以非英语语言呈现时,LLM响应质量的下降程度。通过对18种语言和多个模型的评估,研究发现性能显著下降,尤其是在低资源语言上,这对以英语为中心的能力迁移假设提出了质疑。
技能差异:LLM中的技能是否具有语言不变性?
本文通过基于文本游戏的多语言自我对弈,量化了大语言模型在跨语言技能上的不一致性,揭示了不同语言间显著的性能差异,且这种差异可通过改变中间推理语言得到部分缓解。
大语言模型在不信任输入数据时是否会犯更多错误?
本文分析了大语言模型对提供上下文的忠实度如何取决于其感知的合理性,使用多种语言的事实性、反事实性和虚构性RDF三元组。研究发现上下文-记忆冲突较弱,并强调LLM判断者的选择可能高估其强度。
推理大语言模型中的隐藏语言一致性现象
本文研究多语言推理模型,揭示输出中的语言一致性可能随任务难度增加而退化或崩溃,尤其是对于资源较少的语言。文章认为,评估多语言能力需要同时考虑准确性、语言一致性和任务难度。