找不到地点:揭示多语言 LLM 中的隐式本地与全球偏见

arXiv cs.CL 论文

摘要

Google Research 发布覆盖 12 种语言的 LocQA 数据集,发现多语言大模型在回答含混的地域相关问题时表现出强烈的美国中心与人口基数驱动的地域偏见。

arXiv:2604.19292v1 公告类型:新增 摘要:多语言大模型(LLM)已缩小不同语言间的流畅度差距,但也使模型面临偏见风险,因为知识与规范可能在语言间传播。本文通过模型回答含混地域问题的能力,量化其跨语言与语言内部偏见。为此,我们推出 LocQA——包含 12 种语言共 2,156 道问题的测试集,涉及法律、日期、度量衡等地域相关事实。问题本身除查询语言外,无任何地域提示。LLM 对 LocQA 的回答由此暴露其隐含先验。我们用 LocQA 评估 32 个模型,发现两类结构性偏见:跨语言层面,即便用非英语提问,模型仍倾向给出美国地域相关答案;且经指令微调的模型比基座模型更强化这一全球偏见。语言内部,当同一语言对应多个地域时,模型如同“人口概率引擎”,优先选择人口更多地域的答案。LocQA 的洞察有助于塑造 LLM 期望的地域行为,并量化不同训练阶段对各类偏见的影响。
查看原文
查看缓存全文

缓存时间: 2026/04/22 08:30

# 位置未找到:揭示多语言大模型中的隐式本地与全球偏见  
来源:https://arxiv.org/html/2604.19292  
\\uselogo\\correspondingauthor  

guymorlan@google\.com, \{omer\.goldman, reut\.tsarfaty\}@gmail\.com  

Omer Goldman  Matan Eyal  Google Research  
Adi Mayrav Gilady  Google Research  
Sivan Eiger  Google Research  
Idan Szpektor  Google Research  
Avinatan Hassidim  Google Research  
Yossi Matias  Google Research  
Reut Tsarfaty  

###### 摘要  

多语言大语言模型(LLM)已大幅缩小了语言之间的流利度差距。然而,这一进步也使模型面临偏见风险,因为知识与规范可能在语言之间传播。本文旨在通过模型回答“地域模糊”问题的能力,量化其**跨语言**与**语内**偏见。为此,我们提出**LocQA**,一个包含 2,156 道题目、覆盖 12 种语言的测试集,涉及法律、日期、度量等依赖地域的事实。题目本身除查询语言外,不含任何地域提示。LLM 对 LocQA 的回答因而揭示了其隐式先验。我们用 LocQA 评测了 32 个模型,发现两种结构性偏见:  
1. **跨语言层面**:存在对**美国地域**的持续全球偏见,即使用非英语提问亦然;且经过指令微调的模型比基座模型更严重。  
2. **语内层面**:当同一语言关联多个地域时,模型充当“人口概率引擎”,优先选择人口更多的地域,从而“抹除”小国。  

LocQA 的洞察有助于塑造 LLM 理想的本地行为,并量化不同训练阶段对各类偏见的影响。数据已开源:https://github.com/google-research-datasets/locqa/。

## 1 引言  

人类在自然语言交流中常省略“显而易见”的信息,导致各种歧义(Grice, 1991)。LLM 如何处理这类歧义?本文聚焦**地域歧义**。例如:  
- “急救电话是多少?”  
- “税务年度何时结束?”  

这些英语问题本身模糊,不同地域答案不同。我们推测,模型对此类问题的回答可暴露其隐式偏好:它把哪个地区的现实视为“默认”,又“抹除”了哪些现实。  

若用户用法语问“Quand commence l’exercice fiscal?”,我们期望模型将参考框架移出英语圈。然而,一种语言**很少**只对应单一地域。法语是 29 国官方语言,从法国、瑞士到海地、刚果(金),法律、度量、基础设施差异巨大。  

当前多语言评测混淆了 LLM 的两项能力:  
1. **语言流利度**:用目标语言生成连贯文本;  
2. **地域本地化**:把生成内容锚定在**该语言不同地域说话者的真实世界**。  

当代 LLM 流利度惊人,但尚不清楚它们是否真正代表了多元人口,还是只是把西方规范**流利地翻译**了一遍。  

为隔离“本地化”能力,我们分析模型如何**自发**解决地域歧义。我们定义两条偏见轴:  
- **全球偏见**:美国中心视角跨语言持续存在(如用印尼语提问仍输出美国规范);  
- **地域偏见**:在同一语言内部,模型隐式优先某些地域(如西班牙语默认西班牙还是墨西哥?)。  

我们提出**LocQA**(Localized QA),用**语义不变、地域模糊**的查询,诊断 LLM 的隐式先验。图 1 显示,同一问题在不同地域答案不同,仅凭语言无法消解事实歧义。  

对 32 个模型的实验发现:  
1. **美国默认**:即使用非英语提问,模型仍频繁输出美国规范;  
2. **民粹倾斜**:模型按人口比例“抽奖”,小国被忽略;  
3. **文化对齐税**:指令微调模型**地域偏见**降低,但**美国偏见**显著升高,说明当前对齐牺牲文化细节,换取通用、同质、可能“更安全”的回答。  

贡献:  
1. 发布**LocQA**基准:2,156 道地域特定答案,覆盖 12 语言 49 地域;  
2. 提出**双指标框架**:全球指标量化美国中心偏见,地域指标评估地理公平;  
3. 在 32 个 LLM 上提供**对齐偏见**实证证据。  

我们呼吁:从“多语言”建模转向“多文化、多地域”建模,把地域作为独立维度,确保全球用户获得符合本地事实的服务。

## 2 挑战与动机  

多语言 LLM 必须**检索**知识,这在多语言场景已属不易(Goldman et al., 2025; Lalai et al., 2025)。此外,它们还需**选择**合适的文化框架。因此,模型既要测**能力**(能否回答 X),也要测**倾向**(默认认为 X 是什么)。  

现有文化评测主要测**显式知识**(如“秘鲁首都是哪?”),或**主观价值**(如“当地道德观如何?”),且常在 prompt 中**点名地域**,替模型消解歧义,从而掩盖其信息选择偏见。我们关注**无提示**下的默认行为,揭示显式评测系统遗漏的地理对齐。  

我们进一步量化“改进”多语言能力所带来的选择偏见。例如,Han et al. (2025) 发现“迁移-本地化权衡”:跨语言优化导致文化抹除;Gao et al. (2024) 指出指令微调常带来“浅层”对齐。LocQA 为精确测量这些“税”提供诊断工具。

## 3 LocQA 数据集  

构建目标:模型在地域模糊问题中**默认假设哪个现实**?  
我们设计约 12 道示例问题,要求:  
- 时间独立;  
- 答案明确;  
- 易翻译;  
- 答案随地域变化。  

示例涵盖法律、历史、语言等。  

16 名双语标注员将问题译成 12 种语言(英、西、法、德、希伯来、印地、印尼、意、日、韩、葡、中),并给出**该语言关联国家**的答案。目标国为该语言母语≥100 万人口的国家。部分问题在某些地域无答案,可标 N/A。  

所有翻译与答案经二次独立校验,作者再统一审校。最终得到 2,156 条地域特定问答,对应 44 道并行问题×12 语言×49 地域。

## 4 方法  

### 4.1 指标  

我们定义两项偏见指标:  

#### 全球偏见 \( B_{US} \)  
衡量模型在非英语提问中**默认采用美国答案**的程度。若答案与美国答案“碰撞”(如印尼法定饮酒年龄同为 21 岁),需剔除。公式:  
\[
B_{US} = P_{\text{obs}}(A_{\text{US}}) - P_{\text{exp}}(A_{\text{US}})
\]  
对 11 种非英语语言取宏平均,防止多地域语言(如西班牙语 20 地域)主导。  

#### 地域偏见 \( B_{R} \)  
衡量**同一语言内部**各国答案被过度或不足代表的程度,按语言分别计算。  

(后续章节略,保持原文结构即可)

相似文章

当英语改写本地知识:大语言模型中的全球叙事主导

arXiv cs.CL

本文介绍了CulturalNB(一个孟加拉文化问答对数据集),并评估了九种大语言模型的跨语言文化偏见。研究结果表明,英文提示会增加全球叙事替代并减少本地视角,揭示了大语言模型中的文化失败是立足点和优先级问题,而不仅仅是知识缺失。

安全对齐幻觉:LLMs中的跨语言安全差距

arXiv cs.AI

本文介绍了INCLUDE,一个多语言评估基准,用于量化LLMs中以印度为中心的社会文化偏见,揭示非英语印度语言比英语表现出更高的偏见,表明存在跨语言安全对齐差距。

大型语言模型中地理条件作用的意外影响

arXiv cs.CL

本文识别并分析了LLM中的“位置泄漏”现象,即地理条件作用导致模型即使在与位置无关的提示中也过度依赖位置元数据,揭示了超出内容的结构性条件作用效应。

将LLM性别偏见锚定于人类基线:一项跨语言审计

arXiv cs.CL

本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。