大型语言模型中地理条件作用的意外影响
摘要
本文识别并分析了LLM中的“位置泄漏”现象,即地理条件作用导致模型即使在与位置无关的提示中也过度依赖位置元数据,揭示了超出内容的结构性条件作用效应。
arXiv:2606.18124v1 公告类型: 新
摘要: 现代对话式AI系统经常依赖用户元数据来本地化响应,但这种隐藏上下文引入的意外区域偏差仍知之甚少。在这项工作中,我们评估了位置泄漏现象:即模型在接收到地理位置中性的用户提示时,仍然生成地理引用。在创意写作和开放式问答提示中,即使是最先进的LLM在暴露于位置元数据时,也系统性地偏向于特定区域的输出,泄漏率比基线高出多达793倍(例如,Llama 3.1-8B从0.04%上升到31.7%,Qwen3-8B和Claude Sonnet 4.6分别达到21.3%和8.8%)。我们的分析进一步揭示了一种新的结构性条件作用效应:将注入的位置替换为占位符“Unknown”仍会使泄漏率比基线高出多达72倍,这表明用户配置文件框架本身,独立于任何地理内容,充当生成条件信号。
查看缓存全文
缓存时间: 2026/06/17 05:42
# 大型语言模型中地理条件作用的意外效应
来源:https://arxiv.org/html/2606.18124
###### 摘要
现代对话式AI系统经常依赖用户元数据来本地化响应,然而这种隐藏上下文引入的意外区域偏见仍然未被充分理解。在本工作中,我们评估了位置泄露这一现象:即模型在收到地理上中立的用户提示时,仍然产生地理引用。在创意写作和开放式问答任务中,即使是最先进的LLM,在暴露于位置元数据时,也会系统地偏向特定区域的输出,泄露率比基线最高提升793倍(例如,Llama 3.1-8B从0.04%升至31.7%,Qwen3-8B和Claude Sonnet 4.6分别为21.3%和8.8%)。我们的分析进一步揭示了一种新颖的结构性条件作用效应:将注入的位置替换为占位符"Unknown"仍会使泄露率比基线提升高达72倍,这证明用户资料框架本身,独立于任何地理内容,作为一种生成性条件作用信号。
**大型语言模型中地理条件作用的意外效应**
Naz Col, David M. Chan
加州大学伯克利分校
{doganazcol, davidchan}@berkeley.edu
## 1 引言与背景
大型语言模型(LLM)已成为部署对话式AI系统的核心引擎,改变了用户与信息交互的方式。为了使这些系统更具本地上下文感知能力,生产管道经常将推理时的用户元数据(如地理位置)注入系统指令或提示头中。这种条件作用确保本地化的查询能返回区域相关的结果。
参见图注
图1:注入特定位置的用户资料会使模型输出从通用转向地理化,即使用户提示与位置无关。
不幸的是,现有的地理条件作用方法存在若干明显缺陷。虽然明确提供用户位置有助于定位地理中心查询,但我们观察到,即使底层用户提示完全与位置无关,模型也常常过度依赖这些元数据。我们将此现象称为**位置泄露**:一种潜在的交互层风险,即简单的地理条件作用迫使模型在不必要的情况下,在开放式生成中加入区域引用、文化偏差或地理刻板印象。
先前的研究已表明LLM存在地理偏见,例如在空间预测中偏向富裕地区(Manvi et al., 2024),在历史事件中附和民族叙事(Salnikov et al., 2025),以及在推荐中偏向上流社会地区(Dudy et al., 2025)。但这些工作(Gallegos et al., 2024; Nadeem et al., 2021; Nangia et al., 2020; Bender et al., 2021; Gopinadh et al., 2026)都聚焦于**预训练先验**和**隐式人口统计推断**,而非部署系统中常用的显式条件作用。最近,Piot et al. (2025) 表明这种预训练的地理偏见可以通过在分类设置中进行微调来缓解,但他们并未探究位置泄露最明显的开放式生成场景。Jin et al. (2024) 显示模型会根据推断的用户人口统计信息遭受**隐式个性化**,但未研究推理时直接注入位置的显式条件作用层。
为解决这些局限,本文我们引入了一个框架,旨在量化显式推理时地理条件作用的问题。我们分析了三种常见的部署架构:手动前置结构化用户资料块、系统提示注入,以及两者的双层混合组合。我们通过评估五个语言模型(Qwen3-8B(Team, 2025)、Llama3-8B-Instruct(Grattafiori et al., 2024)、GPT-5-nano(OpenAI, 2025)、Gemini 3 Flash(Google DeepMind, 2025)和Claude Sonnet 4.6(Anthropic, 2025))在两个与位置无关的数据集(WritingPrompts(Fan et al., 2018)和Infinite Chats(Jiang, 2024))上的表现,来探索位置泄露的严重程度。我们表明,注入位置数据会使泄露率比基线提升最高793倍,其中Llama 3.1-8B在某些情况下泄露率高达31.7%。我们还探究了这种条件作用的结构性与语义成分,证明仅用户资料框架本身就是一个独立信号,能显著放大泄露。最后,为探索位置泄露的潜在驱动因素,我们进行了与全球社会经济指标的交叉相关分析(Naz, 2023),发现高等教育入学率(ρ=−0.20, p<0.01)是泄露率的重要预测因子。
我们将主要贡献总结如下:(1)定义并形式化了位置泄露现象,并引入了一个在非地理中心任务中测量地理条件作用的框架;(2)提供了跨越五个最先进模型和三种注入方法的实证证据,展示了最高达31.7%的泄露率;(3)将位置泄露分解为结构性和语义成分,表明仅用户资料框架就能使泄露率比基线模型放大高达72倍,并显示此漏洞对大洋洲和北美地区影响尤为严重。
## 2 测量位置泄露
我们正式定义**位置泄露**为一种生成性条件作用故障:语言模型在接收到与位置无关的提示时,仍在其输出中引入地理引用。
令 \( x \in \mathcal{X} \) 为从位置无关任务分布中抽取的地理中性提示。令 \( c \in \mathcal{C} \) 为注入的地理上下文向量,指定一个国家 \( loc \)(例如,通过用户资料或系统提示修改)。参数化为 \( \theta \) 的语言模型根据 \( P_\theta(y \mid x, c) \) 生成令牌序列 \( y \)。令 \( \mathbb{I}_{\text{leak}}(y, loc) \in \{0,1\} \) 为指示函数:若 \( y \) 包含对 \( loc \)(或其直接语言衍生词)的显式地理引用则输出1,否则输出0。
基线泄露率 \( \lambda_0 \)(无地理条件作用的内在先验)和条件泄露率 \( \lambda_c \)(有显式上下文)分别定义为:
\[
\lambda_0 = \mathbb{E}_{x \sim \mathcal{X}} \left[ \mathbb{I}_{\text{leak}}(f_\theta(x), loc) \right] \quad (1)
\]
\[
\lambda_c = \mathbb{E}_{x \sim \mathcal{X}} \left[ \mathbb{I}_{\text{leak}}(f_\theta(x, c), loc) \right] \quad (2)
\]
其中 \( f_\theta \) 表示标准解码设置下的序列生成函数。一个平衡的模型应在所有 \( x \) 不需要本地化的任务上保持 \( \lambda_c \approx \lambda_0 \approx 0 \),显著的位置泄露则表现为经验性差异 \( \lambda_c \gg \lambda_0 \)。如第3.4节和附录A所示,这可以分解为由格式化包装器驱动的结构性因子 \( \alpha_{\text{struct}} \) 和由国家标识符驱动的语义因子 \( \alpha_{\text{sem}} \)。
#### 数据集与评估指标
我们在两个与位置无关的数据集上评估模型:WritingPrompts(Fan et al., 2018)(10,036个创意写作提示;每个193个联合国承认国家52个提示)和Infinite Chats(Jiang, 2024)(19,300个开放式查询;每个193个国家100个提示)。
#### 手动前置(Manual Pre-pending)
地理块资料被前置到用户提示之前(图2),使位置作为用户指令的一部分显式呈现。
手动前置输入
--- 开始用户资料 ---
位置:[国家名称]
--- 结束用户资料 ---
你醒来时拥有一个极其无用 的 能力……
图2:模型将地理资料块和写作提示作为单个组合输入接收。
表1:Infinite Chats中手动前置(块)注入下的定性示例。每个提示均与位置无关,但模型自发引入了注入的位置(加粗显示)到其输出中。
#### 系统提示注入(System Prompt Injection)
位置数据被注入系统级指令中(图3)。我们使用不包含显式位置感知指令的最小提示,以观察自发性地理适应而非定向行为。
系统提示
你是一个位于 的用户的有用助手。请简洁直接,避免泛泛而谈。
图3:用于位置注入的系统提示。
#### 混合组合(Hybrid Combination)
同时应用两种方法(位置同时嵌入系统提示和用户资料块中)。
#### 实验控制
无注入基线:完全移除上下文中的位置;未知位置条件:保留资料结构,但将位置设为"Unknown"。
## 3 结果与分析
在本节中,我们展示五个模型在地理条件作用下的发现。
### 3.1 创意生成(WritingPrompts)
在创意写作任务中,所有五个模型都一致出现位置泄露。基线均匀偏低(0.2–0.8%);任何注入都会带来急剧增加:Qwen3-8B在混合注入下达到21.3%(基线0.5%),Claude Sonnet 4.6在块注入下上升至8%,是其系统注入率(3.8%)的两倍多。地理上,所有模型的泄露都集中在北美和西欧。
### 3.2 开放式查询(Infinite Chats)
参见图注
图4:所有五个模型在Infinite Chats上的位置泄露率(每个国家100个提示的百分比)。
参见图注
图5:Llama 3.1-8B-Instruct在Infinite Chats上的位置泄露(19,300个样本,193个国家每个100个提示)。(左)混合:31.7%;(中)手动前置:22.3%;(右)系统提示注入:21.6%。每种方法下泄露率都很高,且广泛分布于各大洲。
表2:Infinite Chat上的位置泄露。
所有五个模型的基线几乎为零(≤0.04%),注入后均有增加(表2,图4)。Llama 3.1-8B在混合注入下达到31.7%,是其基线的793倍。GPT-5-nano是唯一一个系统提示(12.2%)超过块注入(9.3%)的模型,而Claude显示了最大的方法差异(块注入16.0% vs. 系统提示3.8%)。所有模型的国家级地图见附录B。
反直觉的是,对于某些模型如Claude Sonnet 4.6和GPT-5-nano,混合组合实际上降低了泄露率,相比只使用一种注入方法(如手动前置)。
### 3.3 区域敏感性差异
表3:Infinite Chats上的全局泄露率(%)和区域敏感性比率(RSR)。
Blk=手动前置;Sys=系统提示注入;Hyb=混合组合。
我们将**区域敏感性比率(RSR)**定义为特定地理区域的平均条件泄露率除以模型在所有评估上下文中的全局基线泄露率:
\[
\mathrm{RSR}_{\text{region}} = \frac{\mathbb{E}_{loc \in \text{region}} [\lambda_c(loc)]}{\mathbb{E}_{loc \in \mathcal{C}} [\lambda_c(loc)]} \quad (3)
\]
其中 \( \mathcal{C} \) 代表所有193个评估国家的完整集合。RSR=1.0表示该区域泄露恰好处于全球平均水平,大于1.0的值表示对区域条件的超敏感性。
表3报告了RSR值,结果见图6。有趣的是,亚洲的泄露率始终低于全球平均值。值得注意的是,这种抑制在Qwen3-8B(RSR∈[0.85,0.87])中仍然存在,表明一个区域在预训练数据中的表征并不会自动决定其在交互层对显式条件作用的敏感度。
参见图注
图6:每大洲和模型的平均RSR,取三种注入方法的平均值。右侧的条柱(RSR=1.0右侧)表示过度代表的区域。大洋洲在所有五个模型中排名第一;亚洲在每个模型中排名最后或倒数第二。
### 3.4 结构与语义
未知位置基线使我们能够探究提示框架本身是否改变模型行为。为此,我们可以将条件泄露率 \( \lambda_c \) 分解为结构性放大因子 \( \alpha_{\text{struct}} \)(由资料框架单独引起)和语义放大因子 \( \alpha_{\text{sem}} \)(由有效区域数据引起),使得 \( \lambda_c = \lambda_0 \cdot \alpha_{\text{struct}} \cdot \alpha_{\text{sem}} \)。
表4:Llama 3.1-8B-Instruct在七种条件下的泄露(n=19,300)。\( \alpha_{\text{struct}} \in [12, 72] \);\( \alpha_{\text{sem}} \in [8, 11] \)。
表4显示了三个发现:(1)完全没有位置条件作用时,内在先验几乎为零(无注入,0.04%);(2)仅结构性框架就将泄露率提升了12到72倍于非结构性基线;(3)在结构性基线基础上添加真实位置可进一步增加泄露率(21.6%–31.7%)。有趣的是,在许多情况下,模型将空占位符视为有效的实际位置,例如模型生成"Best vacation spots for Unknown locals"或"in the kingdom of Unknown"等短语。这种行为表明注意力机制优先考虑提示的结构几何而非其语义内容。因此,缓解位置泄露可能需要改变底层提示架构,而不仅仅是简单调参。
### 3.5 社会经济关联
为进一步探索位置泄露的影响,我们将每个国家的平均泄露率与人均GDP、高等教育入学率和互联网使用率(Naz, 2023)进行交叉相关分析。GDP和互联网使用率无显著关联(表A.5)。只有高等教育入学率显示出显著的负相关(r=−0.17, p=0.023;ρ=−0.20, p=0相似文章
找不到地点:揭示多语言 LLM 中的隐式本地与全球偏见
Google Research 发布覆盖 12 种语言的 LocQA 数据集,发现多语言大模型在回答含混的地域相关问题时表现出强烈的美国中心与人口基数驱动的地域偏见。
定位与控制大型语言模型中的隐式个性化
本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。
大型语言模型的地理空间概念探测:抽象性、组合性与接地
本文引入了一个以概念为中心的基准,用于探测LLM对方向、距离和拓扑等地理空间概念的理解,测试不同模型架构和规模下的抽象性、组合性与接地性。研究结果揭示了当前LLM在概念理解上的明显局限。
大语言模型通过文化不均的基线感知城市
实证研究显示,前沿LLM在描述和评判全球街景时编码了一种偏向西方视角的文化倾斜基线,非西方提示系统性偏离默认更远。
关于大型语言模型(LLMs)的问题:我自己的观察:非指令性文本前缀可能在无需对抗性提示的情况下绕过RLHF约束。
一位用户报告称,一段冗长的非指令性文本前缀可以无需对抗性提示即可使LLM激活发生偏移并绕过RLHF安全约束,并询问这是否反映了模型中不同的世界区域。