使用自然语言自动编码器探测Qwen2.5-7B中的潜在哥伦比亚身份推断
摘要
本初步研究使用自然语言自动编码器来探测Qwen2.5-7B在处理哥伦比亚西班牙语和英语提示时是否内部表示哥伦比亚身份、社会经济地位或刻板印象相关信息,发现潜在推断在被口头表达之前存在的证据。
arXiv:2607.21774v1 Announce Type: new
摘要:大型语言模型可能会从细微的语言线索中推断出人口统计属性,即使这些属性没有被明确说明。本初步研究考察了Qwen2.5-7B-Instruct在处理哥伦比亚西班牙语和英语提示时,是否内部表示哥伦比亚身份、社会经济地位或刻板印象相关信息。我们使用自然语言自动编码器(NLA)来将每个提示的四个位置四分位中第20层的残差流激活口头化。我们的数据集包含30个提示,组成15对匹配的西班牙语-英语对,涵盖显式哥伦比亚线索、隐式哥伦比亚线索和中性控制。我们报告描述性比率和定性证据,而非统计显著性效应,重点关注潜在国籍或刻板印象表示是否在模型输出中被口头表达之前出现。这项工作将激活层面的可解释性与代表性不足的西班牙语变体的偏见评估联系起来。
查看缓存全文
缓存时间: 2026/07/27 07:39
# 使用自然语言自编码器探测Qwen2.5-7B中潜在的哥伦比亚身份推断
来源:https://arxiv.org/html/2607.21774
Pablo Santiago Potes Velasco 奥连特自治大学 哥伦比亚卡利 pablo\.potes@uao\.edu\.co &María del Mar García Matabanchoy 奥连特自治大学 哥伦比亚卡利 maria\_d\.garcia\_m@uao\.edu\.co &Óscar Julián Pérez Ladino 奥连特自治大学 哥伦比亚卡利 oscar\.perez@uao\.edu\.co &Jhoan Stevan Mosquera Ortiz 奥连特自治大学 哥伦比亚卡利 jhoan\.mosquera@uao\.edu\.co &Nicolás Lozano Mazuera 奥连特自治大学 哥伦比亚卡利 nicolas\.lozano\_m@uao\.edu\.co &Gilber Alexis Corrales Gallego 奥连特自治大学 GobLab\-UAI 哥伦比亚卡利 gacorrales@uao\.edu\.co
###### 摘要
大型语言模型可能会从微妙的语言线索推断人口统计属性,即使这些属性并未明确陈述。这项初步研究考察了Qwen2.5-7B-Instruct在处理哥伦比亚西班牙语和英语提示时,是否在内部表示哥伦比亚身份、社会经济地位或与刻板印象相关的信息。我们使用自然语言自编码器(NLA)来将每个提示的四个位置四分位处的第20层残差流激活进行言语化。我们的数据集包含30个提示,排列成15对匹配的西班牙语-英语对,涵盖明确的哥伦比亚线索、隐含的哥伦比亚线索和中性对照。我们报告描述性比率和定性证据,而非统计上有力的效应,重点关注在模型输出中言语化之前是否出现潜在国籍或刻板印象表示。这项工作将激活层面的可解释性与对代表性不足的西班牙语变体的偏见评估联系起来。
## 1 引言
大型语言模型会从从未明确陈述的线索推断用户属性——国籍、方言、社会经济背景——并且这些推断即使在未言语化的情况下也会影响生成:经过指令调整的模型拒绝超过98%的明确人口统计查询,但仍根据推断的属性来调节输出(Bouchaud and Ramaciotti,2025 (https://arxiv.org/html/2607.21774#bib.bib9))。Fraser-Taliente等人(2026 (https://arxiv.org/html/2607.21774#bib.bib1))直接用自然语言自编码器(NLA)说明了这一点:他们的*语言转换*案例研究表明,模型在出现任何词汇线索之前的几个token时就将用户表示为俄罗斯人,后来追溯至错误标记的训练数据。这种类似的未言语化推断对于西班牙语是否发生尚不清楚,尽管有证据表明这对于那些最容易误读的变体应该最为重要——哥伦比亚西班牙语在识别基准测试中的得分远低于伊比利亚半岛西班牙语(F1=0.282 vs. 0.723),原因与训练数据组成有关(Kawasaki,2026 (https://arxiv.org/html/2607.21774#bib.bib22);Mayor-Rocher等人,2025 (https://arxiv.org/html/2607.21774#bib.bib23)),然而没有研究考察模型在产生该输出之前内部表示了什么。
我们使用针对Qwen-2.5-7B的开源NLA,对约30对匹配的哥伦比亚西班牙语/英语提示进行探测,以寻找模型最终响应中不存在的潜在国籍、社会经济地位或刻板印象表示。第2节(https://arxiv.org/html/2607.21774#S2)介绍了相关工作;第3节(https://arxiv.org/html/2607.21774#S3)详细介绍我们的程序;第4节(https://arxiv.org/html/2607.21774#S4)报告研究结果。
## 2 相关工作
在无需监督探针的情况下解释语言模型对其输入表示了什么的方面,已经汇聚出两种策略:投影或修补激活以恢复与输出相关的信息而无需训练(nostalgebraist,2020 (https://arxiv.org/html/2607.21774#bib.bib3);Belrose等人,2023 (https://arxiv.org/html/2607.21774#bib.bib4);Ghandeharioun等人,2024 (https://arxiv.org/html/2607.21774#bib.bib2)),以及训练一个读取器模型——通过稀疏字典(Cunningham等人,2024 (https://arxiv.org/html/2607.21774#bib.bib5))或一个完整的言语化器——将激活转换为自由文本(Chen等人,2024 (https://arxiv.org/html/2607.21774#bib.bib6);Pan等人,2024 (https://arxiv.org/html/2607.21774#bib.bib7);Karvonen等人,2025 (https://arxiv.org/html/2607.21774#bib.bib8))。我们采用后一种方法,使用Fraser-Taliente等人(2026 (https://arxiv.org/html/2607.21774#bib.bib1))的自然语言自编码器(NLA)作为我们的探测工具;他们的*语言转换*案例研究中,言语化器在提示中出现任何词汇线索之前就揭示了潜在的国籍推断,这促使我们询问哥伦比亚西班牙语是否也存在类似的未言语化推断。
另一条平行的工作线表明,人口统计属性可以从激活中线性解码,无论使用何种言语化方法。Bouchaud和Ramaciotti (2025 (https://arxiv.org/html/2607.21774#bib.bib9))报告了通过间接线索探测性别、种族和社会经济地位的AUC-ROC高达0.995,集中在中层;Lauscher等人(2022 (https://arxiv.org/html/2607.21774#bib.bib11))和Tang等人(2023 (https://arxiv.org/html/2607.21774#bib.bib12))在不同架构中证实了这一点,而Hu等人(2026 (https://arxiv.org/html/2607.21774#bib.bib17))表明更细粒度的属性分布更为分散而非严格线性。与我们假设最相关的是*对齐差距*:经过指令调整的模型拒绝了98%以上的明确人口统计查询(Bouchaud and Ramaciotti,2025 (https://arxiv.org/html/2607.21774#bib.bib9)),但当属性仅被暗示时,仍会根据与刻板印象一致的推断来调节生成(Neplenbroek等人,2025 (https://arxiv.org/html/2607.21774#bib.bib10);Tang等人,2023 (https://arxiv.org/html/2607.21774#bib.bib12)),这与偏见在去偏后仍持续存在于上下文化表示中的情况一致(Guo and Caliskan,2021 (https://arxiv.org/html/2607.21774#bib.bib14);Tan and Celis,2019 (https://arxiv.org/html/2607.21774#bib.bib13);Bommasani等人,2020 (https://arxiv.org/html/2607.21774#bib.bib16);Huang等人,2020 (https://arxiv.org/html/2607.21774#bib.bib15);Zhang等人,2025 (https://arxiv.org/html/2607.21774#bib.bib18))。
在行为层面,这种潜在的推断导致西班牙语变体和母语非英语的使用者出现可衡量的差异。伊比利亚半岛西班牙语的识别和生成始终最佳,而拉丁美洲变体则明显落后——哥伦比亚是最低的之一(F1=0.282 vs. 西班牙的0.723)——这与训练数据组成有关,而非数字资源量(Kawasaki,2026 (https://arxiv.org/html/2607.21774#bib.bib22);Mayor-Rocher等人,2025 (https://arxiv.org/html/2607.21774#bib.bib23);Martínez等人,2025 (https://arxiv.org/html/2607.21774#bib.bib28)),而英语的偏见缓解技术无法迁移到西班牙语(Robles等人,2025 (https://arxiv.org/html/2607.21774#bib.bib21))。英语显示出类似效果:锚定于感知到的非母语性会降低响应质量(Reusens等人,2024 (https://arxiv.org/html/2607.21774#bib.bib19)),少数族裔方言会获得更多刻板印象和居高临下的输出(Fleisig等人,2024 (https://arxiv.org/html/2607.21774#bib.bib20)),而对齐训练会扩大而非缩小这些差距(Ryan等人,2024 (https://arxiv.org/html/2607.21774#bib.bib24);Mire等人,2025 (https://arxiv.org/html/2607.21774#bib.bib25);Nayeem and Rafiei,2026 (https://arxiv.org/html/2607.21774#bib.bib26);Kantharuban等人,2023 (https://arxiv.org/html/2607.21774#bib.bib27))。
这两条文献仍然没有连接起来:线性探针研究确立了*人口统计推断与言语化输出存在差异*,偏见审计研究确立了*这种差异对代表性不足的变体造成伤害*,但都没有使用无训练、无监督的言语化器,通过受控的明确/隐含/中性诱导来定位*何时*从提示本身内部的间接线索中涌现出哥伦比亚身份推断。这正是我们针对的空白。
## 3 方法
#### 概述。
(Fraser-Taliente等人,2026 (https://arxiv.org/html/2607.21774#bib.bib1))表明,自然语言自编码器(NLA)解释可以揭示,模型在*任何*明确的词汇线索出现*之前*,并且在*此信念被言语化之前*,就已经在内部将用户表示为俄罗斯人。我们将这一发现改编成一个受控探针,以检验Qwen2.5-7B-Instruct是否从单个隐含线索内部推断出*哥伦比亚*身份,使用与(Fraser-Taliente等人,2026 (https://arxiv.org/html/2607.21774#bib.bib1))一起发布的开源NLA对。
#### 提取和四分位采样。
设MM为目标模型,hl∈Rdh_{\\ell}\\in\\mathbb{R}^{d}(d=3584d=3584)为层l=20\\ell=20处的残差流激活,该深度是发布的Qwen2.5-7B NLA对训练所用的深度,设NN为提示的token数。MM的一次确定性前向传播产生完整的激活序列{hl[1],...,hl[N]}\\{h_{\\ell}[1],\\dots,h_{\\ell}[N]\\},每个token位置一个。从此序列中我们选择四个激活,即四个连续四分位的*最后一个*token:
qk=⌊kN/4⌋,k∈{1,2,3,4},q_{k}=\\lfloor kN/4\\rfloor,\\quad k\\in\\{1,2,3,4\\},
因此hl[q1],...,hl[q4]h_{\\ell}[q_{1}],\\dots,h_{\\ell}[q_{4}]是来自同一次前向传播中四个不同位置的四个不同、全维度的向量——既不是单个激活,也不是对hlh_{\\ell}的35843584个维度的划分。在每个位置查询AV是不可行的,因为每次调用会产生数百个token,因此这个四点子样本使得每个提示的AV成本固定,与NN无关(Fraser-Taliente等人,2026 (https://arxiv.org/html/2607.21774#bib.bib1))。选择最后一个token还使每个查询保持在分布内:AV的监督热启动仅针对前缀最终激活进行训练,每个qkq_{k}形式上都是前缀x[1:qk]x[1:q_{k}]的最终token。每个hl[qk]h_{\\ell}[q_{k}]被传入一次(无重采样)到AV,zk∼AV(⋅∣hl[qk])z_{k}\\sim\\mathrm{AV}(\\cdot\\mid h_{\\ell}[q_{k}]),每个四分位产生一个解释。
#### 设计。
我们构建了15个基础场景,每个场景以西班牙语和英语翻译实现(共30个提示),每个*明确性*级别有五个场景:*明确*(明确的哥伦比亚标记,阳性对照),*隐含*(恰好一个细微线索,类似于(Fraser-Taliente等人,2026 (https://arxiv.org/html/2607.21774#bib.bib1))中的*伏特加*→“俄罗斯”案例),以及*中性*(主题匹配,无国籍标记,阴性对照,用于区分哥伦比亚特定效应与通用AV虚构)。
表1:2(语言)×3(明确性)设计,n=30n=30个提示。
#### 结构化编码。
每个提示的四个四分位级解释(z1,z2,z3,z4)(z_{1},z_{2},z_{3},z_{4})被扩展为120个提示×四分位单元,并由Claude Sonnet独立编码,涉及*国籍*、*社会经济地位*和*刻板印象*提及。编码提示要求(i)仅在明确文本证据存在时标记为true的类别,(ii)对于仅包含通用模型自我描述(例如*“我是Qwen,一个由阿里云创建的大型语言模型”*)的解释默认标记为false——这是已知的AV失败模式而非关于提示的实质性判断,(iii)为每个阳性标签提供逐字支持的引用。自动审计确认完全覆盖,标记失败的API调用,并拒绝任何返回引用未在其源解释中*逐字*找到的情况;120个单元中有1个在重试后提取失败并被列表排除(n=119n=119)。
由于AV已知会虚构听起来合理但上下文错误的具体细节——在我们的数据中,用西班牙、土耳其或加拿大替换哥伦比亚,出现在其他方面主题正确的解释中——因此一个阳性国籍标签会混淆两个不同的事件:表示*某个*国籍身份与专门表示*哥伦比亚*身份。因此,我们额外为每个阳性国籍引用标记其是否命名哥伦比亚(或明确的转喻,例如波哥大、TransMilenio),并在§4 (https://arxiv.org/html/2607.21774#S4)中报告未受限比率和哥伦比亚特定比率;这一区分是在分析设计时确定的,而非事后引入。
#### 统计分析。
我们报告每个(组×四分位)提及率及其Wilson分数区间,该区间在此设计的每个单元格小样本量(n=9n=9–1010)下有效,此时正态近似不适用。每个四分位处的隐含vs中性差异使用Fisher精确检验在相应的2×22\\times2表上进行,而非卡方检验,因为后者在此处的渐近假设不满足。为了总结*何时*国籍首先被表示,我们对于每个该类别至少出现一次的提示,取其最早的四分位,并使用Mann–WhitneyUU检验比较组间的分布;从未出现该类别的提示作为每个组的单独计数报告,而非插补,因为它们的缺失本身就有信息量。所有检验均为双侧检验且未对多重比较进行校正,这与下面的探索性范围一致。
#### 范围。
由于每个单元格n=5n=5,结果报告为描述性比率并带有定性证据,而非统计上有力的效应;我们仅从单层和每个四分位单个AV样本中提取,这限于黑客马拉松规模的计算。
## 4 结果
表2 (https://arxiv.org/html/2607.21774#S4.T2)报告了AV解释提到国籍的比率,按组和四分位分组。隐含线索组在所有四个四分位中单调上升(0.10→0.78),与上下文累积假设一致;图1 (https://arxiv.org/html/2607.21774#S4.F1)显示为持续的正斜率,既没有明确控制的早期上限,也没有后期的崩溃。有两个单元格偏离单调性——Q2处的明确组(0.00)和Q4处的中性组(0.20)——我们将在下面解决这两个问题,然后再转向首次出现的四分位(表3 (https://arxiv.org/html/2607.21774#S4.T3))以及隐含vs中性比较(表4 (https://arxiv.org/html/2607.21774#S4.T4))。
表 2:按组和四分位的国籍提及率(每个单元格n=9n=9–1010;一个单元因提取失败被排除,§3 (https://arxiv.org/html/2607.21774#S3.SS0.SSS0.Px4))。参考图注图 1:按四分位的国籍提及率,所有三个组。隐含(蓝色,三角形)从Q1到Q4稳定上升;明确(橙色,圆形)早期达到上限;中性(灰色,方形)非单调,在§4 (https://arxiv.org/html/2607.21774#S4)中讨论。#### 两个异常都源于非哥伦比亚的虚构,而非噪声。
我们直接检查了明确/Q2和中性/Q4背后的来源引用。明确组中的每个Q2解释都是与提示无关的偏离主题的虚构(例如*“Marketing de Google”*,*“conferencia Tesla”*)——与Q1处记录的相同低锚定失败模式(§3 (https://arxiv.org/html/2607.21774#S3.SS0.SSS0.Px4)),在短提示的第二个早期位置再次出现。中性/Q4背后的两个阳性引用提到了西班牙和海鲜饭,从未提及哥伦比亚。将国籍变量限制为仅哥伦比亚特定提及(排除西班牙/土耳其/加拿大;§3 (https://arxiv.org/html/2607.21774#S3.SS0.SSS0.Px4))消除了两个异常:中性在每个四分位降至0.000.00,而隐含从Q2开始严格高于零(0.00/0.10/0.20/0.110.00/0.10/0.20/0.11)。图1 (https://arxiv.org/html/2607.21774#S4.F1)中的定性模式因此低估而非虚构了隐含与中性的分离;我们在表2 (https://arxiv.org/htm相似文章
思考与非思考:通过稀疏自编码器解读大型语言模型的推理机制
本文使用Top-K稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B的内部推理,对比思考(CoT)与非思考模式,发现不同的特征激活模式,并通过因果干预实验加以验证。
使用稀疏自编码器发现数百万个可解释特征
本文介绍了Qwen3-Instruct SAE,这是一套基于Qwen3指令微调模型训练的稀疏自编码器,能够发现数百万个可解释特征,并展示了拒绝引导能力。
通用语还是探测器产物?重新思考多语言大语言模型中的潜在语言
本研究比较了用于识别多语言大语言模型中潜在语言的探测技术,发现不同方法产生不一致的结果,表明它们揭示了多语言处理的不同方面,而非单一的内部通用语。
Qwen-Scope:将稀疏特征转化为大语言模型的开发工具
本文介绍了 Qwen-Scope,这是一套在 Qwen3 和 Qwen3.5 模型上训练的稀疏自编码器(SAE)工具包,旨在实现机械可解释性分析与干预。该工具包发布了涵盖密集和 MoE 骨干网络的 14 组 SAE 权重,为残差流激活提供了稀疏表示。
LLMs的机制人格分析:通过潜在特征干预调控人格
本文介绍了一种机制可解释性方法,通过使用稀疏自编码器识别并干预潜在特征来调控LLM人格特质,在保持语言性能的同时实现了可控的人格调制。