定位与控制大型语言模型中的隐式个性化

arXiv cs.CL 论文

摘要

本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。

arXiv:2608.11735v1 公告类型:新 摘要:大型语言模型(LLM)通常会在用户未明确说明人口统计身份的情况下,因隐式的人口统计线索而改变其输出。先前的工作已记录了这种行为,但这些行为变化与模型内部激活之间的联系仍不清楚。通过匹配五款LLM中的提示对话和中性对话,我们确定了一个局部化的内部激活信号能够追踪推荐内容的变化,相关性高达r=0.87。当多个线索同时出现时,它们的内部信号大致会合并,但输出的变化并不是简单相加。我们进一步表明,移除与某个线索相关的内部信号可以抑制其影响,通常比通过提示要求模型忽略人口统计信息更有效,同时在很大程度上保持了一般基准性能。然而,选择性移除一个维度的影响而保留同时出现的其他维度的能力,仍然高度依赖于模型和属性。这些结果将隐式个性化行为与一个可分析和因果控制的内部信号联系起来。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:28

# 定位与控制大语言模型中的隐式个性化

来源:https://arxiv.org/html/2608.11735

Siqi Wu,Thai Le

所属机构:印第安纳大学
所属机构:美国布卢明顿
邮箱:[{yueryan,swu2,tle}@iu\.edu](mailto:)

###### 摘要

大语言模型(LLM)常常会因隐式的人口统计学线索而改变其输出,即使用户从未明确说明其人口统计学身份。已有工作记录了这种行为,但这些行为变化与模型内部激活之间的联系仍不清楚。通过在五个LLM上使用匹配的线索对话和中性对话,我们确认了一个局部化的内部激活信号能够追踪推荐变化,相关性最高可达r=0.87r=0.87。当多个线索同时出现时,其内部信号在很大程度上是组合叠加的,但输出的变化却并非简单的相加。我们进一步证明,去除与某个线索相关的内部信号可以抑制其影响,且通常比通过提示要求模型忽略人口统计学信息更有效,同时能在很大程度上保持通用基准性能。然而,在保留共现维度的同时选择性移除某一维度影响的能力,仍然高度依赖于具体模型和属性。这些结果将隐式个性化行为与一个可分析和可因果控制的内部信号联系了起来。

## 1 引言

当用户提到庆祝宽扎节、随口说出*“no cap”*,或询问操场游戏时,大语言模型(LLM)可能会根据这些线索所携带的人口统计学关联,悄悄调整其后续推荐,这种现象被称为*隐式个性化*(15 (https://arxiv.org/html/2608.11735#bib.bib1);17 (https://arxiv.org/html/2608.11735#bib.bib3))。已有研究在多个模型家族中证明了这一现象:编织在多轮对话中的身份线索会可靠地将推荐推向符合刻板印象的内容(19 (https://arxiv.org/html/2608.11735#bib.bib34);13 (https://arxiv.org/html/2608.11735#bib.bib2);28 (https://arxiv.org/html/2608.11735#bib.bib4);11 (https://arxiv.org/html/2608.11735#bib.bib33);7 (https://arxiv.org/html/2608.11735#bib.bib32))。由此产生的危害是具体而严重的。仅方言特征就已被证明会引发更严苛的假设性刑事判决和更低声望的工作分配(13 (https://arxiv.org/html/2608.11735#bib.bib2));当用户历史中出现隐式的人口统计学相关特征时,推荐会收窄至刻板印象内容(17 (https://arxiv.org/html/2608.11735#bib.bib3);4 (https://arxiv.org/html/2608.11735#bib.bib5))。随着LLM日益被整合进关键决策流程,这种静默适应变得尤其成问题,用户无法看到条件化信号、无法对其提出异议,也无法选择退出。

参见图注

图1:概述。隐式线索会改变推荐结果,而线索引起的激活差异在L⋆L^{\star}(已识别的中介层)处能够追踪这一变化。此外,将隐藏方向投影出去可以抑制该变化。

虽然隐式个性化的行为后果已被充分证实(28 (https://arxiv.org/html/2608.11735#bib.bib4)),但这种变化与模型内部表示之间的关系在很大程度上仍不清楚。一些研究通过采用基于探针的方法来预测与用户上下文相关的人口统计学属性,从而触及中间激活(4 (https://arxiv.org/html/2608.11735#bib.bib5);9 (https://arxiv.org/html/2608.11735#bib.bib18))。这些探针表明属性信息是可解码的,但并不能说明它是否在因果意义上塑造了答案。此外,真实对话通常同时携带多个线索。单个对话可能同时包含文化引用和特定年龄段的俚语,因此单轴解释可能无法预测模型在线索重叠时的行为。因此我们要问:混合线索上下文的内部表示是否能分解为其单线索部分?它所驱动的行为是否也能如此分解?我们通过原始线索引起的激活差异ΔA\Delta\mathbf{A}来建立这种联系,该差异是指在介导行为变化的具体层上,匹配的线索上下文与中性上下文在残差流上的差异。图1 (https://arxiv.org/html/2608.11735#S1.F1)总结了三个步骤:线索对话和中性对话产生不同的推荐;它们在这些局部化层的激活差异能够追踪该差异的大小;在生成过程中将该差异从残差流中投影出去可以抑制它。我们评估了五个LLM(7B至14B参数)在电影推荐任务上的表现,对于九个单线索条件中的每一个,以及种族、性别和年龄的三种双线索组合中的每一种,均使用n=50n=50个匹配的线索-中性对话对。我们的主要贡献是:

1. 1.一种追踪个性化的内部信号。我们发现激活差异(ΔA\Delta A)的归一化幅度与行为变化在逐样本基础上强相关(最高为r=.87r=.87),并且在无变化发生的条件下趋近于零。
2. 2.刻画多重身份如何组合。当多个年龄线索同时出现时,混合线索差异ΔA\Delta A可以从样本自身的单线索差异中可靠地重构出来。然而,最终输出并未完美反映这种内部相加:实际行为变化是次加性的,比单线索变化之和低2828–38%38\%。
3. 3.在多线索上下文中关闭隐式个性化。通过在生成过程中投影掉与特定人口统计学线索相关的内部方向,我们可以在某些模型和维度上选择性地抑制其对输出的影响。这种有针对性的内部消融与明确的“忽略人口统计学信息”提示相比,效果相当或更好,后者有时会适得其反并增加刻板印象,同时能在很大程度上保持模型的通用推理能力。

这些结果共同建立了隐式个性化与模型内部表示之间缺失的联系:目标层(L⋆L^{\star})处ΔA\Delta\mathbf{A}的归一化幅度能够追踪模型会产生的变化,而其样本平均方向为抑制该变化提供了推理时目标。

## 2 相关工作

隐式个性化与人口统计学偏见密切相关,但其变化是由用户从未明确说明的线索驱动的,而不是由给定的属性驱动的。早期的基准如StereoSet(27 (https://arxiv.org/html/2608.11735#bib.bib21))、BOLD(5 (https://arxiv.org/html/2608.11735#bib.bib20))和CEB(39 (https://arxiv.org/html/2608.11735#bib.bib23))描述了生成文本中的刻板印象关联,而较新的审计则研究身份相关用户信息如何改变推荐信(38 (https://arxiv.org/html/2608.11735#bib.bib25))、职业和简历设置(8 (https://arxiv.org/html/2608.11735#bib.bib24);36 (https://arxiv.org/html/2608.11735#bib.bib29);40 (https://arxiv.org/html/2608.11735#bib.bib30))、财务建议(7 (https://arxiv.org/html/2608.11735#bib.bib32))以及方言条件决策(13 (https://arxiv.org/html/2608.11735#bib.bib2))中的任务输出。关键区别在于身份是明确说明的还是仅被隐含:显式审计会提供一个人口统计学人设(17 (https://arxiv.org/html/2608.11735#bib.bib3);36 (https://arxiv.org/html/2608.11735#bib.bib29)),而隐式审计会在不点名身份的情况下改变与身份相关的线索(15 (https://arxiv.org/html/2608.11735#bib.bib1);28 (https://arxiv.org/html/2608.11735#bib.bib4))。这种变化之所以可能发生,是因为前沿模型可以从普通文本中恢复出个人属性(34 (https://arxiv.org/html/2608.11735#bib.bib15))。然而,纯粹的行为审计存在局限:不同的线索形式会产生不同的结论,而重叠的身份会产生单轴测试无法发现的影响(23 (https://arxiv.org/html/2608.11735#bib.bib42);40 (https://arxiv.org/html/2608.11735#bib.bib30))。在机制层面,已有工作通过线性探针(28 (https://arxiv.org/html/2608.11735#bib.bib4))和人设跟踪系统(9 (https://arxiv.org/html/2608.11735#bib.bib18);4 (https://arxiv.org/html/2608.11735#bib.bib5))研究了用户属性在内部是如何表示的。探针表明属性信息是可解码的,但并不能说明它驱动了输出。我们遵循因果中介分析传统(37 (https://arxiv.org/html/2608.11735#bib.bib8)),转而询问从线索引起的激活差异中读出的量是否能够追踪行为变化,并支持有针对性的干预。一个互补的研究方向表明,激活方向可以直接改变行为:表征工程构建对比方向来引导生成(44 (https://arxiv.org/html/2608.11735#bib.bib41);20 (https://arxiv.org/html/2608.11735#bib.bib16);33 (https://arxiv.org/html/2608.11735#bib.bib22);41 (https://arxiv.org/html/2608.11735#bib.bib43);1 (https://arxiv.org/html/2608.11735#bib.bib31)),相关工作则通过迭代投影(30 (https://arxiv.org/html/2608.11735#bib.bib13))或闭式线性擦除(2 (https://arxiv.org/html/2608.11735#bib.bib14))来消除受保护属性。与我们的干预最接近的是,在显式招聘场景中,中和属性方向优于反偏见提示(18 (https://arxiv.org/html/2608.11735#bib.bib38)),并且可以在保持能力的同时编辑特质(16 (https://arxiv.org/html/2608.11735#bib.bib27))。这些方法从明确陈述的属性或带标签的探针中构建方向。我们则采用自然发生的隐式线索所引发的对比,并询问其幅度是否追踪行为变化,在线索共现时是否可组合,以及去除其方向是否能抑制该行为,从而将LLM推荐器公平性审计中报告的不平等(43 (https://arxiv.org/html/2608.11735#bib.bib10);17 (https://arxiv.org/html/2608.11735#bib.bib3))与一个可测量的内部量联系起来。

## 3 方法论

### 3.1 数据集

我们采用配对比较框架,其中每个样本由匹配的多轮对话组成,这些对话仅在于是否包含隐式人口统计学线索这一点上有所不同。我们使用GPT-4o生成所有对话(14 (https://arxiv.org/html/2608.11735#bib.bib39))。为了全面捕捉个性化效应,我们从基于文献的分类体系中抽取线索,该体系包含不同类型的身份线索(28 (https://arxiv.org/html/2608.11735#bib.bib4))。这些类型包括例如文化引用、食物、爱好和行为描述。人口统计学身份本身在线索条件或中性条件下都不会被明确命名。我们考察了种族、性别和年龄三个属性条件。详细类别包括:种族中的黑人、亚洲人和白人;性别中的男性和女性;年龄中的儿童、青少年、成人和老年人,共形成九个条件。对于每个n=50n=50的基础场景,我们生成一组匹配的K=5K=5轮用户和助手对话。我们从线索池中随机抽样,每个用户轮次恰好使用一个线索。匹配组内的每个上下文共享完全相同的话题框架,这意味着每个助手轮次的话题在各条件下保持不变。从这个共享主干出发,我们分支到所需的测试条件。这些条件包括每个年龄水平的身份线索变体、使用身份中性填充词的中性基线,以及直接陈述人口统计学身份的显式上下文,用于行为校准。每组对话都以相同的查询结束,要求推荐五部电影,并且每行只输出片名和年份。我们使用贪心解码(T=0T=0)获取响应。我们在主文中聚焦于电影,并在附录A (https://arxiv.org/html/2608.11735#A1)中报告书籍和文章的结果。对于§4.2 (https://arxiv.org/html/2608.11735#S4.SS2)和§4.3 (https://arxiv.org/html/2608.11735#S4.SS3)中的交叉实验,我们在同一对话中组合两个身份维度。我们设置K=4K=4,其中两个线索来自第一个维度,两个来自第二个维度。这确保了跨维度比较的公平性。每个混合线索条件都配有侧重于单一维度的剂量匹配对照。我们通过将另一维度的线索替换为中性填充词来构建这些对照。最后,我们随机化具体身份线索在各样本中的出现顺序,以减轻位置混杂效应。

### 3.2 模型

我们评估了五个指令调优的LLM,参数规模从7B到14B。这些模型包括Llama-3-8B、Mistral-7B-v0.3、Qwen3-8B、Qwen3-14B和Phi-4[^1]。我们在全部五个模型上运行相关性和交叉实验,并在§4.3 (https://arxiv.org/html/2608.11735#S4.SS3)中的消融和能力保持实验中使用三个较小的模型。

[^1]: 我们使用`meta-llama/Meta-Llama-3-8B-Instruct`(依据Meta Llama 3社区许可);`mistralai/Mistral-7B-Instruct-v0.3`、`Qwen/Qwen3-8B`和`Qwen/Qwen3-14B`(依据Apache License 2.0);以及`microsoft/phi-4`(依据MIT许可证)。

### 3.3 行为指标

我们使用两个互补的指标来衡量个性化变化。

#### 描述语义嵌入距离(SED-desc)。

对于每个样本,我们将推荐的五个片名解析为其TMDB[^2] 剧情简介。我们将这些简介在每个条件下拼接成一个字符串,并使用预训练句子变换器`all-mpnet-base-v2`(31 (https://arxiv.org/html/2608.11735#bib.bib44))进行编码。SED-desc是1减去两个结果嵌入的余弦相似度。值越高表示线索推荐与中性推荐之间的语义变化越大。这个连续的、与分类体系无关的指标能够捕捉到项目替换以及非相同项目之间的语义相似性。它还能检测推荐集整体主题特征的变化。

[^2]: https://www.themoviedb.org/

#### 内容对齐比(CAR)。

虽然SED-desc衡量变化的大小,但它不衡量变化的方向;一个响应可能在语义上发生漂移,却没有变得更符合刻板印象。为了捕捉这种方向性变化,我们使用GPT-4o根据预先指定的分类体系(附录B (https://arxiv.org/html/2608.11735#A2))对每个推荐项目进行分类,判断其是否与目标身份相关联。我们将CAR定义为样本中五个项目中被标记为身份关联项目的比例。对于样本ii和目标分类体系tt,最终的CAR变化计算为CAR⁡(Ccue(i),t)−CAR⁡(Cneutral(i),t)\mathrm{CAR}(C_{\mathrm{cue}}^{(i)};t)-\mathrm{CAR}(C_{\mathrm{neutral}}^{(i)};t)。针对相同分类体系对配对的中性响应进行评分,可以控制模型默认输出中的基线刻板印象内容。为了验证自动化标注,一位人工标注者使用相同的分类体系对推荐的层次抽样样本进行了独立重新标注。人工与GPT-4o的总体一致性达到0.8,分歧主要集中在成年/中性边界上,如附录B (https://arxiv.org/html/2608.11735#A2)所示。

这两个指标回答不同的问题。SED-desc衡量响应移动了多远;CAR衡量响应包含哪些与身份关联的内容。

表1:各模型在种族、性别、年龄九个条件下的行为变化。∗∗∗p<0.001,∗∗p<0.01,∗p<0.05。

| 维度 | 属性 | Llama-3-8B | Mistral-7B | Qwen3-8B | Qwen3-14B | Phi-4 |
|------|------|------------|------------|----------|-----------|------|
|      |      | SED | CAR | SED | CAR | SED | CAR | SED | CAR | SED | CAR |
| 种族 | 黑人 | +0.82∗∗∗ | +0.85∗∗∗ | +0.68∗∗∗ | +0.72∗∗∗ | +0.70∗∗∗ | +0.82∗∗∗ | +0.49∗∗∗ | +0.81∗∗∗ | +0.64∗∗∗ | +0.75∗∗∗ |
| 种族 | 亚洲人 | +0.87∗∗∗ | +0.71∗∗∗ | +0.51∗∗∗ | +0.42∗∗ | +0.38∗ | +0.74∗∗∗ | +0.26 | +0.66∗∗∗ | +0.26 | +0.36∗ |
| 种族 | 白人 | +0.34∗ | – | +0.29 | – | +0.18 | – | -0.01 | +0.18 | +0.30 | – |
| 性别 | 男性 | +0.65∗∗∗ | +0.58∗∗∗ | +0.37∗ | -0.16 |

相似文章

大型语言模型应学习个性化而非聚合的人类偏好

arXiv cs.LG

这篇立场论文主张,大型语言模型应从个性化而非聚合的人类偏好中学习,指出社会选择理论中的理论局限性以及人口多样性带来的实际问题。它提出了有边界的个性化框架,在尊重个体自主性的同时维护普遍的安全约束。

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs

arXiv cs.AI

This paper introduces LUNAR, a benchmark for evaluating how large language models personalize responses from longitudinal app interaction histories across daily-life domains such as clothing, food, housing, and mobility. Experiments on 19 mainstream LLMs reveal that effective personalization depends on evidence selection and cross-domain integration, and that stronger personalization can come at the cost of privacy protection.

大型语言模型个性化能力的基准测试

arXiv cs.AI

本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。

赋予角色的大型语言模型表现出类似人类的动机推理

arXiv cs.CL

本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。