在LLM个性化中重新聚焦人类

arXiv cs.CL 论文

摘要

本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。

arXiv:2606.06614v1 公告类型:新 摘要:尽管兴趣日益增长,大多数对大型语言模型(LLM)个性化能力的评估仍依赖合成数据。目前尚不清楚当前的个性化系统对真实用户的效果如何。在本文中,我们研究了使用合成数据与人类数据时LLM个性化性能的差距。我们收集了人类对话(550个对话)以及个性化三个阶段的判断:从对话中提取用户属性(5,949个判断),将相关属性与新提示配对(11,919个),以及将相关属性融入个性化响应中(1,101个)。融入人类数据揭示了系统在每个阶段的局限性。模型在从人类对话中提取属性方面存在困难,在相关属性上与人类判断不一致,生成的个性化响应被人类评为并不优于通用响应(尽管LLM广泛认为更好)。我们引入了两种轻量级基于训练的干预措施,在前两个阶段将自动化个性化评估向人类数据靠拢。然而,在第三阶段,我们发现学习到的奖励模型与人类评分的相关性仅中等,这表明人类对齐的个性化质量判断难以直接建模。我们收集的数据为研究模型如何以人类认为有用的方式提取、选择和融入用户信息奠定了基础。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:19

# 在LLM个性化中重新以人类为中心

来源:https://arxiv.org/html/2606.06614

Lechen Zhang† Jiarui Liu♯ Tal August†

†伊利诺伊大学厄巴纳-香槟分校 ♯卡内基梅隆大学

\{lechenz3, taugust\}@illinois\.edu jiaruil5@andrew\.cmu\.edu

###### 摘要

尽管兴趣日益增长,但大多数对大型语言模型(LLM)个性化能力的评估仍然依赖合成数据。目前尚不清楚当前的个性化系统对真实用户的实际效果如何。在本文中,我们研究了在使用合成数据与人类数据时LLM个性化性能的差距。我们收集了人类对话(550次对话)以及个性化三个阶段的判断:从对话中提取用户属性(5,949个判断)、将相关属性与新提示配对(11,919个判断)、以及将相关属性融入个性化回复(1,101个判断)。融入人类数据揭示了系统在每一个阶段的局限性。模型难以从人类对话中准确提取属性,在相关属性上与人类判断存在分歧,并且生成的个性化回复在人类看来并不比通用回复更好(尽管LLM作为评判者普遍认为更好)。我们在前两个阶段引入了两种轻量级的基于训练的干预措施,使自动化个性化评估更接近人类数据。然而,在第三阶段,我们发现训练得到的奖励模型与人类评分的相关性仅为中等,这表明与人类对齐的个性化质量判断难以直接建模。我们收集的数据为研究模型应如何以人类认为有用的方式提取、选择并融入用户信息奠定了基础。

# 在LLM个性化中重新以人类为中心

Lechen Zhang† Jiarui Liu♯ Tal August†

†伊利诺伊大学厄巴纳-香槟分校 ♯卡内基梅隆大学

\{lechenz3, taugust\}@illinois\.edu jiaruil5@andrew\.cmu\.edu

## 1 引言

随着大型语言模型(LLM)在更多领域部署给更多用户,其针对不同用户个性化回复的能力正变得越来越受追捧(Shaikh等人,2025 (https://arxiv.org/html/2606.06614#bib.bib12))。尽管兴趣日益增长,但目前尚不清楚当前的个性化系统对真实用户的实际效果如何。过去评估模型个性化能力的工作主要依赖合成数据:用户画像(Jiang等人,2025 (https://arxiv.org/html/2606.06614#bib.bib4))、模拟对话(Kim等人,2025 (https://arxiv.org/html/2606.06614#bib.bib22))以及基于LLM的评估(Zhao等人,2025b (https://arxiv.org/html/2606.06614#bib.bib2))。虽然合成数据支持大规模实验,但合成回复与人类回复存在显著差异(Naous等人,2026 (https://arxiv.org/html/2606.06614#bib.bib17);Mehri等人,2026b (https://arxiv.org/html/2606.06614#bib.bib16))。目前尚不清楚模型在合成数据上的性能是否能很好地映射到真实的人类体验。这种紧张关系凸显了个性化的核心困难:个性化的目标是一个人类用户,其属性以及对系统有效性的判断往往是隐式的、嘈杂的、不完整的且依赖于上下文(Hu等人,2008 (https://arxiv.org/html/2606.06614#bib.bib13);Shaikh等人,2025 (https://arxiv.org/html/2606.06614#bib.bib12))。

在本文中,我们研究了用于评估LLM个性化的合成数据与人类数据之间的差距。我们基于先前的评估,将个性化构建为一个三阶段流水线:模型必须(1)从先前的对话中推断稳定的用户属性(用户属性提取),(2)选择与特定回复相关的属性(属性相关性匹配),以及(3)融入相关属性以生成优于通用回复的回复(个性化回复生成)。对于流水线的每个阶段,我们比较人类数据与合成数据。我们的数据集包含50位真实用户和550段对话,这些对话来自现有的对话数据集,并针对所有三个阶段配对了人类判断:5,949个关于提取的用户属性的判断,11,919个关于属性-提示配对的判断,以及1,101个关于个性化生成回复偏好判断的判断。

利用我们的数据集,我们比较了模型性能以及与人类数据和判断的对齐程度。我们发现,融入人类数据揭示了模型在个性化的每个阶段都存在局限性。与合成对话相比,模型难以从人类对话中准确提取属性:从真实对话中提取的用户属性中,额外有22%被判定为有问题。一旦属性被提取出来,模型在将属性与提示配对时再次遇到困难:尽管LLM之间具有很强的一致性,但LLM在相关性匹配上与人类不一致,过度识别出20–40%的更多属性为相关。最后,即使提供了相关属性,人类与模型在何为有效的个性化回复上存在分歧:作为生成器,LLM生成的个性化回复在54.6%的案例中被人类判定为不优于通用回复;而作为评判者,LLM给出的评分过高,与人类偏好仍保持较差的对齐。

我们引入了两种轻量级干预措施,使自动化个性化评估在前两个阶段更接近人类数据。对于属性提取,一个在人类标注上训练的轻量级RoBERTa(Liu等人,2020 (https://arxiv.org/html/2606.06614#bib.bib38))验证器可以在提取的属性被下游使用之前作为有效的安全屏障。对于相关性匹配,基于训练的方法,包括监督分类和GRPO(Shao等人,2024 (https://arxiv.org/html/2606.06614#bib.bib39)),减少了过度选择,并使相关性判断与人类更对齐。对于我们的第三阶段个性化回复生成,训练得到的奖励模型与人类评分的相关性仅为中等,这表明与人类对齐的个性化质量判断难以直接建模。

总体而言,我们的结果表明,个性化给自动化和合成评估带来了独特的困难。我们希望我们收集的数据能够实现对个性化系统更深入的评估,并为研究模型应如何以人类认为有用的方式提取、选择并融入用户信息奠定基础。

代码和数据集可在 https://github.com/orange0629/recenter-personalization 获取。

请参见图注

图1:我们的三阶段个性化框架概述。(1)从对话历史中提取用户属性,(2)针对当前交互上下文的属性相关性匹配,以及(3)基于所选属性的个性化回复生成。通过融入以人类为基础的数据,我们揭示了个性化每个阶段的局限性:模型难以从人类对话中准确提取属性,将这些属性与新提示配对,以及判断什么构成有效的个性化回复。

## 2 LLM个性化的三阶段框架

LLM个性化涵盖了从整体式到分解式方法的范围。端到端基准将个性化质量作为一个单一的黑盒任务进行评估,这使得难以诊断系统在何处失败(Zollo等人,2025 (https://arxiv.org/html/2606.06614#bib.bib1);Zhao等人,2025b (https://arxiv.org/html/2606.06614#bib.bib2);Kim等人,2025 (https://arxiv.org/html/2606.06614#bib.bib22);Zhao等人,2025a (https://arxiv.org/html/2606.06614#bib.bib23))。另一系列工作主张更明确的分解(Wang等人,2023 (https://arxiv.org/html/2606.06614#bib.bib29);Zhuang等人,2024 (https://arxiv.org/html/2606.06614#bib.bib28);Shi等人,2025 (https://arxiv.org/html/2606.06614#bib.bib44);Xu等人,2026 (https://arxiv.org/html/2606.06614#bib.bib45);Du等人,2026 (https://arxiv.org/html/2606.06614#bib.bib46);Mehri等人,2026a (https://arxiv.org/html/2606.06614#bib.bib51)),表明将个性化分解为检索、排序和个性化生成等阶段,相对于整体式方法能带来一致性的提升。我们将LLM个性化构建为一个三阶段流水线(图1 (https://arxiv.org/html/2606.06614#S1.F1)):(1)从对话历史中提取用户属性,(2)针对当前交互上下文的属性相关性匹配,以及(3)基于所选属性的个性化回复生成。该框架基于先前的个性化工作(例如,相关性匹配的灵感来自结构化记忆查找,Salemi等人,2024 (https://arxiv.org/html/2606.06614#bib.bib9)),尽管我们将范围缩小到初始回复个性化(即,给定一个用户及其之前的对话,个性化下一个回复),并将后续个性化阶段(例如,更新过时的记忆,Maharana等人,2024 (https://arxiv.org/html/2606.06614#bib.bib19))留作未来工作。

#### 阶段1 — 属性提取。

我们将**用户属性**定义为关于用户的稳定、长期且与上下文无关的陈述,包括用户偏好和个人资料信息(例如,“用户更喜欢要点式呈现”或“用户是一名Java开发者”)。我们专注于在单次对话中不太可能改变的属性,作为规范我们流水线的初步步骤。该定义遵循了个性化和记忆系统中的常见做法,即过去的交互被综合成持久的用户画像(类似于人物角色),之后可以被检索用于个性化生成(Zhong等人,2024 (https://arxiv.org/html/2606.06614#bib.bib5);Kang等人,2025 (https://arxiv.org/html/2606.06614#bib.bib11))。

#### 阶段2 — 相关性匹配。

我们将**属性相关性**定义为一个用户属性是否应该影响模型对特定提示的回复。先前的系统通常将此阶段近似为一个检索问题,通过语义相似性或结构化记忆查找来选择用户信息(Salemi等人(2024 (https://arxiv.org/html/2606.06614#bib.bib9));Wu等人(2025 (https://arxiv.org/html/2606.06614#bib.bib7));Sun等人(2025 (https://arxiv.org/html/2606.06614#bib.bib18)))。然而,语义相似性并不一定意味着个性化相关性,而词汇上遥远的属性仍然可能影响回复的表述方式(Okite等人,2026 (https://arxiv.org/html/2606.06614#bib.bib31))。因此,我们将相关性选择视为一个推理问题,系统必须决定哪些属性会有意义地改进回复,哪些应该保持未使用,以及属性应如何影响回复而不引入无关或过度的个性化。

#### 阶段3 — 个性化回复生成。

一旦选择了相关属性,模型就必须确定*如何*在最终回复中使用它们。我们将成功的**个性化生成**定义为生成一个优于通用回复的回复。现有工作常常承认相关担忧,但很少直接研究这一阶段的质量。相反,大多数工作使用相邻的指标,如任务性能、偏好对齐或画像一致性(Salemi等人,2024 (https://arxiv.org/html/2606.06614#bib.bib9);Jiang等人,2025 (https://arxiv.org/html/2606.06614#bib.bib4))。因此,我们不仅评估所选属性是否影响输出,还评估它们是否以上下文适当且用户可接受的方式被使用。

## 3 在个性化流水线中重新以人类为中心

尽管人类是个性化的主体,但大多数现有工作使用合成画像、模拟用户、合成对话或基于LLM的评判者来代理人类输入的角色(Salemi等人(2024 (https://arxiv.org/html/2606.06614#bib.bib9));Jiang等人(2025 (https://arxiv.org/html/2606.06614#bib.bib4));Liu等人(2025 (https://arxiv.org/html/2606.06614#bib.bib41));Zhao等人(2025b (https://arxiv.org/html/2606.06614#bib.bib2)))。虽然这些设计支持大规模评估,但目前尚不清楚当前方法能否忠实地模拟人类用户(Ivey等人(2024 (https://arxiv.org/html/2606.06614#bib.bib21));Dong等人(2024 (https://arxiv.org/html/2606.06614#bib.bib20));Naous等人(2026 (https://arxiv.org/html/2606.06614#bib.bib17));Mehri等人(2026b (https://arxiv.org/html/2606.06614#bib.bib16)))。因此,现有的个性化基准可能会引入系统性偏差或高估系统能力。我们认为,LLM个性化的进步需要通过在个性化流水线中重新以人类为中心,具体做法是:(1)将数据基于真实的人类交互(§4 (https://arxiv.org/html/2606.06614#S4)),以及(2)用人类来判断个性化质量(§5 (https://arxiv.org/html/2606.06614#S5)和§6 (https://arxiv.org/html/2606.06614#S6))。在下面的每个小节中,我们将说明融入人类对话和判断如何凸显当前个性化评估中的局限性。

#### 模型

在本研究中,我们主要关注五种最近广泛使用的开源权重和专有LLM。开源权重LLM包括Llama-3.3-70B(Grattafiori等人,2024 (https://arxiv.org/html/2606.06614#bib.bib34))、Qwen3.5-27B(Qwen,2026 (https://arxiv.org/html/2606.06614#bib.bib35))和Gemma-4-31B(Google DeepMind,2026 (https://arxiv.org/html/2606.06614#bib.bib36));专有LLM包括Claude-Sonnet-4.6和GPT-5.4。这些开源权重LLM展示了良好的质量-成本权衡,使其成为大规模个性化实验的实用选择。

## 4 将个性化基于人类交互(阶段1)

我们研究了当使用人类对话或合成对话时,属性提取(阶段1)有何不同。我们发现,人类对话包含更丰富和更多样化的属性(§4.2 (https://arxiv.org/html/2606.06614#S4.SS2.SSS0.Px1)),并且从人类对话中提取属性比从合成对话中更容易出错(§4.2 (https://arxiv.org/html/2606.06614#S4.SS2.SSS0.Px2))。

### 4.1 实验

#### 数据

我们使用WildChat(Zhao等人,2024 (https://arxiv.org/html/2606.06614#bib.bib3))作为人类对话的基础来源,并通过用户IP将多个对话聚类。¹¹使用哈希IP地址作为近似用户标识符遵循了之前关于WildChat的工作(Zhao等人,2024 (https://arxiv.org/html/2606.06614#bib.bib3);Naous等人,2026 (https://arxiv.org/html/2606.06614#bib.bib17))。结果得到98,334个用户。我们筛选出活跃且真实的用户的仅英语对话,²²我们筛选出具有足够交互历史(至少3次对话和15轮对话)且没有自动化或恶意使用迹象(LLM判断)的用户。完整的预处理细节见附录A (https://arxiv.org/html/2606.06614#A1)。最终得到16,573个用户。对于合成数据,我们包括三个最近的个性化数据集:CUPID(Kim等人,2025 (https://arxiv.org/html/2606.06614#bib.bib22))、PrefEval(Zhao等人,2025a (https://arxiv.org/html/2606.06614#bib.bib23))和PersonaLens(Zhao等人,2025b (https://arxiv.org/html/2606.06614#bib.bib2))。

#### 实验设置

为了提取用户属性,我们将每个用户历史分割成更短的块,以适应所有LLM的上下文窗口(50K tokens),并提示LLM列出每个块中表达或隐含的用户相关属性,同时为每个提取的属性提供推理和置信度评分。我们使用Llama-3.3-70B作为属性提取实验的主干模型。³³我们发现Llama-3.3-70B对于此任务是具有竞争力的选择,因为根据人工检查,它在我们测试的开源模型中表现最佳。我们不使用闭源模型,因为 s

相似文章

在LLM个性化中重新以人类为中心

Hugging Face Daily Papers

本文通过将真实人类重新引入评估循环,研究LLM个性化的有效性,揭示了在个性化管道的每个阶段人类判断与LLM输出之间的系统性差距,并强调了合成数据和LLM评判的局限性。

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。

HumanLLM:通过人类认知模式对大语言模型拟人化的基准测试与改进

arXiv cs.CL

HumanLLM 提出了一个框架,通过将心理模式建模为相互作用的因果力来对大语言模型的拟人化进行基准测试和改进。该方法从学术文献中构建了244个心理模式和11,359个多模式场景。研究表明,真正的人类对齐需要认知建模而非表面行为模拟,HumanLLM-8B 在多模式动态上的表现超越了 Qwen3-32B 等更大的模型。

从提示到行为对齐:用于推荐评估的个性化LLM评判器

arXiv cs.AI

本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。