在LLM个性化中重新以人类为中心

Hugging Face Daily Papers 论文

摘要

本文通过将真实人类重新引入评估循环,研究LLM个性化的有效性,揭示了在个性化管道的每个阶段人类判断与LLM输出之间的系统性差距,并强调了合成数据和LLM评判的局限性。

尽管兴趣日益增长,但大多数关于大语言模型(LLM)个性化能力的评估都依赖于合成数据。目前尚不清楚当前的个性化系统对真实用户的效果如何。本文研究了使用合成数据与人类数据时LLM个性化性能的差距。我们收集了人类对话(550段对话)以及个性化三个阶段的判断:从对话中提取用户属性(5,949个判断)、将相关属性与新提示配对(11,919个判断)、以及将相关属性融入个性化回复(1,101个判断)。纳入人类数据揭示了每个阶段的系统局限性。模型难以从人类对话中提取属性,在相关属性上与人类判断存在分歧,并且生成的个性化回复在人类看来并不比通用回复更好(尽管LLM评判普遍认为其更好)。我们引入了两种基于训练的轻量级干预,在前两个阶段将自动化个性化评估向人类数据靠拢。然而,在第三阶段,我们发现学习到的奖励模型与人类评分仅呈现适度相关性,这表明与人类对齐的个性化质量判断难以直接建模。我们收集的数据为研究模型应如何以人类认为有用的方式提取、选择和纳入用户信息提供了基础。
查看原文
查看缓存全文

缓存时间: 2026/06/18 23:59

论文页面 - 在LLM个性化中重新以人为中心

Source: https://huggingface.co/papers/2606.06614 个性化正成为LLM系统的核心承诺:聊天机器人记住你的工作、兴趣、偏好和过去的对话,以定制回复。但“个性化”并不总是有帮助——它也可能让人感到不舒服、冒犯,或只是不必要。

这引发了一个基本但令人惊讶地未充分检验的问题:谁来决定个性化是否真正有帮助——是模型,还是被个性化的人?

大多数现有基准严重依赖合成角色、模拟对话和LLM评判者。在这项工作中,我们将真实人类重新纳入循环。

我们将个性化研究为一个三阶段流水线:

🧠 属性提取 — 系统应从对话历史中推断出什么?
🎯 相关性匹配 — 哪些属性对当前请求真正重要?
✍️ 回复生成 — 个性化是否改善了用户体验?

通过550次真实用户对话和近19,000个人类判断,我们在每个阶段都发现了系统性的“人类-LLM”差距:

• 模型从真实对话中提取出有噪声且过度泛化的属性。合成数据低估了这一难度。
• LLM和人类在哪些属性应被用于一个新问题上存在分歧(κ=0.30),但各自群体内部一致性良好(κ=0.60和0.43)。
• LLM选择的属性数量是人类认为相关的2–3倍,表明存在过度个性化的倾向。
• 即使使用人类选择的相关属性,54.6%的个性化回复被人类判定为并不比通用回复更好。
• LLM评判者常常高估个性化质量,有时会奖励仅表面提及属性(而人类认为无用的)的回复。

我们还发现,轻量级训练能显著改善属性验证和相关性匹配。但回复级别的个性化仍然困难得多,很可能因为“好的个性化”本质上是因人而异的。

我们的结论很简单:合成用户和LLM评判者不足以捕捉人类偏好的复杂本质。我们强调人类数据的重要性,并呼吁在LLM个性化中重新以人为中心。

相似文章

在LLM个性化中重新聚焦人类

arXiv cs.CL

本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。

从提示到行为对齐:用于推荐评估的个性化LLM评判器

arXiv cs.AI

本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。

Review Arcade:论LLM评审的人类对齐与可游戏性

Hugging Face Daily Papers

本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。

LLM-as-Judge的几何学:为何LLM间共识并非人类对齐

arXiv cs.CL

本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。