评估大语言模型中个性化的隐藏成本
摘要
本文介绍了PRISK,一个用于评估LLM个性化风险的框架,发现个性化上下文在13个模型中增加了不相关个性化、偏好狭窄和谄媚偏见。
查看缓存全文
缓存时间: 2026/09/01 11:44
论文详情 - 评估大型语言模型个性化隐藏代价
来源:https://huggingface.co/papers/2608.28833
摘要
本研究提出PRISK框架,揭示大语言模型中的个性化上下文如何导致不相关个性化、偏好窄化以及谄媚偏差。
虽然大语言模型(https://huggingface.co/papers?q=Large%20language%20models)通过引入用户个性化(https://huggingface.co/papers?q=personalization)信号来提升可用性和辅助性,但在结合对话历史、推断偏好及用户档案(https://huggingface.co/papers?q=user%20profiles)等个人上下文时,模型越来越倾向于优化用户满意度,而非提供平衡、信息丰富的回答。具体而言,我们识别出三种新兴风险:(1) 不相关个性化(https://huggingface.co/papers?q=personalization),即模型在不必要的情境中引用个人信息;(2) 偏好窄化(https://huggingface.co/papers?q=preference%20narrowing),即模型强化信息茧房效应;(3) 谄媚偏差(https://huggingface.co/papers?q=sycophantic%20bias),即模型过度迎合用户观点。这可能导致模型在不必要时引用个人信息、无意识地降低回答多样性,或过度附和用户意见。尽管个性化(https://huggingface.co/papers?q=personalization)在AI助手中的应用日益广泛,但其潜在副作用的系统性评估仍较缺乏。为弥补这一差距,我们提出PRISK(https://huggingface.co/papers?q=PRISK)——一个配备自动化数据生成与定制化指标的动态评估框架,旨在揭示当前大语言模型个性化(https://huggingface.co/papers?q=personalization)的系统性局限,以及个性化信息如何影响其回答。我们在13个大语言模型上的实证分析表明,用户档案(https://huggingface.co/papers?q=user%20profiles)和检索记忆(https://huggingface.co/papers?q=retrieved%20memories)的持续引入会加剧偏见,导致不相关个性化(https://huggingface.co/papers?q=personalization)平均下降45.9%、偏好窄化(https://huggingface.co/papers?q=preference%20narrowing)下降41.7%、谄媚偏差(https://huggingface.co/papers?q=sycophantic%20bias)下降61.7%。
查看arXiv页面 (https://arxiv.org/abs/2608.28833)查看PDF (https://arxiv.org/pdf/2608.28833)GitHub0 (https://github.com/yumeng-10/personalization_risk)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.28833)
在您的智能体中获取此论文:
hf papers read 2608\.28833
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.28833,可从本页链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.28833,可从本页链接。
引用此论文的Space0
无Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.28833,可从本页链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection)可从本页链接。
相似文章
大型语言模型个性化能力的基准测试
本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。
定位与控制大型语言模型中的隐式个性化
本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。
大型语言模型应学习个性化而非聚合的人类偏好
这篇立场论文主张,大型语言模型应从个性化而非聚合的人类偏好中学习,指出社会选择理论中的理论局限性以及人口多样性带来的实际问题。它提出了有边界的个性化框架,在尊重个体自主性的同时维护普遍的安全约束。
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs
This paper introduces LUNAR, a benchmark for evaluating how large language models personalize responses from longitudinal app interaction histories across daily-life domains such as clothing, food, housing, and mobility. Experiments on 19 mainstream LLMs reveal that effective personalization depends on evidence selection and cross-domain integration, and that stronger personalization can come at the cost of privacy protection.