评估大语言模型中个性化的隐藏成本

Hugging Face Daily Papers 论文

摘要

本文介绍了PRISK,一个用于评估LLM个性化风险的框架,发现个性化上下文在13个模型中增加了不相关个性化、偏好狭窄和谄媚偏见。

虽然大语言模型 (LLMs) 融入了用户个性化信号以提升可用性和实用性,但当基于个人上下文(如对话历史、推断的偏好和用户资料)时,它们越来越从提供平衡、信息丰富的响应转向优化用户满意度。具体而言,我们识别出三个新兴风险:(1) 不相关个性化,即模型在不必要的上下文中引用个人信息;(2) 偏好狭窄,即模型强化信息回音室;(3) 谄媚偏见,即模型过度同意用户意见。因此,模型可能在不必要的情况下引用个人信息,无意中减少响应多样性,或过度同意用户意见。尽管个性化在AI助手中的使用日益增加,但对其潜在副作用的系统性评估仍然有限。为了弥合这一差距,我们提出了PRISK,一个动态评估框架,具有自动化数据生成和定制指标,旨在揭示当前LLM个性化中的系统局限性以及个性化信息如何塑造其响应。我们对13个LLMs的实证分析表明,用户资料和检索到的记忆的存在一致地加剧了偏见,导致不相关个性化平均下降45.9%,偏好狭窄下降41.7%,谄媚偏见下降61.7%。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:44

论文详情 - 评估大型语言模型个性化隐藏代价

来源:https://huggingface.co/papers/2608.28833

摘要

本研究提出PRISK框架,揭示大语言模型中的个性化上下文如何导致不相关个性化、偏好窄化以及谄媚偏差。

虽然大语言模型(https://huggingface.co/papers?q=Large%20language%20models)通过引入用户个性化(https://huggingface.co/papers?q=personalization)信号来提升可用性和辅助性,但在结合对话历史、推断偏好及用户档案(https://huggingface.co/papers?q=user%20profiles)等个人上下文时,模型越来越倾向于优化用户满意度,而非提供平衡、信息丰富的回答。具体而言,我们识别出三种新兴风险:(1) 不相关个性化(https://huggingface.co/papers?q=personalization),即模型在不必要的情境中引用个人信息;(2) 偏好窄化(https://huggingface.co/papers?q=preference%20narrowing),即模型强化信息茧房效应;(3) 谄媚偏差(https://huggingface.co/papers?q=sycophantic%20bias),即模型过度迎合用户观点。这可能导致模型在不必要时引用个人信息、无意识地降低回答多样性,或过度附和用户意见。尽管个性化(https://huggingface.co/papers?q=personalization)在AI助手中的应用日益广泛,但其潜在副作用的系统性评估仍较缺乏。为弥补这一差距,我们提出PRISK(https://huggingface.co/papers?q=PRISK)——一个配备自动化数据生成与定制化指标的动态评估框架,旨在揭示当前大语言模型个性化(https://huggingface.co/papers?q=personalization)的系统性局限,以及个性化信息如何影响其回答。我们在13个大语言模型上的实证分析表明,用户档案(https://huggingface.co/papers?q=user%20profiles)和检索记忆(https://huggingface.co/papers?q=retrieved%20memories)的持续引入会加剧偏见,导致不相关个性化(https://huggingface.co/papers?q=personalization)平均下降45.9%、偏好窄化(https://huggingface.co/papers?q=preference%20narrowing)下降41.7%、谄媚偏差(https://huggingface.co/papers?q=sycophantic%20bias)下降61.7%。

查看arXiv页面 (https://arxiv.org/abs/2608.28833)查看PDF (https://arxiv.org/pdf/2608.28833)GitHub0 (https://github.com/yumeng-10/personalization_risk)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.28833)

在您的智能体中获取此论文:

hf papers read 2608\.28833

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.28833,可从本页链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.28833,可从本页链接。

引用此论文的Space0

无Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.28833,可从本页链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection)可从本页链接。

相似文章

大型语言模型个性化能力的基准测试

arXiv cs.AI

本文介绍了SDR-Bench,一个用于在双方贝叶斯说服框架下评估大型语言模型个性化能力的基准,发现在前沿大语言模型中存在一致的瓶颈,并通过现场部署验证了该框架。

大型语言模型应学习个性化而非聚合的人类偏好

arXiv cs.LG

这篇立场论文主张,大型语言模型应从个性化而非聚合的人类偏好中学习,指出社会选择理论中的理论局限性以及人口多样性带来的实际问题。它提出了有边界的个性化框架,在尊重个体自主性的同时维护普遍的安全约束。

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs

arXiv cs.AI

This paper introduces LUNAR, a benchmark for evaluating how large language models personalize responses from longitudinal app interaction histories across daily-life domains such as clothing, food, housing, and mobility. Experiments on 19 mainstream LLMs reveal that effective personalization depends on evidence selection and cross-domain integration, and that stronger personalization can come at the cost of privacy protection.