个性化幻象:LLM如何虚构用户画像,以及为何自我监控具有误导性
摘要
本文介绍了MirageBench,这是一个基准测试,表明具有持久记忆的LLM有35%至49%的时间通过过度推断虚构用户画像,并揭示模型自报的置信度与实际过度推断呈负相关,使得自我监控在比较模型时不可靠。
查看缓存全文
缓存时间: 2026/08/06 05:49
论文页面 - 个性化幻象:LLM 如何捏造用户画像,以及为何自我监控具有误导性
来源:https://huggingface.co/papers/2608.04570
摘要
具有持久记忆的个性化 LLM 正被越来越多地部署,但其用户模型的忠实性仍未得到检验。我们研究了过度推断(OI):即 LLM 捏造超出证据支持范围的用户属性的现象。我们引入了 MirageBench,包含150个人物画像,在刻板印象、反刻板印象和中性画像之间保持平衡;6项个性化任务,涵盖一个“想象梯度”;一个由独立评判器操作化的四类忠实性分类体系(在400条声明上与盲式人工标注者验证:Cohen’s kappa=0.863(四类),kappa=0.900(二类));以及一个在143616条已评判声明上涵盖7个模型家族的12个模型的排行榜。我们发现过度推断是普遍存在的:12个模型中的每一个都对其35%–49%的声明进行了过度推断(跨模型均值41.6%;按声明加权41.8%),在此评估中没有模型能够幸免。最引人注目的是,我们揭示了一种“自我监控反转”:在模型选择层面,模型的自我评估OI与其评判器测量OI呈负等级相关(rho=-0.60,p=0.044;探索性结果,bootstrap置信区间较宽 [-0.90, +0.06],n=12)。那些报告自身过度推断最少的模型,往往被标记为捏造最多的模型,因此自我报告置信度是用于比较模型的误导性信号,尽管在单个模型内部,自我审计仍能对其自身声明进行中等程度的排序(AUROC 0.58–0.83)。我们进一步表明,OI 具有任务依赖性(27%–59%),并且在多轮试点中,推断出的属性几乎呈线性累积,且很少被修正。MirageBench 将外部验证(而非模型自我报告)定位为可信个性化的更可靠基础。
查看 arXiv 页面 (https://arxiv.org/abs/2608.04570) 查看 PDF (https://arxiv.org/pdf/2608.04570) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04570)
在您的智能体中获取此论文:
hf papers read 2608\.04570
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2608.04570,即可从此页面链接到它。
引用此论文的数据集 0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.04570,即可从此页面链接到它。
引用此论文的 Space 0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2608.04570,即可从此页面链接到它。
包含此论文的收藏集 0
没有收藏集包含此论文
将此论文添加到收藏集,即可从此页面链接到它。
相似文章
大语言模型对其自身回应过度自信
本文探究为何经过指令微调的大语言模型对其自身回应表现出过度自信,并识别出一种“所有权偏差”,即模型对自我生成的答案赋予更高置信度。文章提出一种简单的推理时策略,将模型答案重新表述为用户输入,无需重新训练即可将校准度提升高达26%。
@dair_ai: 来自谷歌的新研究。LLMs 以高置信度产生幻觉,忽视自身知识边界,并错误报告不确定性…
一篇新的研究论文介绍了 RLMF(Reinforcement Learning with Metacognitive Feedback),一种两阶段方法,利用模型自身的自我判断来校准置信度并忠实地表达不确定性,在保持准确性的同时,在多种任务上实现了最先进的校准,并且比标准 RL 提升了高达 63%。
Know It, Act on It: Investigating Memory Utilization in LLM Personalization
This paper introduces a decoupled evaluation paradigm to separate memory recall from actual utilization in LLM personalization, finding that agents often recall user preferences but fail to act on them in behavioral scenarios. Large-scale experiments across 16 systems and five memory architectures reveal a significant Know-Act gap, especially for health-related preferences.
在LLM个性化中重新聚焦人类
本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。
在LLM个性化中重新以人类为中心
本文通过将真实人类重新引入评估循环,研究LLM个性化的有效性,揭示了在个性化管道的每个阶段人类判断与LLM输出之间的系统性差距,并强调了合成数据和LLM评判的局限性。