个性化幻象:LLM如何虚构用户画像,以及为何自我监控具有误导性

Hugging Face Daily Papers 论文

摘要

本文介绍了MirageBench,这是一个基准测试,表明具有持久记忆的LLM有35%至49%的时间通过过度推断虚构用户画像,并揭示模型自报的置信度与实际过度推断呈负相关,使得自我监控在比较模型时不可靠。

具有持久记忆的个性化LLM正被日益广泛地部署,但其用户模型的忠实性仍未得到审视。我们研究了过度推断(OI):即LLM在证据支持之外虚构用户属性的现象。我们引入了MirageBench,包含150个在刻板印象、反刻板印象和中性画像之间平衡的用户画像,6项跨越``想象力梯度''的个性化任务,一个由独立评判器操作化的四类忠实性分类体系(在400条论断上针对盲态人工标注者进行了验证:Cohen's kappa = 0.863(四类),kappa = 0.900(二分类)),以及一个涵盖7个模型家族共12个模型、基于143616条已评判论断的排行榜。我们发现过度推断普遍存在:12个模型中的每一个都在其35%--49%的论断上过度推断(跨模型均值41.6%;按论断加权41.8%),本评估中没有任何模型能够幸免。最引人注目的是,我们揭示了自我监控反转:在模型选择层面,模型的自我评估OI与其评判器测量的OI呈负秩相关(rho = -0.60,p = 0.044;探索性,宽自助法置信区间[-0.90, +0.06],n = 12)。报告过度推断最少的模型往往被标记为虚构最多的模型,因此自我报告的置信度在比较模型时是一个误导性信号,尽管在单个模型内部,自我审计仍能较好地对其自身论断进行排序(AUROC 0.58--0.83)。我们进一步表明,OI是任务相关的(27%--59%),并且在一个多轮试点中,推断出的属性近似线性地累积,几乎不被修正。MirageBench将外部验证而非模型自我报告定位为可信个性化的更可靠基础。
查看原文
查看缓存全文

缓存时间: 2026/08/06 05:49

论文页面 - 个性化幻象:LLM 如何捏造用户画像,以及为何自我监控具有误导性

来源:https://huggingface.co/papers/2608.04570

摘要

具有持久记忆的个性化 LLM 正被越来越多地部署,但其用户模型的忠实性仍未得到检验。我们研究了过度推断(OI):即 LLM 捏造超出证据支持范围的用户属性的现象。我们引入了 MirageBench,包含150个人物画像,在刻板印象、反刻板印象和中性画像之间保持平衡;6项个性化任务,涵盖一个“想象梯度”;一个由独立评判器操作化的四类忠实性分类体系(在400条声明上与盲式人工标注者验证:Cohen’s kappa=0.863(四类),kappa=0.900(二类));以及一个在143616条已评判声明上涵盖7个模型家族的12个模型的排行榜。我们发现过度推断是普遍存在的:12个模型中的每一个都对其35%–49%的声明进行了过度推断(跨模型均值41.6%;按声明加权41.8%),在此评估中没有模型能够幸免。最引人注目的是,我们揭示了一种“自我监控反转”:在模型选择层面,模型的自我评估OI与其评判器测量OI呈负等级相关(rho=-0.60,p=0.044;探索性结果,bootstrap置信区间较宽 [-0.90, +0.06],n=12)。那些报告自身过度推断最少的模型,往往被标记为捏造最多的模型,因此自我报告置信度是用于比较模型的误导性信号,尽管在单个模型内部,自我审计仍能对其自身声明进行中等程度的排序(AUROC 0.58–0.83)。我们进一步表明,OI 具有任务依赖性(27%–59%),并且在多轮试点中,推断出的属性几乎呈线性累积,且很少被修正。MirageBench 将外部验证(而非模型自我报告)定位为可信个性化的更可靠基础。

查看 arXiv 页面 (https://arxiv.org/abs/2608.04570) 查看 PDF (https://arxiv.org/pdf/2608.04570) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.04570)

在您的智能体中获取此论文:

hf papers read 2608\.04570

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2608.04570,即可从此页面链接到它。

引用此论文的数据集 0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.04570,即可从此页面链接到它。

引用此论文的 Space 0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2608.04570,即可从此页面链接到它。

包含此论文的收藏集 0

没有收藏集包含此论文

将此论文添加到收藏集,即可从此页面链接到它。

相似文章

大语言模型对其自身回应过度自信

Hugging Face Daily Papers

本文探究为何经过指令微调的大语言模型对其自身回应表现出过度自信,并识别出一种“所有权偏差”,即模型对自我生成的答案赋予更高置信度。文章提出一种简单的推理时策略,将模型答案重新表述为用户输入,无需重新训练即可将校准度提升高达26%。

Know It, Act on It: Investigating Memory Utilization in LLM Personalization

arXiv cs.CL

This paper introduces a decoupled evaluation paradigm to separate memory recall from actual utilization in LLM personalization, finding that agents often recall user preferences but fail to act on them in behavioral scenarios. Large-scale experiments across 16 systems and five memory architectures reveal a significant Know-Act gap, especially for health-related preferences.

在LLM个性化中重新聚焦人类

arXiv cs.CL

本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。

在LLM个性化中重新以人类为中心

Hugging Face Daily Papers

本文通过将真实人类重新引入评估循环,研究LLM个性化的有效性,揭示了在个性化管道的每个阶段人类判断与LLM输出之间的系统性差距,并强调了合成数据和LLM评判的局限性。