AI人格会成长吗?分析与基准测试LLM智能体在生活事件后的人格演变

Hugging Face Daily Papers 论文

摘要

本文研究LLM智能体在经历重大生活事件后人格如何演变,使用大五人格特质,并引入名为BFI-Adapt的基准,以评估14个模型中事件诱发人格变化的方向保真度。

人格条件化LLM智能体(PC-Agents)越来越多地用于情感支持、社会模拟和角色扮演,这推动了终身智能体的发展,使其能够在长时间交互中保持连贯性。这种连贯性的一个关键组成部分是人格演变:智能体在不同情境中经历生活事件时,应发生合理且基于心理学理论的变化。尽管先前的研究表明,LLM的人格会在情境扰动下发生偏移,但这些偏移在不同特质、事件、人设和模型之间的差异仍鲜为人知。我们以11个重大生活事件为研究对象,以大五人格特质作为心理测量锚点,并对照人类人格心理学中的纵向证据来解读由此产生的演变轨迹。在四个诊断轴上,PC-Agents在具有和缺乏已证实人类变化方向的事件-特质对中,表现出可测量的特质偏移,且发生率相似。即使偏移方向符合预期,其幅度通常也低于人类效应量范围。性别和文化区域提示几乎没有调节作用,而人设层面的离散度相比人类样本被压缩了三到四倍。为了进行系统性比较,我们引入了BFI-Adapt,一个可复用的基准,用于评分事件诱发人格变化的方向保真度,并使用它对14个模型进行排名。验证套件表明,测量到的偏移超过了无事件重测噪声,在独立改写的提示下保持稳定,与基于情境的行为选择仅有有限且依赖模型的趋同,并在不相关的穿插对话后仍然持续存在。总之,这些检验确立了所测量轨迹是稳健的事件条件化反应模式。我们的结果表明,当前PC-Agents模拟了人类人格动态的均值,但未模拟其形态。
查看原文
查看缓存全文

缓存时间: 2026/08/10 06:13

论文页面 - AI 角色会成长吗?分析并基准测试 LLM 智能体在生活事件后的人格演化

来源:https://huggingface.co/papers/2608.06485

摘要

人格条件化的 LLM 智能体(PC-Agents)越来越多地用于情感支持、社交模拟和角色扮演,这推动了能够在长期交互中保持一致性的终身智能体的发展。这种一致性的一个关键组成部分是人格演化:智能体在经历不同情境中的生活事件时,应产生合理且有心理学依据的变化。尽管先前研究表明 LLM 人格会在情境扰动下发生偏移,但人们对这些偏移如何随特质、事件、角色和模型的不同而变化仍知之甚少。我们以大五人格特质作为心理测量锚点,研究了 11 个重大生活事件后由事件诱发的人格变化,并结合人类人格心理学中的纵向证据来解读由此产生的变化轨迹。在四个诊断维度上,PC-Agents 在有无文献记载的人类变化方向的事件-特质对上都表现出可测量的特质变化,且变化速率相似。即使变化方向符合预期,其幅度通常也低于人类效应量范围。性别和文化区域提示几乎没有调节效应,而角色层面的离散度相对于人类样本被压缩了三到四倍。为了进行系统性比较,我们引入了 BFI-Adapt,这是一个可复用的基准,用于评估事件诱发人格变化的方向保真度,并使用它对 14 个模型进行排名。验证套件表明,测量到的变化超过了无事件重测噪声,在独立改写的提示下保持稳定,与基于场景的行为选择仅表现出有限且依赖模型的趋同性,并且在穿插的无关对话后仍然存在。这些检验共同确立了所测得轨迹是稳健的事件条件化响应模式。我们的结果表明,当前的 PC-Agents 模拟了人类人格动力学中的均值,但并未模拟其形态。

查看 arXiv 页面 查看 PDF GitHub0 添加到合集

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.06485,即可从此页面链接到该模型。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.06485,即可从此页面链接到该数据集。

引用此论文的 Space0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2608.06485,即可从此页面链接到该 Space。

包含此论文的合集0

没有合集包含此论文

将此论文添加到合集(https://huggingface.co/new-collection),即可从此页面链接到该合集。

相似文章

超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色

arXiv cs.AI

提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。

大型语言模型捕捉人类性格的效果如何?

arXiv cs.AI

本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。