Deep Persona: 一个基于心理学的角色扮演代理和模拟架构及评估框架

Hugging Face Daily Papers 论文

摘要

本文介绍了Deep Persona,一个基于心理学的角色扮演代理架构,并提出了一个评估框架。对LLMs进行评估后发现,尽管语用流畅度高,但在情感表达方面存在系统性限制。

目前,使用大型语言模型(LLMs)进行角色模拟的方法大多依赖于浅层的角色描述,这些描述无法在长时间交互中维持角色行为的一致性。我们引入Deep Persona,一个基于心理学的三层架构,将角色组织为可观测表达、潜在信念和核心动机驱动的层级结构,用于构建高度逼真的角色扮演代理。该架构受脚本决定论和有限能动性原则的约束,将模型限制为一个由结构化内部脚本引导的反应引擎。我们进一步提出一个无需参考的评估框架,该框架利用现有的心理学临床工具和对抗性压力测试,将对话自然度与经验性的人类分布进行基准比较。实证评估显示,尽管LLMs达到了高度的语用流畅性,但在情感表达和共同注意方面表现出系统性限制。此外,我们展示了两个Deep Persona的案例研究,并使用所提出的框架进行评估,证明结构化角色可以产生更接近人类对话行为的交互。
查看原文
查看缓存全文

缓存时间: 2026/09/22 07:25

论文页面 - 深度角色:基于心理学的角色扮演智能体与模拟系统架构及评估框架

来源:https://huggingface.co/papers/2609.22255

摘要

现有关于大型语言模型角色模拟的方法大多依赖于浅层的人物描述,这些描述无法在长期交互中维持连贯的角色行为。我们提出“深度角色“这一基于心理学原理的三层架构,该架构将角色分层为可观察的表象表达、潜在信念与核心动机驱动,用于构建高度逼真的角色扮演智能体。该架构遵循脚本决定论与有限自主性原则,将模型限制为受结构化内部脚本引导的响应引擎。我们进一步提出了一种无需参考标准的评估框架,该框架运用已建立的心理临床量具和对抗性压力测试,基于经验性人类分布来评估对话自然度。实证评估显示,虽然大型语言模型在语用流畅性方面表现优异,但在情感表达与联合注意力方面仍存在系统性局限。此外,我们展示了两个深度角色的案例研究,并使用所提框架进行评估,证明结构化角色设计能够生成更接近人类对话行为的交互。

查看 arXiv 页面 (https://arxiv.org/abs/2609.22255)查看 PDF (https://arxiv.org/pdf/2609.22255)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.22255)

在智能体中获取此论文:

hf papers read 2609.22255

未安装最新版 CLI?请执行:curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2609.22255 即可从本页面建立链接。

引用此论文的数据集 0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.22255 即可从本页面建立链接。

引用此论文的交互空间 0

暂无交互空间链接此论文

在交互空间 README.md 中引用 arxiv.org/abs/2609.22255 即可从本页面建立链接。

包含此论文的收藏集 0

暂无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页面建立链接。

相似文章

超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色

arXiv cs.AI

提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。

使用多智能体评估对角色扮演语言智能体进行对抗性压力测试

arXiv cs.AI

本文提出了一个模块化的多智能体平台,用于对角色扮演语言智能体进行对抗性压力测试,通过策略驱动的审讯智能体和自动化评判智能体,揭示多轮对话中累积的行为失败。跨三个人设和三类LLM家族的实验表明,多策略对抗评估将鲁棒性得分降低0.17-0.20,并识别出常见的失败模式,且与人类评判高度一致。