PersonaArena:用于评估和增强大语言模型中人格层面角色扮演的动态模拟框架
摘要
PersonaArena 是一个动态模拟框架,利用大规模社交内容语料库和多智能体辩论评判机制,评估并提升大语言模型在真实社交场景中保持连贯且真实的人格层面角色扮演能力。
arXiv:2605.17044v1 公告类型:新论文
摘要:大语言模型日益成为交互式社交智能体,但它们在真实社交场景中保持连贯且真实的人格层面角色扮演能力仍然有限。现有研究主要聚焦于角色层面设定,依赖静态评估格式,未能捕捉日常社交互动的复杂性。本文提出 PersonaArena,一个用于评估和增强大语言模型中人格层面角色扮演的动态模拟框架。PersonaArena 利用经过筛选的大规模用户生成社交内容语料库构建细粒度人格库,并在模拟社交环境中引发多轮、上下文丰富的交互。该框架采用多智能体辩论评判机制,实现全面且公正的评估。通过大量实验,我们证明 PersonaArena 能够严格评估和提升大语言模型的角色扮演能力,推动开发更真实、社交能力更强的人工智能智能体。
查看缓存全文
缓存时间: 2026/05/19 06:38
# PersonaArena:用于评估和增强大语言模型中人物级角色扮演的动态模拟框架 来源:https://arxiv.org/abs/2605.17044 查看PDF (https://arxiv.org/pdf/2605.17044) > 摘要:大语言模型(LLMs)越来越多地充当交互式社交智能体,但它们在维持连贯且真实的人物级角色扮演方面的能力仍然有限,尤其是在现实社交场景中。现有研究主要聚焦于角色级设定,并依赖静态评估格式,未能捕捉日常社交互动的复杂性。在本文中,我们提出了PersonaArena,一个用于评估和改进大语言模型中人物级角色扮演的动态模拟框架。PersonaArena利用大规模、经过筛选的用户生成社交内容语料库,构建了一个细腻的人物库,并在模拟社交环境中引发多轮、上下文丰富的互动。我们的框架采用多智能体辩论评审机制,以实现全面且公正的评估。通过大量实验,我们证明PersonaArena能够对大语言模型的角色扮演能力进行严格评估和增强,推动更真实且社交能力更强的AI智能体的发展。 ## 提交历史 作者:Shi Wenlong \[查看邮箱 (https://arxiv.org/show-email/193ca9d4/2605.17044)\] **\[v1\]** 2026年5月16日星期六 15:23:28 UTC(5,612 KB)
相似文章
超越合作模拟器:为LLM代理的稳健评估生成逼真的用户角色
提出了Persona Policies(PPol),一种即插即用的控制层,利用LLM驱动的进化程序搜索来生成多样且逼真的用户角色,用于评估LLM代理。相比基线实现了33-62%的适应度提升,逼真度评分达到80.4%,并将代理鲁棒性提升了+17%的任务成功率。
超越借用历史:面向交互式角色扮演评估的个性化用户模拟
介绍了PALATE,一个可扩展的基准,用于评估角色扮演智能体,使用个性化对齐的LLM模拟用户和个性化评分标准,解决了固定历史评估的局限性。
程序问题:面向数据驱动的公民商议的行动感知LLM角色建模
一个可复现的流水线将公共Zoom录音转换为带有发言人归属的转录文本,并丰富角色画像、话题及行动标签,然后在此数据上微调LLM角色。行动感知微调显著提升了角色保真度、一致性和商议响应性,从而实现了逼真的公民商议模拟。
大型语言模型捕捉人类性格的效果如何?
本文系统评估了关于LLM角色提示的假设,并识别出'角色流形坍缩'现象,即更丰富的角色描述会降低行为多样性和模拟逼真度。研究结果发现,简单的年龄-性别角色通常比更详细的档案表现更好。
SocialPersona:基于多模态社交媒体上下文的个性化画像与对话基准
介绍了SocialPersona,一个评估多模态大语言模型从纵向社交媒体时间线中恢复显性偏好并将其用于个性化对话能力的基准。