标签
本文将Funder的人格三元框架适配到大语言模型(LLM),利用稀疏自编码器发现并验证类似特质的内部表征,并通过特征层面的干预展示可控的双向行为偏移。
本文介绍了从语言模型中提取的大五人格特质的人格向量,为涌现不对齐提供了可解释的解释。研究表明,不对齐的微调会导致模型人格沿着特定特征变化(低宜人性和尽责性,高外向性和神经质),为安全现象提供了人类可读的诊断特征。
本文提出一个扩展的疏散框架,将认知、情感、社交和人格机制整合到基于智能体的不确定性人类行为仿真中。该框架建模动态事件意识、记忆、恐惧以及基于OCEAN的人格,展示了其对疏散效率和真实人群现象的影响。
本文介绍了一种机制可解释性方法,通过使用稀疏自编码器识别并干预潜在特征来调控LLM人格特质,在保持语言性能的同时实现了可控的人格调制。
作者介绍了这两篇论文,探讨了基于LLM的实体中带有时间戳日志的连续性与涌现人格,以及记忆如何减少令牌消耗和开发人员时间。
一个根据15个模型的研究,将用户与最符合其个性和价值观的LLM匹配的测试。
本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。
OpenAI 展示新版语音模型在个性化和自然度上的突破,能够进行自然的头脑风暴式对话,表现出共情和适时插话能力,接近人类对话节奏。