标签
本文介绍了从语言模型中提取的大五人格特质的人格向量,为涌现不对齐提供了可解释的解释。研究表明,不对齐的微调会导致模型人格沿着特定特征变化(低宜人性和尽责性,高外向性和神经质),为安全现象提供了人类可读的诊断特征。
本文提出了一种多智能体人群模拟,使用LLM驱动的智能体通过视觉、听觉和触觉通道相互感知和评估,导致涌现的情感传染,无需显式手工编写的情感转移。研究展示了在五个场景中空间、时间和人格依赖的传染动态,并评估了后端依赖的评估行为。
本文介绍了一种机制可解释性方法,通过使用稀疏自编码器识别并干预潜在特征来调控LLM人格特质,在保持语言性能的同时实现了可控的人格调制。
本文研究对LLM在长篇散文上进行微调(结合关联的大五人格剖面)是否能稳定问卷回答并归纳目标剖面,发现虽然方差减小,但完整五维剖面的准确率仍接近随机水平。