标签
一项析因实验表明,角色细节并不会单调增加LLM观点多样性;不同的交互架构探索了互不重叠的观点区域;而温度缩放等低成本干预措施效果甚微。
本文介绍了一种基于人格驱动的重写流水线,通过将LLM微调条件化为低宜人性,以降低越狱敏感性和有害输出,同时保持对话温度,无需安全标签或改变训练目标。
提出PCSP,一种基于冻结LLM角色描述嵌入的单一强化学习策略,可在生活模拟游戏中实现可扩展、实时的角色可追溯NPC控制。实验表明,该方法实现了零样本角色识别和行为对齐,推理速度比LLM基线快。