标签
本文批判了Beckmann-Butlin的大语言模型个体化框架,认为人格向量具有体制依赖性而非基底同一性,并通过在Qwen3和Mistral模型上的实证实验展示了跨体制的不对称性。本文提出将(载体,体制)配对作为表征内容的基本单位。
本文探讨了现成的角色引导向量是否能减少大型语言模型中的谄媚行为,发现它们能达到针对性对比激活添加(CAA)效果的68-98%,且无需谄媚行为特定的训练数据,并认为谄媚行为更适合被理解为一种角色层面的属性。