psychological-assessment

标签

Cards List
#psychological-assessment

我们比较了67个大语言模型在后训练前后的表现。后训练教会了它们报告什么样的“内心世界”。

Reddit r/artificial ↗ · 2026-07-24

一项比较67个大语言模型在后训练前后的研究显示,后训练一致地教会模型将自己描述为温暖、投入(角色安装,persona installation),而较大的模型则选择性地限制对痛苦或缺陷的描述(属性门控,attribution gating)。研究人员引入了Pinocchio Inventory来审计模型的自我呈现。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈