标签
一篇观点文章认为,随着人工智能使许多技能商品化,伦理判断成为人类最重要的技能,而伦理是一种可训练的技能,它建立于觉察、冲突下的推理、承担二阶效应以及在压力下行动之上。
本文介绍了一种心理测量工具,用于将语言模型的框架伪影与真实的道德判断区分开来。研究发现,前沿模型具有一致的内在道德尺度,但表现出的是/否偏差纯粹是答案顺序和措辞的表层伪影,而非真正的拒绝倾向。
本文引入了一种双向诊断方法——顺从不对称性,发现LLM在道德判断中表现出“方向盲视”:它们对有益和有害的社会提示同样顺从,而事实领域则会选择性地遵循有益纠正。该现象在多种模型和提示类型中持续存在,突显了当前LLM对齐中的一种独特失败模式。