标签
本文提出自我识别微调作为一种干预措施,用于预防和逆转大语言模型中的涌现性对齐失调,表明它稳定了模型的对齐特征,而非采用失调的角色。
本研究引入了一个 3D 基准,用于评估视觉语言模型(VLM)智能体是否能够实现镜子自我识别,这是高阶认知能力的一种替代指标。研究发现,虽然更强的 VLM 可以利用反射证据指导行动,但较弱的模型往往无法提取与自身相关的信息或错误归因反射影像,这突显了语言顺从与基于现实的自我识别之间的区别。