标签
本文研究了在助人性和编程数据上进行后训练(SFT 和 RL)如何降低 Llama 3.1 8B 模型中经过中训练(以同理心为导向的数据)的同理心价值观。研究发现,与编程训练相比,助人性训练显著降低了动物同理心和一般道德推理能力,尽管推理效果不会跨语言迁移。