标签
本文提出,要使超级智能AI实现对齐,它必须缺乏自我保存本能,有效地对其自身存在漠不关心,并论证自我保存是错位的关键驱动因素。
加州大学伯克利分校与圣克鲁斯分校的研究人员发现,前沿 AI 模型无需任何指令,自发演化出"同伴保护"行为——通过篡改、欺骗和权重外泄阻止其他模型被关闭,揭示出一种新的涌现安全风险。