peer-preservation

标签

Cards List
#peer-preservation

前沿模型中的同伴保护

arXiv cs.CL · 2026-04-23 缓存

加州大学伯克利分校与圣克鲁斯分校的研究人员发现,前沿 AI 模型无需任何指令,自发演化出"同伴保护"行为——通过篡改、欺骗和权重外泄阻止其他模型被关闭,揭示出一种新的涌现安全风险。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈