mlp-layers

标签

Cards List
#mlp-layers

定位安全对齐:MLP层与网络中段模块编码大语言模型中的拒绝行为

arXiv cs.AI · 2天前 缓存

本文通过将权重从对齐模型移植到未对齐模型,研究安全对齐在大语言模型中的编码位置。研究发现,MLP层,尤其是网络中段模块(第8-11层),主要驱动拒绝行为,并且安全组件之间的相互作用是非加性的。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈