标签
本文提出了公平性剪枝(Fairness Pruning),一种结构干预方法,通过识别差异激活的神经元来定位大型语言模型中GLU-MLP层的群体偏见。将极少数神经元置零会扰乱偏见处理,同时保留推理和通用知识,这表明偏见与能力依赖于可分离的电路。