标签
本文通过分析大型语言模型在四种英语方言上的内部概率分布,考察其隐性方言偏见,发现模型将更多负面住房相关形容词与非裔美国人英语和尼日利亚皮钦语相关联,反映了类似于人类歧视的继承偏见。
本文审计并缓解大型语言模型中的方言偏见,显示它们系统性地偏好标准美式英语而非非裔美国人英语。作者引入了激活操控,一种无需训练的方法,在保持流畅性的同时显著减少偏见,并发布了迄今为止最大的真实AAE平行语料库。
该研究发现,语言模型在并列比较标准美式英语和非裔美国人白话英语时,会表现出更强的方言偏见,即使经过安全微调也是如此。反事实公平微调可以在孤立情况下减少某些偏见,但在对比设置中并不一致。