标签
研究发现,欧洲超过100名政客,大多为女性,成为性露骨深度伪造网站的目标,凸显了在线性别歧视的规模及其对民主的影响。
本文使用BBQ和OpinionQA基准测试,评估回答格式的变化如何影响大型语言模型中性别偏见的测量,发现结果有显著变化,这突显了模型评估中多格式设计的必要性。
本文提出了一种混合流水线,将基于微调LLaMA的性别分类与标签感知的神经机器翻译相结合,以缓解英语到罗马尼亚语机器翻译中的性别偏见,引入了新数据集,并在基准测试上将性别准确率提高了40多个百分点。
本文介绍了Symphony-Bias,一个用于评估大语言模型在文本、视觉和音频模态下乐器与性别关联偏见的多模态数据集。研究发现,92%的乐器层面结果与先前社会科学研究一致,其中文本模态的性别偏见最强,音频最弱。
本文介绍了GAND,这是一个用于分析机器翻译中性别偏见的性别模糊自然英语句子的基准测试资源,并利用对比翻译进行可解释性分析,以揭示影响性别分配的源词。
一项对6个前沿LLMs在8个偏见基准测试上的独立评估发现,大多数模型在政治上偏左,并且Grok自述的右倾立场与其左倾行为不一致。拒答率各不相同,GPT-5.4在20%的种族相关问题上拒绝回答。
本文采用配对简历方法,对14个大语言模型在招聘中的歧视行为进行了审计,发现较旧的模型表现出亲白人的偏见,而较新的模型则显示无偏见或亲黑人的偏见,表明不同代际的算法招聘偏见发生了逆转。
本文介绍了GAMA-Bench,一个包含1,298个性别镜像冲突场景的基准测试,并发现LLMs始终对男性角色采用更严厉的惩罚和指责框架,而对女性角色同样的不当行为则给予更具同理心和治疗性的回应。
本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。
本文提出了一种神经元级干预方法,识别语言模型中的性别特定神经元(女性、男性、性别中立),并在保留语义的同时引导句子生成朝向目标性别形式,实验表明该方法可实现精确控制并缓解偏见。
本文首次对多模态语音识别模型进行了偏见评估,发现在将人脸与音频配对时,跨性别和种族的准确率存在显著差异,这对AI系统的公平性具有重要意义。
提出EquiSumm,一种基于性别偏见感知的包容性推文摘要生成框架,确保不同性别群体意见的代表性,解决自动摘要中的群体公平性问题。
本文研究了链式思维提示对大型语言模型中性别偏见的影响,发现它并不能持续减少偏见,而且表面上的改进源于浅层服从而非真正的理解。
一项研究发现,为男女生成的相同AI简历获得了显著不同的评价,女性的简历更易因其能力和可信度受到质疑。这反映出人们对AI使用认知中存在的广泛性别偏见,并可能进一步加剧AI应用的差距。