标签
本文对LLM简历筛选进行了受控审计,发现即使资质证据相同,决策在呈现方式变化时也可能不稳定。
MUtE 引入了一个新颖的框架,用于文本表示中的最优概念擦除和反事实干预,以提升算法公平性,并在NLP模型中实现反事实文本生成。
FairSelect是一个工具包,用于系统评估预处理、处理中及后处理阶段的公平性缓解策略,支持交叉性子群评估以及公平性与效用权衡的比较。
本文采用配对简历方法,对14个大语言模型在招聘中的歧视行为进行了审计,发现较旧的模型表现出亲白人的偏见,而较新的模型则显示无偏见或亲黑人的偏见,表明不同代际的算法招聘偏见发生了逆转。
本博士论文批判了当前机器学习中的公平性度量方法,并提出统计假设检验和结构性分析来解决偏差问题,重点关注网络和层级上下文。
本文提出了一个用于保险定价的α公平个体偿付保费(α-FISP)框架,该框架在确保偿付能力的同时平衡精算公平和团结公平,通过约束优化得到一系列定价解。
本文通过混合方法研究,探讨了公共卫生中算法公平性的认知与实践之间的鸿沟,提出了Fairness-to-Action框架,以识别转化过程中的停滞点。研究结果强调了制度化薄弱以及系统层面重准确性轻公平性的倾向。
本文提出了“解释公平性分类法”(Explanation Fairness Taxonomy, EFT),以分析大型语言模型(LLM)在不同人口群体中证明决策时的差异,研究发现尽管决策本身保持平衡,但在解释的质量和语调上仍存在显著偏差。
本文引入了一个概率图模型框架,以因果方式审核大语言模型(LLM)的安全机制,揭示出由于忽视了语境的毒性,标准的观测指标高估了人口统计学偏差。