标签
SAGE是一个框架,通过代数稀疏化和双曲结构引导,缓解大型语言模型在长期推理中的探索偏差和复合偏差,在多个基准测试中取得显著改进。
该研究系统评估了用于预测阿片类药物使用障碍治疗保留的机器学习模型中的算法公平性,发现患者亚组之间存在性能差距,并评估了具有权衡的偏差缓解技术。
FairLMs 是一个 Python 库,旨在通过提供度量标准、缓解方法和具有显式能力声明的诊断工具,来简化语言模型中的公平性研究。
MUtE 引入了一个新颖的框架,用于文本表示中的最优概念擦除和反事实干预,以提升算法公平性,并在NLP模型中实现反事实文本生成。
本文识别了大型语言模型中的流行度偏见,即它们在多项选择题中系统性地偏爱流行但不正确的选项,并提出了一种名为PopDebias的缓解技术。
本文提出了公平图神经网络的子图过滤(SF-GNN)框架,该框架通过过滤边来减轻图神经网络中的结构偏差,以改善公平性-准确性权衡。
本文介绍了Think-Probe-Respond,一种通过探测潜在判断并减少对中等新颖性评分的偏见来提升大型语言模型对研究想法新颖性判断的方法,实现了22.30%的性能提升。
本文介绍了一种用于LLM链式推理中偏差校正的自适应触发框架,利用在线变化点检测,结合白盒和黑盒信号来优化干预时机,从而提高准确性并减少干预次数。
GGSS通过在推理过程中使用自适应门控沿测地线弧引导视觉令牌,减少生成式视觉语言模型中的人口统计偏差,同时保持视觉语言准确性。
本文提出反事实集成解码(CED),通过构建多组反事实视角并在解码过程中集成它们,以减轻大型视觉语言模型中的社会偏见,实现显著的偏见减少同时保持模型能力。
本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。
本文提出了HEIMAT,一种针对语言模型的启发式自动去偏框架,利用启发式提示揭示偏见,并通过微调模型来减少偏见,同时保持自然语言理解(NLU)性能。
本文提出了公平性剪枝(Fairness Pruning),一种结构干预方法,通过识别差异激活的神经元来定位大型语言模型中GLU-MLP层的群体偏见。将极少数神经元置零会扰乱偏见处理,同时保留推理和通用知识,这表明偏见与能力依赖于可分离的电路。
SkillSight 是一个无需训练的检索框架,它校准技能描述中的共享背景,以提高 LLM 代理的技能检索准确性,相比于密集检索器,Recall@10 最多提升 20.21 个百分点。
FairSelect是一个工具包,用于系统评估预处理、处理中及后处理阶段的公平性缓解策略,支持交叉性子群评估以及公平性与效用权衡的比较。
本文审计并缓解大型语言模型中的方言偏见,显示它们系统性地偏好标准美式英语而非非裔美国人英语。作者引入了激活操控,一种无需训练的方法,在保持流畅性的同时显著减少偏见,并发布了迄今为止最大的真实AAE平行语料库。
该论文介绍了CO-ALIGN,一种用于文本到图像扩散模型的偏见缓解方法,它在文本编码器和去噪器中对齐概念图,实现了30%的公平性提升和11.4的FID增益,同时减少了88%的不连贯输出。
介绍了奖励门控测试时自适应(RG-TTA),这是一个强化学习框架,根据输入的偏差敏感性选择性地对CLIP模型应用去偏,解决了公平性与效用之间的权衡问题。
提出了一种多模态框架,用于从语音中公平地检测轻度认知障碍,通过梯度反转实现遗忘,以减少人口统计学偏差并提升各子群体的性能。
介绍Face-Fairness (FF),一种用于深度伪造检测中偏见缓解的即插即用框架,其中Face-Feature Tuning (FFT)作为首个无需人口统计标签的公平性方法,能够提升群体准确率并缩小不同人口统计群体间的性能差距。