标签
本文研究了多项选择基准上的无标签策略能否消除大型语言模型对选项顺序的敏感性,发现两阶段提示和独立假设评分均无法可靠地提高准确性。
本文提出了一种新方法,通过让 LLM 随机生成数字来测量其潜在的数字偏差,并据此修正 token 生成概率,从而缓解 LLM-as-a-Judge 中的评分偏差。在四个任务上的实验表明,该方法优于基线方法,并揭示了评分偏差在不同模型、任务和分数区间上的差异。
本文提出了HEIMAT,一种针对语言模型的启发式自动去偏框架,利用启发式提示揭示偏见,并通过微调模型来减少偏见,同时保持自然语言理解(NLU)性能。
本文介绍了一种称为“叙事锚定”的失败模式,即当相同的临床事实以不同的社会语言学语域表达时,临床语言模型会产生不同的诊断结果。作者发布了一个基于USMLE的数据集,并提出了NarrativeShield,这是一个三代理流水线,可将锚定差距降至接近零。
本文研究对齐微调如何在大语言模型中引入线索诱导偏差(如谄媚行为),发现偏差是由对齐过程而非预训练植入的,并且可以通过隐藏状态方向进行解码和引导。
本文研究了NLP中基于预处理的刻板印象缓解方法,发现虽然它们减少了针对特定群体的刻板印象,但可能无意中增加其他人口群体(包括不相关类别)的刻板印象或反刻板印象。作者跨模型系列和预处理策略展示了这些副作用,并讨论了对评估和缓解实践的影响。
介绍了奖励门控测试时自适应(RG-TTA),这是一个强化学习框架,根据输入的偏差敏感性选择性地对CLIP模型应用去偏,解决了公平性与效用之间的权衡问题。
本文对印度语言的精神病学访谈中的多语言临床ASR系统进行了系统性审计,并提出了SamaVaani,一种统一的去偏技术,旨在提升跨人口群体的性能与公平性。
一种后验方法通过截断权重更新矩阵SVD的尾部来减少微调大语言模型中的虚假相关性。该方法在不重新训练或使用群体标签的情况下,将虚假群体差距最多减少5倍,精度损失小于2个百分点。
PEARL引入了一种对比分位数近似框架,用以缓解推荐系统中的行为强度不平衡问题,在服务数十亿用户的生产级直播平台上实现了参与度指标的显著提升。
DebiasRAG 提出了一种无调优、查询特定的去偏框架,利用检索增强生成来减少大语言模型中的社会偏见,同时不降低其原有能力。
来自麻省理工学院(MIT)、伍斯特理工学院(WPI)和 Google 的研究人员提出了 WRING,这是一种用于视觉语言模型(VLM)的新型后处理去偏方法,旨在避免在消除特定偏见时放大其他偏见的“打地鼠困境”。
# 专家乘积训练减少自然语言推理中的数据集伪影 来源:[https://arxiv.org/html/2604.19069](https://arxiv.org/html/2604.19069) ###### 摘要 神经NLI模型过度拟合数据集伪影而非真正推理。仅假设模型在SNLI上达到57.7%,显示出强烈虚假关联,其中38.6%的基线错误源于这些伪影。作者提出专家乘积(PoE)训练,对偏见模型过度自信的样本降权。