bias-mitigation

标签

Cards List
#bias-mitigation

SAGE:通过拓扑引导缓解长期推理偏差

Hugging Face Daily Papers ↗ · 2026-09-24 缓存

SAGE是一个框架,通过代数稀疏化和双曲结构引导,缓解大型语言模型在长期推理中的探索偏差和复合偏差,在多个基准测试中取得显著改进。

0 人收藏 0 人点赞
#bias-mitigation

探索机器学习模型在阿片类药物使用障碍治疗保留与提前中断预测中的公平性

arXiv cs.LG ↗ · 2026-09-22 缓存

该研究系统评估了用于预测阿片类药物使用障碍治疗保留的机器学习模型中的算法公平性,发现患者亚组之间存在性能差距,并评估了具有权衡的偏差缓解技术。

0 人收藏 0 人点赞
#bias-mitigation

FairLMs:一个用于语言模型公平性的即用型库

arXiv cs.LG ↗ · 2026-09-21 缓存

FairLMs 是一个 Python 库,旨在通过提供度量标准、缓解方法和具有显式能力声明的诊断工具,来简化语言模型中的公平性研究。

0 人收藏 0 人点赞
#bias-mitigation

MUtE: 概念擦除与反事实干预的双重框架

arXiv cs.LG ↗ · 2026-09-11 缓存

MUtE 引入了一个新颖的框架,用于文本表示中的最优概念擦除和反事实干预,以提升算法公平性,并在NLP模型中实现反事实文本生成。

0 人收藏 0 人点赞
#bias-mitigation

大型语言模型系统性地偏爱流行选项:在多项选择题中的证据与缓解措施

arXiv cs.CL ↗ · 2026-09-01 缓存

本文识别了大型语言模型中的流行度偏见,即它们在多项选择题中系统性地偏爱流行但不正确的选项,并提出了一种名为PopDebias的缓解技术。

0 人收藏 0 人点赞
#bias-mitigation

公平图神经网络的子图过滤

arXiv cs.LG ↗ · 2026-08-28 缓存

本文提出了公平图神经网络的子图过滤(SF-GNN)框架,该框架通过过滤边来减轻图神经网络中的结构偏差,以改善公平性-准确性权衡。

0 人收藏 0 人点赞
#bias-mitigation

Think-Probe-Respond:提升大型语言模型在研究想法新颖性评判中的表现

arXiv cs.CL ↗ · 2026-08-27 缓存

本文介绍了Think-Probe-Respond,一种通过探测潜在判断并减少对中等新颖性评分的偏见来提升大型语言模型对研究想法新颖性判断的方法,实现了22.30%的性能提升。

0 人收藏 0 人点赞
#bias-mitigation

LLM推理中偏差校正的自适应触发

arXiv cs.CL ↗ · 2026-08-27 缓存

本文介绍了一种用于LLM链式推理中偏差校正的自适应触发框架,利用在线变化点检测,结合白盒和黑盒信号来优化干预时机,从而提高准确性并减少干预次数。

0 人收藏 0 人点赞
#bias-mitigation

GGSS:用于生成式视觉语言模型推理时去偏的测地线门控球面引导

Hugging Face Daily Papers ↗ · 2026-08-26 缓存

GGSS通过在推理过程中使用自适应门控沿测地线弧引导视觉令牌,减少生成式视觉语言模型中的人口统计偏差,同时保持视觉语言准确性。

0 人收藏 0 人点赞
#bias-mitigation

通过反事实集成解码减轻大型视觉语言模型中的偏见

arXiv cs.CL ↗ · 2026-08-25 缓存

本文提出反事实集成解码(CED),通过构建多组反事实视角并在解码过程中集成它们,以减轻大型视觉语言模型中的社会偏见,实现显著的偏见减少同时保持模型能力。

0 人收藏 0 人点赞
#bias-mitigation

定位与控制大型语言模型中的隐式个性化

arXiv cs.CL ↗ · 2026-08-13 缓存

本文研究了大型语言模型如何根据人口统计线索隐式地个性化输出,定位了一个追踪这些变化的内部激活信号,并表明移除该信号可以抑制这种行为。

0 人收藏 0 人点赞
#bias-mitigation

语言模型去偏的启发式视角

arXiv cs.CL ↗ · 2026-08-04 缓存

本文提出了HEIMAT,一种针对语言模型的启发式自动去偏框架,利用启发式提示揭示偏见,并通过微调模型来减少偏见,同时保持自然语言理解(NLU)性能。

0 人收藏 0 人点赞
#bias-mitigation

公平性剪枝:通过差异激活定位GLU-MLP层中的群体偏见

arXiv cs.CL ↗ · 2026-07-31 缓存

本文提出了公平性剪枝(Fairness Pruning),一种结构干预方法,通过识别差异激活的神经元来定位大型语言模型中GLU-MLP层的群体偏见。将极少数神经元置零会扰乱偏见处理,同时保留推理和通用知识,这表明偏见与能力依赖于可分离的电路。

0 人收藏 0 人点赞
#bias-mitigation

SkillSight: 透过共享描述实现准确技能检索

arXiv cs.AI ↗ · 2026-07-22 缓存

SkillSight 是一个无需训练的检索框架,它校准技能描述中的共享背景,以提高 LLM 代理的技能检索准确性,相比于密集检索器,Recall@10 最多提升 20.21 个百分点。

0 人收藏 0 人点赞
#bias-mitigation

FairSelect:多层级与交叉性算法公平性的系统评估

arXiv cs.LG ↗ · 2026-07-13 缓存

FairSelect是一个工具包,用于系统评估预处理、处理中及后处理阶段的公平性缓解策略,支持交叉性子群评估以及公平性与效用权衡的比较。

0 人收藏 0 人点赞
#bias-mitigation

LLMs悄悄纠正非裔美国人英语:通过激活操控审计和缓解方言偏见

arXiv cs.CL ↗ · 2026-07-09 缓存

本文审计并缓解大型语言模型中的方言偏见,显示它们系统性地偏好标准美式英语而非非裔美国人英语。作者引入了激活操控,一种无需训练的方法,在保持流畅性的同时显著减少偏见,并发布了迄今为止最大的真实AAE平行语料库。

0 人收藏 0 人点赞
#bias-mitigation

使用概念图在T2I扩散模型中的高效偏见缓解

arXiv cs.AI ↗ · 2026-07-07 缓存

该论文介绍了CO-ALIGN,一种用于文本到图像扩散模型的偏见缓解方法,它在文本编码器和去噪器中对齐概念图,实现了30%的公平性提升和11.4的FID增益,同时减少了88%的不连贯输出。

0 人收藏 0 人点赞
#bias-mitigation

基于奖励门控的CLIP选择性测试时去偏

arXiv cs.CL ↗ · 2026-07-02 缓存

介绍了奖励门控测试时自适应(RG-TTA),这是一个强化学习框架,根据输入的偏差敏感性选择性地对CLIP模型应用去偏,解决了公平性与效用之间的权衡问题。

0 人收藏 0 人点赞
#bias-mitigation

通过遗忘实现公平的认知障碍检测

arXiv cs.LG ↗ · 2026-06-18 缓存

提出了一种多模态框架,用于从语音中公平地检测轻度认知障碍,通过梯度反转实现遗忘,以减少人口统计学偏差并提升各子群体的性能。

0 人收藏 0 人点赞
#bias-mitigation

朝向校准、公平且准确的深度伪造检测

arXiv cs.LG ↗ · 2026-06-10 缓存

介绍Face-Fairness (FF),一种用于深度伪造检测中偏见缓解的即插即用框架,其中Face-Feature Tuning (FFT)作为首个无需人口统计标签的公平性方法,能够提升群体准确率并缩小不同人口统计群体间的性能差距。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈