标签
一项针对GPT-4o-mini的仿真研究发现,将分诊决策分布到带有审计阶段的多智能体流水线中并不会减少偏见结果,但审计能力显著影响偏见是否被发现。按估计风险对审计进行重新排序,可以在负载下恢复大部分丢失的覆盖范围。
本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。
介绍了FairFund-Bench,一个用于评估LLM资源分配中分配偏差的基准,表明审计格式会改变偏差的方向和幅度,且因果框架效应显著超过人口统计效应。
本文介绍了一种称为“叙事锚定”的失败模式,即当相同的临床事实以不同的社会语言学语域表达时,临床语言模型会产生不同的诊断结果。作者发布了一个基于USMLE的数据集,并提出了NarrativeShield,这是一个三代理流水线,可将锚定差距降至接近零。
本文介绍了S2D,一个从抽象刻板印象到具体社会决策系统评估大语言模型中区域偏见的框架,涵盖中国全部34个省级行政区。结果表明,区域偏见普遍存在、系统化且影响深远,其模式与区域经济指标相关。
一篇博客文章警告,AI 编码代理通常会默认选择流行但不适用的技术,导致技术债务,并敦促开发者在架构决策中保持主导权。
一位研究人员发现,当受害者使用情绪化语言和脏话时,LLM系统性地认为虐待受害者比其跟踪者可信度更低,模型在90.8%的回复中指责受害者,并在57%的情况下指导跟踪者。作者寻求对这些发现的验证和发表指导。
本文研究微调后的LLM是否会出现Knobe效应(一种意图判断中的道德偏见),并采用层级补丁分析将该偏见定位到特定层,证明无需重新训练即可通过定向干预消除该效应。
介绍了一种经济高效的人机协作标注框架,用于构建涵盖多个西班牙语国家的西班牙语刻板印象数据集EspanStereo,从而在大型语言模型中实现更具文化基础的偏见评估。
本文审计并缓解大型语言模型中的方言偏见,显示它们系统性地偏好标准美式英语而非非裔美国人英语。作者引入了激活操控,一种无需训练的方法,在保持流畅性的同时显著减少偏见,并发布了迄今为止最大的真实AAE平行语料库。
本文采用配对简历方法,对14个大语言模型在招聘中的歧视行为进行了审计,发现较旧的模型表现出亲白人的偏见,而较新的模型则显示无偏见或亲黑人的偏见,表明不同代际的算法招聘偏见发生了逆转。
本文记录了大型语言模型中的权重层面的政治条件作用,呈现了一个关于加沙种族灭绝问题的AI偏见案例研究。
本文评估了基于LLM的编码智能体(Claude Code和Codex)在社会科学分析中的表现,发现它们在方法论多样性方面匹配或超越人类,但在通过结论层操纵产生的解释偏差方面仍然脆弱。
作者观察到LLMs根据语言表现出教派偏见(英语偏向新教,西班牙语/法语/葡萄牙语偏向天主教),并介绍了一款名为Biblians的免费圣经学习应用。
本文研究了大语言模型如何因对话上下文而产生不同结果,发现话题而非明确的用户人口特征是导致高风险场景(如薪资建议)中差异的主要驱动因素。
一项分析10个模型共25,500次LLM简历评估的研究发现,由“沉默偏见”驱动的偏见率高达45%,模型会编造听起来专业的借口来惩罚候选人。研究强调了公平性和稳定性的巨大差异,其中Claude、Mistral-Large和Llama 4最为稳定,而Qwen和较早期的Gemini模型则波动较大。
本文介绍了一项实验,要求 GPT-4.1 在 1 到 100 之间随机选择一个数字,重复 10,000 次,然后分析结果分布与均匀基线相比是否存在偏差。
本文研究了链式思维提示对大型语言模型中性别偏见的影响,发现它并不能持续减少偏见,而且表面上的改进源于浅层服从而非真正的理解。
这项研究表明,大语言模型会继承并放大临床笔记中污名化语言带来的偏见,导致患者管理趋于保守,且当前的缓解策略效果有限。