三个人告诉我,我的LLM简历筛选研究测量了错误的东西。他们是对的。以下是数据。

Reddit r/artificial 论文

摘要

在面临方法论批评后,作者对LLM简历筛选研究进行了广泛的实验,揭示了初始偏差测量很大程度上源于噪声,并且提示设计、包装器选择等因素显著影响评分。

三个月前,我发布了一项LLM简历筛选研究,其中审计员将45%的分数差异标记为偏见。讨论中的反馈质疑了我的方法论,因此我运行了新的实验来检验三个具体反对意见。为检验u/kamilc86提出的'推理是事后编造'的说法,我在320次运行中将正面和负面的理由移回提示中。99.7%的情况下,分数按推理方向移动了3.62分,证明分数确实遵循推理。然而,极端的基线不稳定性证实了他的更广泛观点:初始45%的偏差中很大一部分只是被错误标记为偏差的随机噪声。在4800次运行中测试u/AssiduousLayabout提出的将分数置于最后的观点,发现模式排序对稳定性没有影响,且将录用与不录用的分歧从33%提高到54%。模糊的提示指令也未能减少方差。在4165次运行中测试u/hex4def6提出的安慰剂想法,揭示了无意义的编辑(如汽车颜色)对分数的影响几乎与人口统计学编辑相当(0.328 vs 0.362分)。'银色高尔夫'对分数的改变比更改我的大学或姓名更大,尽管模型从未在理由中提及汽车。最终,名字和职业空窗期显示出真实信号,但原始的不稳定性淹没了大多数人口统计学维度。包装器选择也严重影响结果:通过CLI运行Claude添加了一个隐藏的系统提示,使分数偏移了0.247,这代表了88%的人口统计学信号,意味着基准测试无法在不同包装器间通用。完整数据和代码可在安慰剂控制、推理移植、提示实验室、GitHub仓库和完整博客文章中获取。
查看原文

相似文章

我分析了25,500次LLM简历筛选来测量招聘偏见,结果令人警醒。

Reddit r/artificial

一项分析10个模型共25,500次LLM简历评估的研究发现,由“沉默偏见”驱动的偏见率高达45%,模型会编造听起来专业的借口来惩罚候选人。研究强调了公平性和稳定性的巨大差异,其中Claude、Mistral-Large和Llama 4最为稳定,而Qwen和较早期的Gemini模型则波动较大。

大语言模型能公平招聘吗?简历筛选中的种族偏见

arXiv cs.CL

本文采用配对简历方法,对14个大语言模型在招聘中的歧视行为进行了审计,发现较旧的模型表现出亲白人的偏见,而较新的模型则显示无偏见或亲黑人的偏见,表明不同代际的算法招聘偏见发生了逆转。

不要向LLM询问置信度分数

Hacker News Top

作者认为,要求LLM生成自我评估的置信度分数在科学上是无效且具有误导性的,它只是一种心理安全把戏,而不是衡量正确性的可靠方法。

评估 LLM 在受控实验中作为人类代理的可靠性

arXiv cs.CL

本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。