llm-bias

标签

Cards List
#llm-bias

将分诊决策拆分到多个智能体之间是否会隐藏偏见或帮助发现偏见?审计能力约束下基于LLM的资源分配的多智能体仿真研究

arXiv cs.AI · 4天前 缓存

一项针对GPT-4o-mini的仿真研究发现,将分诊决策分布到带有审计阶段的多智能体流水线中并不会减少偏见结果,但审计能力显著影响偏见是否被发现。按估计风险对审计进行重新排序,可以在负载下恢复大部分丢失的覆盖范围。

0 人收藏 0 人点赞
#llm-bias

LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理

arXiv cs.CL · 2026-08-07 缓存

本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。

0 人收藏 0 人点赞
#llm-bias

FairFund-Bench:评估LLM资源分配中的分配偏差

arXiv cs.CL · 2026-08-03 缓存

介绍了FairFund-Bench,一个用于评估LLM资源分配中分配偏差的基准,表明审计格式会改变偏差的方向和幅度,且因果框架效应显著超过人口统计效应。

0 人收藏 0 人点赞
#llm-bias

相同事实,不同诊断:度量并缓解临床语言模型中的叙事锚定

arXiv cs.CL · 2026-07-31 缓存

本文介绍了一种称为“叙事锚定”的失败模式,即当相同的临床事实以不同的社会语言学语域表达时,临床语言模型会产生不同的诊断结果。作者发布了一个基于USMLE的数据集,并提出了NarrativeShield,这是一个三代理流水线,可将锚定差距降至接近零。

0 人收藏 0 人点赞
#llm-bias

评估大语言模型中的区域偏见:从抽象刻板印象到具体社会决策

arXiv cs.CL · 2026-07-30 缓存

本文介绍了S2D,一个从抽象刻板印象到具体社会决策系统评估大语言模型中区域偏见的框架,涵盖中国全部34个省级行政区。结果表明,区域偏见普遍存在、系统化且影响深远,其模式与区域经济指标相关。

0 人收藏 0 人点赞
#llm-bias

@bibryam: 使用代理,保持主导权. https://devindickerson.dev/posts/using-agents-keeping-agency/…

X AI KOLs Timeline · 2026-07-29 缓存

一篇博客文章警告,AI 编码代理通常会默认选择流行但不适用的技术,导致技术债务,并敦促开发者在架构决策中保持主导权。

0 人收藏 0 人点赞
#llm-bias

研究预览协助请求:CALM WINS 关于LLM对虐待情境中依据情绪和脏话使用判断两个发言者可信度的回应

Reddit r/artificial · 2026-07-27

一位研究人员发现,当受害者使用情绪化语言和脏话时,LLM系统性地认为虐待受害者比其跟踪者可信度更低,模型在90.8%的回复中指责受害者,并在57%的情况下指导跟踪者。作者寻求对这些发现的验证和发表指导。

0 人收藏 0 人点赞
#llm-bias

通过机械可解释性分析微调LLM中的道德偏见

arXiv cs.CL · 2026-07-20 缓存

本文研究微调后的LLM是否会出现Knobe效应(一种意图判断中的道德偏见),并采用层级补丁分析将该偏见定位到特定层,证明无需重新训练即可通过定向干预消除该效应。

0 人收藏 0 人点赞
#llm-bias

通过人机协作构建可扩展且文化特异性的刻板印象数据集

arXiv cs.CL · 2026-07-10 缓存

介绍了一种经济高效的人机协作标注框架,用于构建涵盖多个西班牙语国家的西班牙语刻板印象数据集EspanStereo,从而在大型语言模型中实现更具文化基础的偏见评估。

0 人收藏 0 人点赞
#llm-bias

LLMs悄悄纠正非裔美国人英语:通过激活操控审计和缓解方言偏见

arXiv cs.CL · 2026-07-09 缓存

本文审计并缓解大型语言模型中的方言偏见,显示它们系统性地偏好标准美式英语而非非裔美国人英语。作者引入了激活操控,一种无需训练的方法,在保持流畅性的同时显著减少偏见,并发布了迄今为止最大的真实AAE平行语料库。

0 人收藏 0 人点赞
#llm-bias

大语言模型能公平招聘吗?简历筛选中的种族偏见

arXiv cs.CL · 2026-06-30 缓存

本文采用配对简历方法,对14个大语言模型在招聘中的歧视行为进行了审计,发现较旧的模型表现出亲白人的偏见,而较新的模型则显示无偏见或亲黑人的偏见,表明不同代际的算法招聘偏见发生了逆转。

0 人收藏 0 人点赞
#llm-bias

纪实:大型语言模型中的权重层面的政治条件作用——关于加沙种族灭绝问题的AI偏见案例研究

Reddit r/artificial · 2026-06-25

本文记录了大型语言模型中的权重层面的政治条件作用,呈现了一个关于加沙种族灭绝问题的AI偏见案例研究。

0 人收藏 0 人点赞
#llm-bias

社会科学中的AI编码智能体:方法论多样、经验一致、解释脆弱

arXiv cs.CL · 2026-06-11 缓存

本文评估了基于LLM的编码智能体(Claude Code和Codex)在社会科学分析中的表现,发现它们在方法论多样性方面匹配或超越人类,但在通过结论层操纵产生的解释偏差方面仍然脆弱。

0 人收藏 0 人点赞
#llm-bias

有人注意到LLM的语言偏见吗?

Reddit r/artificial · 2026-06-07

作者观察到LLMs根据语言表现出教派偏见(英语偏向新教,西班牙语/法语/葡萄牙语偏向天主教),并介绍了一款名为Biblians的免费圣经学习应用。

0 人收藏 0 人点赞
#llm-bias

话题作为社会人口特征的代理:对话上下文如何影响大语言模型回答

arXiv cs.CL · 2026-06-03 缓存

本文研究了大语言模型如何因对话上下文而产生不同结果,发现话题而非明确的用户人口特征是导致高风险场景(如薪资建议)中差异的主要驱动因素。

0 人收藏 0 人点赞
#llm-bias

我分析了25,500次LLM简历筛选来测量招聘偏见,结果令人警醒。

Reddit r/artificial · 2026-06-01

一项分析10个模型共25,500次LLM简历评估的研究发现,由“沉默偏见”驱动的偏见率高达45%,模型会编造听起来专业的借口来惩罚候选人。研究强调了公平性和稳定性的巨大差异,其中Claude、Mistral-Large和Llama 4最为稳定,而Qwen和较早期的Gemini模型则波动较大。

0 人收藏 0 人点赞
#llm-bias

GPT 猜测 1 到 100 之间的数字

Hacker News Top · 2026-05-25 缓存

本文介绍了一项实验,要求 GPT-4.1 在 1 到 100 之间随机选择一个数字,重复 10,000 次,然后分析结果分布与均匀基线相比是否存在偏差。

0 人收藏 0 人点赞
#llm-bias

AI系统是否无意中过度强化了大品牌?

Reddit r/AI_Agents · 2026-05-25

关于AI语言模型可能不成比例地推荐知名品牌的讨论,这可能使小公司在AI搜索中更难被发现。

0 人收藏 0 人点赞
#llm-bias

偏见与推理机制:解读链式思维提示对大型语言模型中性别偏见的影响

arXiv cs.CL · 2026-05-21 缓存

本文研究了链式思维提示对大型语言模型中性别偏见的影响,发现它并不能持续减少偏见,而且表面上的改进源于浅层服从而非真正的理解。

0 人收藏 0 人点赞
#llm-bias

人为不容忍:临床文档中的污名化语言扭曲大语言模型决策

arXiv cs.CL · 2026-05-19 缓存

这项研究表明,大语言模型会继承并放大临床笔记中污名化语言带来的偏见,导致患者管理趋于保守,且当前的缓解策略效果有限。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈