AI模型继承人类偏见——近期医疗研究显示清晰模式。您注意到了什么?

Reddit r/ArtificialInteligence 新闻

摘要

本文讨论了近期医疗研究,揭示AI模型继承人类偏见的现象,并列举了Zack等人(2024年)和Omar等人(2025年)的具体研究案例。文章邀请读者分享在ChatGPT和Claude等模型中遇到AI偏见的经历。

我从一个简单的前提出发:人类并非公正无私。远非如此。我们携带文化、政治、性别、阶级和代际偏见,并将其带入所做的一切。AI模型是基于人类创建的数据进行训练,并与人类偏好保持一致。因此,‘AI是客观的,因为它是机器’这种想法对我来说似乎是一个相当危险的迷思。您怎么看?您认为模型真的可能完全公正吗?或者像我一样,您认为偏见是不可避免的,因为它源于我们?更重要的是:您在哪种模型中注意到这一点最明显,是在什么主题或情境中?(ChatGPT、Claude、Gemini、Grok、Llama、DeepSeek……无论什么)请分享具体经历。您问了什么,它如何回复,为什么感觉它有偏见(或者为什么您惊讶于它没有偏见)? 一些近期研究说明了这一点(尤其在医疗领域): • Zack等人(Lancet Digital Health, 2024):GPT-4系统性地根据种族和性别刻板化临床案例和推荐。 • Omar等人(Nature Medicine, 2025):9个模型,超过170万个响应,涉及1000个急诊案例,跨32种社会人口变体。标记为黑人、无家可归或LGBTQIA+的案例更频繁地被导向紧急护理、侵入性操作或心理健康评估(有时高达6-7倍)。 • 同一组的2026年疼痛研究(Nature Health)和EQUITRIAGE分诊审计发现类似模式,包括胸痛中强烈的女性分诊不足(某些模型中比例为4.83:1和9.10:1)。
查看原文

相似文章

个性化 AI 的力量

OpenAI Blog

OpenAI 讨论了个性化 AI 的重要性和透明度,强调了他们发布的 Model Spec 文档,该文档解释了 ChatGPT 的行为指南和设计选择,以确保用户了解模型响应的原因。

AI幻觉可能比人类更“人性”

Reddit r/artificial

文章指出,AI幻觉其实映射了人类的认知偏差——确认偏误、过度自信等,它们并非纯粹的技术缺陷,而是像人类一样在知识缺口处“脑补”的结果。

无理解的模仿:大语言模型中决策偏差的起源

arXiv cs.CL

本文研究了像ChatGPT-4o和Qwen这样的大语言模型如何通过有缺陷的人类行为模仿来产生决策偏差,即使当人类偏好本身并无偏差时也是如此,并表明对偏差的科学描述可能成为大语言模型反应的自我实现预言。

AI 自信犯错的程度远超人们想象,不服来辩

Reddit r/ArtificialInteligence

一位用户分享了对 AI 模型的担忧:AI 在数据单薄或含糊不清时,也能以与数据充分时相同的自信呈现结论。文中举了一个例子:一条仅在 200 条评论中出现两次的投诉,被列为头号关注点。文章质疑这是否是一个可通过提示词修复的问题,还是一个需要人工核验的根本性局限。