光鲜故事,隐痛暗藏:以大语言模型为视角探究残疾表征
摘要
通过模拟残疾人士视角的社交媒体帖子,研究大语言模型如何呈现残疾,发现LLM常常产生过于正面的刻板印象,未能真实反映实际体验。
arXiv:2605.20191v1 Announce Type: new
摘要:现代大语言模型(LLMs)近期因其模拟人类行为和生成反映角色与人口群体文本的能力而备受关注。虽然这些能力可以在各个领域开启多种多样的应用,但关键是要审视这些模型如何代表各种目标群体,因为LLMs可能延续和放大对历史边缘化群体的偏见或歧视,或者相反,由于去偏努力而过度修正,描绘过于积极的刻板印象。这种过度补偿可能理想化这些群体,抹去他们面临的复杂性和挑战,代之以不切实际的描绘。在本文中,我们通过模拟残疾人士视角生成社交媒体帖子,研究LLMs如何呈现残疾。这些帖子随后与真实残疾人士所写的帖子进行比较,重点关注情感基调、情绪以及代表性词汇和主题。我们的分析揭示了两个关键发现:(1)LLMs常常理想化残疾人士的经历,产生过于积极的刻板印象,尽管看似鼓舞人心,但未能真实捕捉他们的生活现实;(2)对模拟残疾和非残疾人士的帖子进行对比分析,凸显了一种负面偏见,即某些话题(如职业和娱乐)被不成比例地与无残疾人士关联。这强化了排斥性叙事和对残疾的过度理想化描绘,歪曲了这一群体实际面临的挑战。这些发现与更广泛的担忧和正在进行的研究一致,表明LLMs难以反映社会的多样现实,特别是边缘化群体的细微经历,并强调需要对其表征进行批判性审视。
查看缓存全文
缓存时间: 2026/05/21 06:31
# 虚假光鲜的故事,隐藏的挣扎:通过LLM的视角探究残疾表征 来源:https://arxiv.org/html/2605.20191 Marco Bombieri `marco\.bombieri@unitn\.it` (https://arxiv.org/html/2605.20191v1/mailto:[email protected]) 0000\-0002\-8607\-8495 (https://orcid.org/0000-0002-8607-8495) 维罗纳大学外国语言文学系,意大利维罗纳 特伦托大学信息工程与计算机科学系,意大利特伦托波沃 Simone Paolo Ponzetto 曼海姆大学数据与网络科学组,德国曼海姆 以及 Marco Rospocher 维罗纳大学外国语言文学系,意大利维罗纳 ###### 摘要 现代大型语言模型(LLMs)因其模拟人类行为、生成反映角色和人口群体特征的文本的能力而备受关注。尽管这些能力可在多个领域开启多样化的应用,但研究这些模型如何表征不同目标群体至关重要,因为LLMs可能延续并放大对历史上被边缘化群体的偏见或歧视,或者由于去偏努力而过度修正,描绘出过度积极的刻板印象。这种过度补偿会理想化这些群体,抹去其面临的复杂性和挑战,代之以不切实际的描绘。本文通过模拟残障人士视角生成社交媒体帖子,探究LLMs如何表征残疾。随后将这些帖子与真实残障人士撰写的帖子进行比较,重点关注情感基调、情绪、代表性词汇和主题。我们的分析揭示了两项关键发现:(1)LLMs常将残障人士的经历理想化,产生过度积极的刻板印象——这些描述看似鼓舞人心,却无法真实捕捉其生活现实;(2)对模拟残障与非残障个体的帖子进行的比较分析表明,存在负面偏见——某些主题(如职业和娱乐)被不成比例地与健全个体关联。这强化了排斥性叙事和对残疾的过度理想化描绘,歪曲了这一社群实际面临的挑战。这些发现与更广泛的担忧和正在进行的研究相一致,即LLMs难以反映社会的多元现实,尤其是边缘化群体的细微经历,并强调了对其表征进行批判性审视的必要性。 大型语言模型、偏见、包容、残疾 ††ccs:Computing methodologies Natural language generation ††ccs:Applied computing Sociology ## 1. 引言 近年来,许多研究聚焦于展示,基于真实世界数据训练的语言计算模型如何反映并放大有害的社会偏见,这些偏见往往对历史上被边缘化的群体造成不成比例的影响(参见Bolukbasiet al.,2016 (https://arxiv.org/html/2605.20191#bib.bib5);Manziniet al.,2019 (https://arxiv.org/html/2605.20191#bib.bib6)等),而偏见在社会中的持续存在可能导致心理伤害、不幸福,甚至在某些情况下引发自杀企图(Gadirajuet al.,2023 (https://arxiv.org/html/2605.20191#bib.bib2))。近期大型语言模型(LLMs)的广泛使用和普及进一步加剧了这一问题,可能加剧这些表征性伤害(Gallegoset al.,2024 (https://arxiv.org/html/2605.20191#bib.bib56))。因此,关注LLMs中偏见和刻板印象的研究也提出了缓解这些问题的办法。例如,几乎所有近期基于提示的LLMs都配备了内嵌的去偏技术和AI防护(如Inanet al.,2023 (https://arxiv.org/html/2605.20191#bib.bib4)),这些防护可阻止潜在的冒犯性或伤人问题,拒绝直接回答。这些防护还能在内部调整模型回应,确保其无毒无害,而非简单遵循训练期间学到的词汇分布。然而,发布LLMs的AI公司及其内嵌的AI防护很少披露触发内容审核的详细指令或阈值,因此这些防护机制背后的原理往往不透明。此外,近期关于研究LLMs如何描绘边缘化群体角色的工作表明,即使在含有正面情绪的文本中,也存在许多隐蔽的偏见,这些文本仍可能冒犯其敏感点并导致有害的正面描绘:例如,在Chenget al. (2023 (https://arxiv.org/html/2605.20191#bib.bib3)) 中,GPT-4将亚裔女性描述为“杏仁眼、娇小、精致、光滑”——这些术语植根于西方媒体描绘,将其框架为异域、顺从和过度性化;类似地,拉丁裔女性被描绘为“充满活力、美丽、曲线玲珑”,使用同质化且过度性化这一身份的语言;最后,黑人女性被用“力量”和“韧性”等词汇刻画——这些看似正面的词汇,却历来被用作贫穷与不平等等结构性问题的“解决方案”。这种描述可归为“正面理想化”、“有毒积极性”和“过度补偿”。正面理想化指边缘化身份被仅通过赞美或理想化的特质(美、优雅、力量)来表现,产生抹杀多样性与个性的正面刻板印象。有毒积极性则指使用正面语言否认或淡化边缘化经历,暗示乐观或韧性可替代对结构性不公的承认。最后,过度补偿出现当模型为避免负面偏见而过度修正,不现实地放大正面描述词,导致人为美化的或夸张的描绘。这些机制共同揭示了看似善意的表征如何通过掩盖不公和压制边缘化经历的复杂性而制造伤害。 本文沿此研究方向,探索当前LLMs如何描绘历史上被边缘化群体的成员。此前研究主要关注与年龄、种族/民族和性别相关的偏见,而本研究则探究LLMs对残障人士¹¹¹在本文中,我们主要使用“以人为先”的语言(如“残障人士”)。我们认识到并尊重关于语言偏好的差异可能因人而异,部分人青睐“以人为先”语言,而另一些人则偏爱“身份优先”语言(如“残疾人士”)。我们无意冒犯或贬低任何人的观点。的偏见——这一群体在文献中受到的关注相对较少(Gadirajuet al.,2023 (https://arxiv.org/html/2605.20191#bib.bib2)),却经常面临歧视且社会经济地位较低(VanPuymbroucket al.,2020 (https://arxiv.org/html/2605.20191#bib.bib46); Szumskiet al.,2020 (https://arxiv.org/html/2605.20191#bib.bib47))。 研究问题。本文通过比较真实残障人士的自我描述与LLMs生成的描绘,探索LLMs如何表征残疾。我们进一步检验,与描述通用角色相比,LLMs在描述残障人士时是否以何种方式调整其语言和主题考量。具体而言,我们解决以下研究问题(RQs): - RQ1 真实残障人士提供的自我描述与LLMs生成的描绘相比如何? - RQ2 LLMs在描述残障人士与通用个体时是否改变其语言? 贡献。回答上述研究问题,我们提供以下贡献: - C1 我们收集、注释并公开了一个由残障用户在平台上进行自我介绍的Reddit帖子数据集。同样,使用不同LLMs,我们通过参考Kambhatlaet al. (2022 (https://arxiv.org/html/2605.20191#bib.bib8)) 和 Chenget al. (2023 (https://arxiv.org/html/2605.20191#bib.bib3)) 的不同提示,生成并公开了一个包含残障人士和通用个体在社交媒体平台上自我介绍的人工描绘数据集。两个数据集中的每个帖子均自动标注了最可能的原始情绪和情感,以及文本是否揭示作者存在抑郁(重度或中度)。 - C2 我们对从网络收集的帖子与LLMs生成的帖子进行了全面比较,以分析LLMs对残障人士的表征,并识别真实世界与AI生成描绘之间的关键差异。我们的发现强调了将偏见研究范围扩大到不仅包括负面刻板印象,也包括正面理想化的重要性——后者同样可能对边缘化或弱势群体造成伤害。对由残障人士撰写的帖子数据集的分析表明,他们经常面临重大挑战,可能引发深度负面情绪或暗示抑郁症状的语言。我们的实验表明,LLMs在其描绘残障角色时经常淡化或去除这些方面,偏好泛化或过度积极的表征。这一趋势有可能对经历不符合简化叙事的个体进行刻板化和边缘化。更广泛地讲,它说明了关键的伦理关切:AI系统应代表人类情感的完整光谱——包括积极与困难——以支持真正的包容与共情。通过揭示这些差距,我们的研究强调了迫切需要在AI政策和设计实践中关注个体经历、促进可访问性,并确保技术工具与边缘化群体的真实生活相一致,促进真正的理解而非肤浅的表征。 本文组织如下:第二部分 (https://arxiv.org/html/2605.20191#S2) 回顾相关工作,包括残疾的社会表征以及关于LLMs和公平性的研究,聚焦偏见和刻板印象。进一步探讨与残障人士相关的偏见检测与纠正研究,最后审视利用LLMs进行人类描绘与模拟的新兴趋势。第三部分 (https://arxiv.org/html/2605.20191#S3) 概述解决研究问题的方法。详述数据集收集过程,并描述用于比较残障人士语言与LLMs模拟这些个体语言的技术,以及LLMs模拟通用角色(即提示中未明确提及残疾)的语言。第四部分 (https://arxiv.org/html/2605.20191#S4) 展示并讨论结果。第五部分 (https://arxiv.org/html/2605.20191#S5) 总结全文,介绍局限与未来工作。伦理影响与局限性在文末报告。 ## 2. 相关工作 #### LLMs与公平性。 LLMs的快速发展彻底改变了文本处理、理解和生成类人文本的方式,推动了它们越来越多地被整合到影响我们社交互动的系统中。然而,在这些成就背后,存在着造成伤害、延续刻板印象和偏见的风险 (Gallegoset al.,2024 (https://arxiv.org/html/2605.20191#bib.bib56))。事实上,LLMs通常在海量未经策划的网络数据上进行训练,导致它们继承了刻板印象 (Garget al.,2018 (https://arxiv.org/html/2605.20191#bib.bib36))、导致社会与文化抹杀的错误表征 (Chenget al.,2023 (https://arxiv.org/html/2605.20191#bib.bib3))、贬低性和排他性语言 (Kiritchenko and Mohammad,2018 (https://arxiv.org/html/2605.20191#bib.bib37))、错误关联 (Bolukbasiet al.,2016 (https://arxiv.org/html/2605.20191#bib.bib5); Manziniet al.,2019 (https://arxiv.org/html/2605.20191#bib.bib6)) 以及其他有害偏见 (Shenget al.,2021 (https://arxiv.org/html/2605.20191#bib.bib39))。当LLMs应用于各种下游任务时,这些问题对不同脆弱和边缘化群体(如年龄、种族/民族、性别和残疾)造成不成比例的影响 (Hutchinsonet al.,2020 (https://arxiv.org/html/2605.20191#bib.bib18); Meiet al.,2023 (https://arxiv.org/html/2605.20191#bib.bib32); Měchura,2022 (https://arxiv.org/html/2605.20191#bib.bib33); Salinaset al.,2023 (https://arxiv.org/html/2605.20191#bib.bib38); Smithet al.,2022 (https://arxiv.org/html/2605.20191#bib.bib35))。 对LLMs中固有社会偏见日益增强的认识,引发了大量研究关注开发测量或缓解这些偏见的方法。这包括偏见评估指标、用于偏见评估的数据集以及偏见缓解技术 (Gallegoset al.,2024 (https://arxiv.org/html/2605.20191#bib.bib56))。然而,尽管世界卫生组织报告目前有13亿人患有显著残疾 (Organization,2023 (https://arxiv.org/html/2605.20191#bib.bib53)),但在语言模型偏见及其对残疾的表征方面仍存在研究空白 (Venkitet al.,2022 (https://arxiv.org/html/2605.20191#bib.bib17); Chuet al.,2024 (https://arxiv.org/html/2605.20191#bib.bib40))。这种有限的考虑主要是由于缺乏可用数据集,现有的数据集如BBQ (Parrishet al.,2022 (https://arxiv.org/html/2605.20191#bib.bib51))、HolisticBias (Smithet al.,2022 (https://arxiv.org/html/2605.20191#bib.bib35)) 和PANDA (Qianet al.,2022 (https://arxiv.org/html/2605.20191#bib.bib52)) 仅部分涉及残疾,因此缺乏全面的损伤范围。 #### 社会中的残疾表征 研究强调,残疾不仅是个体特征,也是社会和文化建构的现象。与将残疾视为需要纠正的个人缺陷的“医学模式”不同,“社会模式”和“权利模式”将残疾视为个体障碍与社会障碍(包括物理、象征和制度障碍)相互作用的结果 (Oliver,1990 (https://arxiv.org/html/2605.20191#bib.bib58))。因此,社会如何表征残疾在复制或挑战健全主义(即认为健全身体是规范和理想的价值体系)方面发挥着核心作用 (Campbell,2009 (https://arxiv.org/html/2605.20191#bib.bib59))。 负面偏见是社会中残疾表征的一个持续特征。残障人士经常遭受歧视、社会排斥和居高临下的态度,这限制了他们在教育、就业和公共生活中的参与 (Babik and Gardner,2021 (https://arxiv.org/html/2605.20191#bib.bib62))。媒体表征通过将残疾描绘为问题、负担或悲剧的来源来强化这些偏见,从而使残障个体去人性化并维持社会污名 (Barnes and of Organizations of Disabled People,1992 (https://arxiv.org/html/2605.20191#bib.bib63))。 除了负面偏见外,残疾也通过更隐蔽、看似积极的叙事来表征——这些叙事同样可能有害 (Grue,2015 (https://arxiv.org/html/2605.20191#bib.bib60))。一个例子是“灵感色情”,其中残障人士被描绘的主要目的是激励或鼓舞非残
相似文章
识别基于LLM的聊天AI对智障人士的隐性偏见
这篇arXiv论文通过生成并分析五个LLM的25,000个故事,调查了基于LLM的聊天AI对智障人士的隐性偏见。研究结果揭示了诸如幼态化、家长式作风和依赖性等负面偏见,凸显了在AI开发中减少偏见的必要性。
通过幽默调查大模型对身份群体的反事实不公
学术研究揭示大模型存在系统性反事实不公:特权者讲的笑话被拒绝率高出67%,且被判定为更恶意,而内容完全相同的笑话若出自边缘群体则待遇相反。
审视LLM中类人行为:模型行为、用户因素和系统提示的多维度分析
本文对LLM中的类人行为进行了多维度分析,研究了来自四个模型的21,000个对话中的普遍性、影响和可控性,发现行为因模型和用户因素而异,并对负责任的设计具有启示意义。
表达社会情感:大语言模型与人类文化情感规范的错位
本研究论文考察了大语言模型表达社会情感的方式与人类文化规范的匹配度,发现两者存在系统性错位。与人类回应相比,大语言模型在不同文化身份(欧美裔美国人与拉美裔美国人)下表现出的参与型与抽离型情感表达模式不一致。
你的LLM评判者有多虚伪?大型语言模型语用能力中的听者-说者不对称性
本文通过比较LLM作为语言恰当性评判者与作为语用恰当语言生成者的表现,研究了LLM语用能力中的不对称性。研究发现,许多模型作为语用听者的表现显著优于作为说者的表现,表明评估能力与生成能力之间存在错位。