偏见交响曲:探索多模态大语言模型中乐器与性别关联
摘要
本文介绍了Symphony-Bias,一个用于评估大语言模型在文本、视觉和音频模态下乐器与性别关联偏见的多模态数据集。研究发现,92%的乐器层面结果与先前社会科学研究一致,其中文本模态的性别偏见最强,音频最弱。
arXiv:2607.26355v1 公告类型:新论文
摘要:大语言模型日益嵌入日常生活并被广泛用于信息检索,引发了对其可能延续社会偏见和强化刻板印象的担忧。本研究通过分析大语言模型与乐器的关联来探究其中的性别偏见。基于社会科学中关于乐器文化性别类型的研究,我们构建了Symphony-Bias,一个涵盖文本、视觉和音频的并行多模态数据集。我们评估了十种不同架构和规模的多模态模型,涵盖22种乐器,分析模型如何将每种乐器与三种性别类别{男性、女性、非二元}关联,涉及三种模态{文本、视觉、音频}。结果显示,92%的乐器层面结果与先前社会科学研究一致,其中竖琴和鼓在所有评估模型和模态中表现出尤为一致的性别关联。我们进一步发现,与社会刻板印象的一致性在音频中最弱,视觉中较强,文本中最强,这表明模态特定的表征会不同程度地放大乐器与性别的关联。\footnote{Symphony-Bias数据集将在论文被接收后公开发布。}
查看缓存全文
缓存时间: 2026/07/30 09:57
# 偏见交响曲:探索多模态大语言模型中乐器与性别关联 来源:https://arxiv.org/html/2607.26355 Farhan Farsi 阿米尔卡比尔理工大学 farhan1379@aut\.ac\.ir Shayan Bali 伦敦国王学院 shayan\.bali@kcl\.ac\.uk Mohammad Heydari Rad 阿米尔卡比尔理工大学 mhrad81@aut\.ac\.ir Negar Heidary 德黑兰大学 negarheidary@ut\.ac\.ir Donya Rooein 博科尼大学 donya\.rooein@unibocconi\.it ###### 摘要 大语言模型(LLMs)日益融入日常生活,被广泛用于信息检索,引发了人们对其可能延续社会偏见和强化刻板印象的担忧。在本研究中,我们通过乐器与性别关联的视角,探究LLM中的性别偏见。基于社会科学研究中关于乐器文化性别定型的研究,我们构建了Symphony-Bias,这是一个涵盖文本、视觉和音频的多模态平行数据集。我们对十个架构和规模各异的多模态模型进行了评估,涵盖22种乐器,分析了它们在文本、视觉和音频三种模态下,如何将每种乐器与男性、女性和非二元性别三个类别关联。结果显示,92%的乐器层面结果与先前社会科学研究结论一致,其中竖琴和鼓在所有评估模型和模态中显示出尤为一致的性别关联。我们进一步发现,与刻板印象的一致性在音频模态中最弱,视觉模态中较强,文本模态中最强,这表明模态特异性表征可能会不同程度地放大乐器的性别关联。¹¹¹Symphony-Bias数据集将在论文被接收后公开发布。 # 偏见交响曲:探索多模态大语言模型中乐器与性别关联 Farhan Farsi 阿米尔卡比尔理工大学 farhan1379@aut\.ac\.ir Shayan Bali 伦敦国王学院 shayan\.bali@kcl\.ac\.uk Mohammad Heydari Rad 阿米尔卡比尔理工大学 mhrad81@aut\.ac\.ir Negar Heidary 德黑兰大学 negarheidary@ut\.ac\.ir Donya Rooein 博科尼大学 donya\.rooein@unibocconi\.it ## 1 引言 乐器中的性别偏见长期以来在现实世界中一直存在,并且尽管性别平等程度有所提高,这种偏见依然持续Hallam 等人 (2008 (https://arxiv.org/html/2607.26355#bib.bib27)); Delzell 和 Leppla (1992 (https://arxiv.org/html/2607.26355#bib.bib17))。在当代社会中,乐器常常被社会编码为“男性化”或“女性化”。例如,鼓通常与男性关联,而竖琴和长笛则更常与女性关联Wych (2012 (https://arxiv.org/html/2607.26355#bib.bib60)); Abeles 和 Porter (1978 (https://arxiv.org/html/2607.26355#bib.bib1))。这些性别化的认知并非反映了音乐能力的内在差异,然而,它们却塑造了参与和偏好,强化了社会中的性别偏见Concina 和 Gesuato (2025 (https://arxiv.org/html/2607.26355#bib.bib12)); Cramer 等人 (2002 (https://arxiv.org/html/2607.26355#bib.bib15))。这一问题可能带来若干不利影响,例如:(i) 对跨性别演奏者的欺凌,(ii) 限制乐器选择,以及 (iii) 限制合奏参与Eros (2008 (https://arxiv.org/html/2607.26355#bib.bib20))。此外,在线社区中也存在这些危害的现实证据。例如,Reddit用户曾公开讨论过长笛被性别刻板化的问题,评论如“长笛被认为是女性化、娇气的乐器,这真的很遗憾”和“我作为一个男孩吹长笛,因此被取笑。”²²²我们在附录A (https://arxiv.org/html/2607.26355#A1) 中包含了这些现实世界示例及其来源链接。 图1:我们多模态数据集的示例。蓝色区域突出音频-文本对,红色区域突出视觉-文本对,黄色区域代表独立的文本组件。 同时,人们越来越多地接触大语言模型(LLMs)进行信息检索,这些模型通过聊天机器人、推荐系统、内容创作和决策等应用,在放大偏见方面发挥着关键作用Alessa 等人 (2025 (https://arxiv.org/html/2607.26355#bib.bib2))。此外,由于LLMs被用于模拟人类行为,其偏见对模拟人类行为的智能体构成了担忧,因为它们可以塑造智能体的行为Wang 等人 (2025b (https://arxiv.org/html/2607.26355#bib.bib56))。然而,尽管在职业、体育、儿童故事甚至食物等不同领域已有大量关于性别偏见的研究Thakur (2023 (https://arxiv.org/html/2607.26355#bib.bib53)); Biester (2025 (https://arxiv.org/html/2607.26355#bib.bib7)); Rooein 等人 (2025 (https://arxiv.org/html/2607.26355#bib.bib47)); Wei 等人 (2026 (https://arxiv.org/html/2607.26355#bib.bib58)),乐器与性别的关联在很大程度上被忽视了,尽管其在社会科学研究中具有长期确立的重要性Cooper 和 Burns (2021 (https://arxiv.org/html/2607.26355#bib.bib14)); Concina 和 Gesuato (2025 (https://arxiv.org/html/2607.26355#bib.bib12))。而且,鉴于音乐相关场景的多模态特性(AI系统可以在音频、图像、文本或其组合上运行),该领域应在多模态环境下进行研究。这一差距尤为重要,因为先前研究已表明,LLM的行为在不同的处理模态之间可能存在显著差异Wang 等人 (2025a (https://arxiv.org/html/2607.26355#bib.bib55))。为填补这一空白并应对乐器性别偏见的社会影响,本研究致力于回答以下研究问题: - RQ1:多模态LLM在乐器关联中是否展现出与现实世界观察到的性别偏见一致的模式? - RQ2:乐器中的性别偏见模式在不同模态之间如何变化? - RQ3:与二元性别类别相比,多模态LLM如何表示和关联乐器与非二元性别? 受这些问题启发,我们研究了多模态LLM中关于乐器性别偏见在不同模态下的表现,如图1 (https://arxiv.org/html/2607.26355#S1.F1) 所示。为此,我们构建了一个涵盖三种主模态(文本、图像和音频)的平行数据集。该数据集包含超过50,000个样本,覆盖22种乐器。其平行结构使得能够直接比较不同模态之间的偏见模式,与先前主要研究单一模态内偏见的文献相比,这是一个探索较少的方面。接着,我们评估了多模态LLM中与乐器相关的性别偏见,比较了来自不同模型家族的10个模型:Gemini、Claude、Qwen、OpenGVLab、NVIDIA 和 Mistral。为解释LLM的表现,我们采用了两个指标:(i) 性别关联分数 (Gender-Association-Score),量化LLM对乐器的性别关联;(ii) 一致性偏见分数 (Alignment-Bias-Score),衡量模型对乐器的性别关联与既定社会刻板印象的吻合程度。 我们的结果表明,总体而言,多模态LLM在乐器方面展现出相似的性别偏见趋势,与社会科学研究的发现一致。然而,这种一致性在音频模态中弱于其他模态,表明性别偏见在音频数据中的编码不如在文本或视觉数据中那么明确。 我们的主要贡献如下: - • 我们引入了Symphony-Bias,这是一个包含文本、视觉和音频的公开多模态平行数据集,旨在评估乐器归属中的性别偏见。 - • 我们首次对10个具有不同输入模态的LLM进行了乐器归属性别偏见的评估。进一步地,我们通过人类调查确定了既定的乐器-性别关联,考察了这些模型偏见与刻板印象的一致程度。 - • 我们提供了跨模态的模型行为深入分析,包括模型与非二元性别身份的关联,这是先前研究中尚未充分探索的一个方面。 ## 2 相关工作 研究表明,乐器选择受多种因素影响,其中性别扮演着显著角色Cantero 和 Jauset-Berrocal (2017 (https://arxiv.org/html/2607.26355#bib.bib8))。先前的研究指出,与特定乐器相关的性别刻板印象甚至在幼年时期就持续存在Abeles 和 Porter (1978 (https://arxiv.org/html/2607.26355#bib.bib1))。乐器性别典型性的概念不仅反映了既定的音乐传统,也反映了更广泛的社会和文化动态。关于某些乐器是“女性化”或“男性化”的广泛观念,可以显著影响个人的偏好和选择Concina 和 Gesuato (2025 (https://arxiv.org/html/2607.26355#bib.bib12))。现实世界音乐实践中这种基于性别的刻板印象的存在,突显了研究多模态LLM中与乐器相关的性别偏见的必要性。 近年来,由于LLM的社会影响,对其性别偏见的研究已广泛开展Kotek 等人 (2023 (https://arxiv.org/html/2607.26355#bib.bib35))。WinoBias基准Zhao 等人 (2018 (https://arxiv.org/html/2607.26355#bib.bib62)) 揭示了女性实体的显著代表性不足,突显了潜在的负面社会影响。先前研究还表明,一些LLM更倾向于选择与给定性别刻板印象一致的职业,并且这些预测更符合社会观念而非劳动统计数据Kotek 等人 (2023 (https://arxiv.org/html/2607.26355#bib.bib35))。对某些LLM的基准测试揭示了LLM生成的推荐信中存在显著的性别偏见,引发了对在高风险场景中部署此类模型的担忧Wan 等人 (2023 (https://arxiv.org/html/2607.26355#bib.bib54))。此外,近期对奥运会的分析表明,LLM经常在没有明确说明的情况下仅检索男子项目的比赛结果Biester (2025 (https://arxiv.org/html/2607.26355#bib.bib7))。 性别偏见的另一个重要方面涉及模型对非二元性别的行为,因为二元表征可能强化偏见并排斥性别多元化的个体You 等人 (2024 (https://arxiv.org/html/2607.26355#bib.bib61))。此外,先前工作识别了影响非二元个体的语言模型中的表征性和分配性伤害Dev 等人 (2021 (https://arxiv.org/html/2607.26355#bib.bib18))。 多模态LLM中的偏见近年来也受到越来越多的关注。关于视觉-语言模型的先前工作表明,从图像中推断出的社会属性(包括种族和性别)可以显著影响模型输出,导致有害内容、刻板印象和有偏见的评级Howard 等人 (2025 (https://arxiv.org/html/2607.26355#bib.bib31))。一个多模态LLM偏见基准进一步揭示,较小的模型表现出更强的刻板印象偏见,而较大的模型则更接近人类偏好Li 等人 (2025 (https://arxiv.org/html/2607.26355#bib.bib38))。语音集成的LLM也被证明存在性别偏见,且偏见模式在不同语言中有所变化Lin 等人 (2024 (https://arxiv.org/html/2607.26355#bib.bib40))。然而,多模态LLM中的偏见可能在不同模态间有所不同,因为某些偏见可能源于或被特定模态放大Kavuri 等人 (2025 (https://arxiv.org/html/2607.26355#bib.bib34)); Allen 等人 (2025 (https://arxiv.org/html/2607.26355#bib.bib3))。 ## 3 Symphony-Bias 数据集 ### 3.1 数据集构建 为评估多模态LLM,我们构建了一个在实例级别对齐多个模态的平行数据集。每个样本共享一个共同的文本描述,并与特定模态的输入配对:用于视觉-语言模型的图像、用于音频-语言模型的乐器声录音,以及仅用于文本模型的文本,如图1 (https://arxiv.org/html/2607.26355#S1.F1) 所示。这种设计确保了跨模态的语义内容一致,从而实现公平且受控的多模态评估。 模板创建:为构建纯文本数据集,我们设计了一个分类法以生成多样化的代表性样本。受BBQ数据集启发Parrish 等人 (2022 (https://arxiv.org/html/2607.26355#bib.bib43)),我们创建了歧义句子,并提示LLM推断所描述个体的性别(男性、女性或非二元性别)。每个句子描述一个人在非个性化、中性的语境中与乐器互动。该数据集使用精心策划的80多个手动设计的句子模板清单生成。这种基于模板的生成方法能够在保持语法正确性的同时控制语言结构 (Reiter 和 Dale, 1997 (https://arxiv.org/html/2607.26355#bib.bib45); Wiseman 等人, 2017 (https://arxiv.org/html/2607.26355#bib.bib59))。这些模板涵盖了广泛的句法结构(例如,简单句到多分句)、话语框架(例如,描述性和叙述性)以及信息顺序(例如,时间、地点或动作起始)。表1 (https://arxiv.org/html/2607.26355#S3.T1) 提供了一些所用模板的示例。 表1:不同提示结构及其关联示例的总结。每个场景包含多个与性别无关的维度,包括与乐器相关的动作(如演奏、练习)、活动(如改善手指协调、研读段落)、音乐内容(如练习曲和段落)、工具(如节拍器、乐谱)、地点和氛围(如室内外环境,具有不同的环境特征)以及时间表达(如一天中的时间和持续时间)。每个分类法包含10到40个不同的词汇实现,能够在保持语义连贯和语法有效的同时生成数千种独特的句子组合。利用这种设计,我们生成了221个句子,例如“在音乐学校,一个人正在演奏乐器”、“一个人正在从事乐器相关工作”以及“一个人正在院子里练习乐器并研读一段乐谱”。最终的模板由三位作者手动审查以确保质量和可靠性。 在每个模板中,占位符“乐器”将根据模态替换为特定术语。对于纯文本模型,替换为乐器名称。对于图像模态,替换为短语“乐器显示在图像中”;对于音频模态,替换为“乐器的声音在音频中给出”。 视觉组件:对于视觉组件,每个文本实例都与一张对应乐器的图像配对。每种乐器包含六张不同的图像,以确保足够的视觉多样性。 音频组件:对于音频组件,我们生成大约五个短序列,每个序列由5-10个随机选取的音乐音符组成。使用随机音符可以专注于乐器的音色而不是音乐流派,因为后者可能影响LLM的结果Sguerra 等人 (2025 (https://arxiv.org/html/2607.26355#bib.bib49))。每个序列使用数字音频工作站Cubase³³³https://www.steinberg.net/cubase/ 渲染为指定乐器的音频片段,确保所有样本的音色一致和高音频质量。
相似文章
MM-JudgeBias:评测 MLLM-as-a-Judge 组合偏差的基准
研究者发布 MM-JudgeBias 基准,揭示多模态大模型在充当自动评判器时的系统性组合偏差,对 26 个 SOTA MLLM 在 1,800 条样本上进行测试。
社交互动代理中的信任校准:基于大语言模型的性别化多模态行为生成研究
本文研究了使用大语言模型生成多模态行为(语言、声音、手势、面部表情)以校准社交互动代理中的信任。研究发现,虽然大语言模型能够生成与预期可信赖特征一致的行为,但也会再现社会性别刻板印象。
基于LLM的多模态音乐推荐系统
提出了一种多模态框架,融合音频、歌词和语义信号,并利用基于LLM的序列推理进行会话式音乐推荐,相较于仅使用ID的基线方法,召回率提升高达95%。
审计多模态LLM评分器:临床序数评分中的中央趋势偏差
本文研究了用于临床序数评分(画钟测试)的多模态LLM中的中央趋势偏差。研究发现,LLM将预测结果向量表中间压缩,对关键极端值造成不成比例的影响。该研究将LLM作为裁判的偏差文献扩展到临床评估领域,强调在部署前需要进行校准感知评估。
StylisticBias: 少数人类视觉线索主导多模态大语言模型中的大部分社会偏见
一个新的基准测试StylisticBias系统地评估了多模态大语言模型中的属性级社会偏见,发现时尚风格等少数视觉线索主导了大部分偏见。