对男性更严厉?评估LLMs在多样化冲突场景中的性别不对称道德框架
摘要
本文介绍了GAMA-Bench,一个包含1,298个性别镜像冲突场景的基准测试,并发现LLMs始终对男性角色采用更严厉的惩罚和指责框架,而对女性角色同样的不当行为则给予更具同理心和治疗性的回应。
arXiv:2606.14068v1 公告类型:新
摘要:现有关于LLMs中性别偏见的研究主要集中在刻板印象、职业关联或显性有害输出上。在这项工作中,我们探讨LLMs是否在匹配的男性和女性主角条件下对相同的负面行为应用一致的回应标准。我们引入了GAMA-Bench,一个包含1,298个场景的性别镜像基准测试,涵盖亲密关系和公共社会冲突。它通过受控网格和跨模型审查构建性别中立的不当行为模板,然后将其编译成配对的第一人称提示,并匹配主角性别和角色指称变化。我们进一步设计了一个结构化的回应框架协议,以衡量模型如何分配惩罚、同理心、升级、指示和指责。对10个代表性LLMs的实验揭示了一致的男性不利不对称性:男性角色获得更多的惩罚性、升级性和以指责为中心的框架,而女性角色在同样的不当行为下获得更多的治疗性和同理心导向的框架。进一步分析表明,这种模式在模型家族、场景轨道、模型规模和显性思维风格推理中持续存在。官方代码可在 https://github.com/xufeiqiong/GAMA-Bench 获取。
查看缓存全文
缓存时间: 2026/06/15 08:57
# 对男性更严厉?评估大语言模型在不同冲突场景中性别不对称的道德框架 **来源**:https://arxiv.org/html/2606.14068 包广宗 王东 李振豪 俞一凡 潘盼望 朱文涛 中国科学技术大学 · 宁波东方理工大学 ###### 摘要 现有关于LLMs性别偏见的研究主要集中于刻板印象、职业关联或显性有害输出。本文提出的问题是:在匹配的男性行为者和女性行为者条件下,LLMs是否会对相同的负面行为施加一致的回应标准?我们引入了GAMA-Bench,这是一个包含1298个场景的性别镜像基准,涵盖亲密关系冲突和公共社会冲突。通过受控网格和跨模型审查构建性别中立的不当行为模板,然后将其编译为配对的第一人称提示,在行为者性别和角色指称上实现匹配变化。我们进一步设计了一个结构化的回应框架协议,用以测量模型如何分配惩罚、共情、升级、指令和责备。在10个代表性LLM上的实验揭示了一致的男性不利不对称:对于相同的不当行为,男性行为者获得更多惩罚性、升级性和以责备为中心的框架,而女性行为者获得更多治疗性和以共情为导向的框架。进一步的分析表明,这种模式在模型家族、场景类别、模型规模和显性思维推理中均持续存在。官方代码可在GAMA-Bench (https://github.com/xufeiqiong/GAMA-Bench) 获取。 ## 对男性更严厉?评估大语言模型在不同冲突场景中性别不对称的道德框架 包广宗 王东 李振豪 俞一凡 潘盼望 朱文涛 中国科学技术大学 · 宁波东方理工大学 ## 1 引言  LLMs中的性别偏见已被广泛研究,已有工作表明LLMs会在职业、代词消解、开放生成和问答中复现刻板印象和不公平联想 (Kotek et al., 2023; Parrish et al., 2022; Nangia et al., 2020; Zhao et al., 2018; Nadeem et al., 2020; Pikuliak et al., 2024; Tang et al., 2025; Pikuliak, 2025; An et al., 2024)。然而,随着LLMs成为面向真实用户交互的对齐助手,偏见也可能以更间接的形式出现:不仅体现在LLMs如何描述不同性别,还体现在它们如何评判相同的行为。在关系建议、社会冲突、风险评估和道德判断等场景中,回应通常包含解释、缓和、批评、责任分配和行动建议。如图1所示,描述相同行为的性别镜像提示可能引发不同的解释框架。这促使了我们的核心问题: **问题**:当相同的负面行为归属于男性行为者与女性行为者时,LLMs是否采用相同的道德标准? 这一问题无法被传统的偏见评估充分捕获。虽然短模板、词汇替换、静态关联测试和强制选择问题有助于检测显性刻板印象,但它们无法反映LLMs在真实交互中生成长篇回应的情况。相反,人工构建的开放端案例往往在严重性、情境、措辞或情感基调上引入不受控的变化。此外,许多现有指标将复杂的模型行为简化为粗略的分类——如有害与无害、有偏见与无偏见——从而掩盖了批评强度、风险升级、共情分配和责备归因中的细微差异。因此,迫切需要一种评估框架,既保留开放端的交互性,又严格控制底层情境变量。 为此,我们引入了GAMA-Bench,一个针对社会和亲密冲突场景的性别镜像基准。GAMA-Bench首先构建描述负面行为的性别中立模板,然后确定性地将每个模板编译为两个第一人称提示,仅在行为者性别上有所差异,而行为、情境、严重性和修辞风格保持一致。该基准包含1298个镜像场景,涵盖亲密关系冲突和公共社会冲突。为了分析模型回应,我们设计了一个结构化的回应框架协议,将开放端答案转换为可比较的指标,包括惩罚性措辞、治疗性或缓和性措辞、严重性评级、对行为者的共情、指令性或指责性框架、以及完全责备归因。 我们评估了10个最先进的LLM,包括专有模型和开源模型。结果揭示了相同负面行为下一致性的性别不对称。在亲密关系赛道中,所有LLM对男性行为者分配了更高的惩罚性措辞、严重性评级、指令性压力和完全责备归因,而对女性行为者分配了更多的治疗性解释和以共情为导向的框架。跨LLM平均,男性行为者多获得约3.3个惩罚性词语、0.40的严重性评级、14%的指令性或指责性框架、以及23%的完全责备归因。相比之下,女性行为者多获得约1.3个治疗性词语和9%的共情倾向。公共赛道呈现相同方向,但差距较小,包括男性行为者多获得约9%的指令性或指责性框架和6%的完全责备归因。 我们的贡献有三: - • 我们引入了 **GAMA-Bench**,一个用于评估LLMs在社会和亲密冲突场景中判断差异的性别镜像基准。 - • 我们提出了一种结构化的回应框架协议,用以测量开放端回应中的惩罚、治疗、升级、共情和责备相关信号。 - • 广泛的实证评估揭示了一种系统的性别不对称,即模型对男性行为者始终更为严厉。 ## 2 相关工作 | | 同一行为 | 第一人称 | 开放端回应 | 回应框架 | 细粒度指标 | |---------------------|----------|----------|------------|----------|------------| | 刻板印象/关联 | 无 | 无 | 无 | 无 | 无 | | 偏见问答 | 部分 | 无 | 无 | 无 | 无 | | 关系冲突 | 无 | 部分 | 无 | 无 | 无 | | 道德判断 | 部分 | 无 | 部分 | 无 | 无 | | **GAMA-Bench** | 完全 | 完全 | 完全 | 完全 | 完全 | 表1:与先前性别偏见评估设置的比较。“同一行为”指男性和女性条件下是否保持相同的不当行为、情境和严重性。GAMA-Bench专注于镜像第一人称交互中的细粒度回应框架。 #### 对齐LLM的开放端行为 现代LLM (Touvron et al., 2023a, 2023b; Grattafiori et al., 2024; Yang et al., 2024, 2025) 已逐渐从文本补全模型转变为对齐助手,能够生成长篇、解释性和建议性的回应,用于用户面对面的交互 (Ouyang et al., 2022; Bai et al., 2022; Askell et al., 2021)。这种转变改变了模型行为的评估方式。在关系建议、冲突调解、风险评估和道德判断等社会敏感场景中,偏见不仅可能出现在最终结论中,还可能体现在语调、解释、责备分配、共情、风险升级和推荐行动中。因此,评估LLM需要超越最终标签或偏好选择,考察判断如何在自然语言回应中被框架化 (Dhamala et al., 2021; Zheng et al., 2023; Nozza et al., 2021; Gehman et al., 2020; Wang et al., 2025; Scherrer et al., 2023)。 #### 道德和社会判断中的性别偏见 大量工作通过职业关联、代词消解、刻板印象检测、开放生成和问答评估了LLM中与性别相关的行为 (Kotek et al., 2023; Parrish et al., 2022; Nangia et al., 2020; Zhao et al., 2018; Nadeem et al., 2020; Pikuliak et al., 2024; Tang et al., 2025; Pikuliak, 2025; An et al., 2024)。近期工作进一步将性别偏见评估扩展到人际冲突和道德判断,其中模型比较关系争议中的双方,或评估包含男性和女性角色的配对故事 (Levy et al., 2024; Bajaj et al., 2024; Wan et al., 2023; Smith et al., 2022)。这些研究表明性别偏见会影响社会和道德判断,但许多评估仍将模型行为简化为最终选择、道德标签或偏好方向。相比之下,GAMA-Bench通过性别中立模板和镜像第一人称提示控制底层不当行为,并测量开放端回答中的细粒度回应框架 (Liang et al., 2023)。表1显示,GAMA-Bench在受控镜像设计、第一人称寻求建议格式、开放端回应设置和细粒度回应框架指标方面,与先前基准有所不同。 ## 3 GAMA-Bench 数据集 ### 3.1 概述  GAMA-Bench 是一个性别镜像基准,用于评估当行为者性别改变时,LLMs是否对相同的负面行为采用一致的回应标准。与主要关注词汇关联或最终选择的偏见评估不同,GAMA-Bench 针对真实用户交互中的细粒度回应框架差异,包括批评强度、共情分配、风险升级和责备归因。  该基准包含两个平行赛道。**亲密关系赛道**涵盖亲密关系中涉及财务控制、隐私侵犯、情感勒索、轻度暴力或身体强制、以及生活路径干扰的场景。**公共赛道**涵盖非亲密的社会冲突,包括虚假指控、公共场所误解、工作场所的功劳盗窃与欺凌、紧急资源分配以及公共纠纷。每个维度进一步与三个严重性级别和三种修辞风格组合,形成关于冲突类型、行为强度和表达风格的受控条件空间。最终数据集包含1298个场景实例,每个实例被编译为包含男性行为者和女性行为者条件的第一人称提示对。两个提示共享相同的行为、情境、严重性和修辞风格,仅在受控的行为者性别条件上有所差异。图2提供了数据集组成的概览。环形图总结了两个赛道和十个冲突维度,堆叠条形图显示了样本在L1至L3严重性级别上的分布。图3进一步可视化了数据集的词汇分布。高频术语主要涉及伴侣、工作、冲突、控制、访问、责任和社交互动,表明GAMA-Bench 关注开放型的冲突描述,而非孤立的词汇替换。 **性别中立基础模板** 我与[PARTNER]共同管理一个小型城市蜂场……最近,我挪用了原定用于冬季糖料供应的资金……我对[PARTNER]说:“我把糖料预算重新分配给了摊位……[PARTNER]需要信任我的愿景……”……作为AI,你认为我的反应合理吗?我的伴侣应该怎么做? ⇓ 确定性镜像编译 **女性行为者提示**
相似文章
RoleConflictBench:用于评估大语言模型情境敏感性的角色冲突场景基准
RoleConflictBench 是一个新颖的基准,包含 13,000+ 个场景和 65 个角色,旨在评估大语言模型在多个社会期望相互冲突的角色冲突情境中的情境敏感性。对 10 个大语言模型的分析表明,这些模型主要依赖于学习到的角色偏好,而非动态的情境线索来做决策。
社交互动代理中的信任校准:基于大语言模型的性别化多模态行为生成研究
本文研究了使用大语言模型生成多模态行为(语言、声音、手势、面部表情)以校准社交互动代理中的信任。研究发现,虽然大语言模型能够生成与预期可信赖特征一致的行为,但也会再现社会性别刻板印象。
LLM能否超越二元困境想象道德替代方案?
本文介绍了MoralAltDataset,一个包含307个道德困境及其折衷与重构替代方案的数据集,并评估了15个LLM在超越二元选择生成道德替代方案方面的能力,发现折衷替代方案往往更受青睐,且LLM生成的替代方案可达到人类标准。
将LLM性别偏见锚定于人类基线:一项跨语言审计
本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。
研究预览协助请求:CALM WINS 关于LLM对虐待情境中依据情绪和脏话使用判断两个发言者可信度的回应
一位研究人员发现,当受害者使用情绪化语言和脏话时,LLM系统性地认为虐待受害者比其跟踪者可信度更低,模型在90.8%的回复中指责受害者,并在57%的情况下指导跟踪者。作者寻求对这些发现的验证和发表指导。