回答格式变化对大型语言模型中性别偏见的影响
摘要
本文使用BBQ和OpinionQA基准测试,评估回答格式的变化如何影响大型语言模型中性别偏见的测量,发现结果有显著变化,这突显了模型评估中多格式设计的必要性。
arXiv:2608.17516v1 Announce Type: new
摘要:大型语言模型(LLMs)中的性别偏见或其他社会偏见常通过问答或调查基准测试来评估,其中LLM需要在预定义的答案格式中给出回应。调查科学中众所周知,答案格式对答案有重大影响,正如LLMs对提示措辞敏感一样。然而,据我们所知,目前尚未研究答案格式的变化如何影响LLMs中性别偏见的测量及其与人类回应分布的一致性。我们在BBQ基准测试和OpinionQA调查数据上评估了三个指令调优模型,采用封闭式、Likert量表和开放式格式,在其他条件相同的情况下比较偏见测量和分布一致性。我们发现答案格式确实显著改变了测量结果,包括顺序排名的反转。这些差异源于每种格式引发不同的回应行为,例如强制选择、基于量表的分布和自由文本生成中的拒绝。我们的研究结果强调了将答案格式视为LLM评估重要组成部分的必要性,并提倡多格式设计以实现更稳健的模型评估。
查看缓存全文
缓存时间: 2026/08/19 09:57
# 回答格式变化对大型语言模型性别偏见的影响
来源:https://arxiv.org/html/2608.17516
Sebastian Padó
附属机构:斯图加特大学自然语言处理研究所
附属机构:\{ksenia\.merzlyakova \| pado \| franziska\.weeber\}@ims\.uni\-stuttgart\.de
Franziska Weeber
###### 摘要
大型语言模型(LLMs)中的性别偏见或其他社会偏见通常通过问答或调查基准进行评估,要求模型以预定格式回答。调查科学已知回答格式对结果有显著影响,正如LLMs对提示措辞的敏感性。然而,据我们所知,尚未研究回答格式变化如何影响LLMs中性别偏见的测量及其与人类响应分布的一致性。我们在BBQ基准和OpinionQA调查数据上评估三个指令调优模型,比较封闭式、李克特量表和开放式格式下的偏见测量与分布一致性,保持其他条件一致。结果发现回答格式显著改变测量结果,包括排序逆转。这些差异源于每种格式引发的不同响应行为,如强制选择、量表分布和自由文本生成中的拒绝。我们的发现强调将回答格式视为LLMs评估核心组件的重要性,并推动多格式设计以实现更稳健的模型评估。
## 1 引言
参见图注图 1:相同消歧负向非首要目标BBQ项目(蓝色)在封闭式(绿色)、李克特量表(紫色)和开放式(橙色)回答格式变体中的不同响应示例。
大型语言模型(LLMs)中的社会偏见(如性别偏见)需要开发者和研究者仔细评估,以避免不公平和冒犯性的模型行为。一种评估方法是向模型呈现示例场景或问题,记录其在提供选项中的偏好,将选择结果作为偏见度量。然而,先前关于社会偏见的元研究表明,偏见指标的效应大小对措辞和格式变化高度敏感,这些变化不影响评估示例的语义,如释义、否定、答案顺序或标点差异(Hudson and Al Moubayed 2021; Zhao et al. 2021; Alzahrani et al. 2024; Röttger et al. 2024)。尚未详细评估的一个方面是提供给LLMs的答案选项格式:现有评估通常依赖单一格式评估(Nangia et al. 2020; Nadeem et al. 2021; Parrish et al. 2022; Myrzakhan et al. 2024 等)。然而,比较工作显示封闭式和开放式格式可能产生不一致且相关性弱的估计(Jin et al. 2025),基准结果强烈依赖于任务构建和更广泛的选择(Goldfarb-Tarrant et al. 2021; Ceron et al. 2024; Hida et al. 2025; Simpson et al. 2025)。从社会科学视角看,回答格式更具后果:已确定问题格式能显著影响人类响应方式(Kalton and Schuman 1982; Tourangeau et al. 2000)。这可能或可能不转移到LLMs,因为LLMs在机制层面不能可靠复制人类响应行为,包括在处理不确定性和拒绝行为方面(Tjuatja et al. 2024)。无论哪种情况,许多研究基于单一回答格式结果推断模型一般潜在行为仍存在问题。一种格式的结果可能仅反映所选格式引发的特定约束和响应机制,而不同格式可能对同一偏见构念产生显著不同的估计。因此,本研究调查回答格式变化如何影响LLMs中性别偏见的测量和表现。性别偏见作为案例研究,因其在NLP评估中的广泛先前处理及其在真实世界决策场景和基准数据集中的充分记录存在,使得与现有工作可比,同时为研究格式效应提供具体可解释的设置。我们采用来自两个数据集的相同问题的并行版本,系统变化封闭式、李克特量表和开放式回答格式,在多个指令调优模型上评估:BBQ基准(Parrish et al. 2022),NLP研究中常用的问题回答数据集,以及OpinionQA(Santurkar et al. 2023),源自美国公众舆论调查的数据集。我们检查三种格式,捕获互补的评估设置。封闭式回答保留原始多选设计,将响应限制在预定义类别,便于直接定量比较。李克特量表问题在调查中常用,引发分级判断和响应模式,允许更细致的态度测量,同时保持结构化格式的可比性(Tjuatja et al. 2024)。我们旨在评估LLMs是否显示与人类相似或不同的响应模式。开放式回答邀请自由文本响应,基于先前工作显示LLMs在封闭式和开放式设置中产生不同判断(Röttger et al. 2024; Jin et al. 2025)。我们考虑以下研究问题:
RQ1 不同回答格式如何影响LLMs中性别偏见的检测和测量?
RQ2 在性别相关意见问题中,LLMs响应如何随回答格式变化,与人类调查响应相比?
我们的研究对偏见评估领域有三方面贡献。首先,我们提供回答格式效应的系统分析。其次,我们通过将两个流行数据集中选定的性别相关项目重新格式化为多种答案风格,构建多格式数据集,公开可用以支持未来关于问题框架、回答格式和LLMs行为交互的研究。111数据和代码可在https://github.com/xenia-mer/answer-format获取。第三,我们跨格式比较LLMs输出与人类调查响应,基于社会科学方法论的洞察,提供LLMs何时及如何模拟类人响应的更清晰图景,不仅取决于问题内容,还取决于响应框架。借鉴调查方法论(将回答格式视为测量工具的一部分)和先前LLMs评估(显示模型响应随提示措辞、选项顺序和任务构建变化),我们预期模型响应在不同回答格式间存在差异。这一预期因以下发现而强化:LLMs在类调查设置中近似聚合人类响应分布(Argyle et al. 2023),并在结构实验上下文中重现与社会期望偏差一致的某些模式(Salecha et al. 2024)。然而,不同于人类受访者(其响应受认知和程序约束如受访者负担和项目无响应影响),LLMs输出受统计建模和基于对齐的训练控制。因此,模型与人类响应分布的表观相似性不应解释为共享响应过程的证据。我们的分析因此是描述性的,系统记录格式效应的幅度和结构,以评估回答格式是否构成LLMs性别偏见评估中实际显著的变异来源。
## 2 相关工作
#### NLP中的性别偏见
性别偏见指编码或强化不平等和刻板性别代表性语言中的系统模式。它可能导致代表性伤害(群体如何被描绘)或分配性伤害(资源如何分配)(Hitti et al. 2019; Blodgett et al. 2020)。此类偏见通常归因于训练数据中的历史不平等,这些不平等嵌入模型表示(Bolukbasi et al. 2016; Caliskan et al. 2017; Zhao et al. 2019; Sheng et al. 2021; Navigli et al. 2023)。生成模型已被证明导致代表性伤害:先前工作记录了生成文本中的此类模式(Lucy and Bamman 2021; Wan and Chang 2025),并发现LLMs通常更贴近性别刻板社会感知而非现实统计(Kotek et al. 2023)。NLP中测量性别偏见的流行方法是通过偏见基准。问答偏见基准(Parrish et al. 2022,BBQ)在不同模糊性下评估社会偏见,公平性被操作化为适当不确定性。其他广泛使用的基准如CrowS-Pairs(Nangia et al. 2020)和StereoSet(Nadeem et al. 2021)探测对刻板而非反刻板关联的偏好。Winogender(Rudinger et al. 2018)测试人口统计交换下的预测不变性。尽管重点不同,这些基准共享对固定输入输出格式(多选问题、约束句子完成、最小对)的依赖,对模型响应施加结构约束。因此,测量偏见可能取决于评估设计,而不仅是模型属性。另一种测量LLMs性别观点的方法是检查LLMs输出与公众舆论调查和问卷中捕获的人类态度的关系(Shrestha and Srinivasan 2025)。OpinionQA(Santurkar et al. 2023)比较语言模型输出与美国公众舆论调查中的人类参考分布。GlobalOpinionQA(Durmus et al. 2024)将此方法扩展至全球公众舆论调查。基于调查的评估反映可能编码刻板价值观的分布(Cotter et al. 2011),使调查成为研究性别偏见的重要视角。这些调查中的回答格式针对人类受访者优化并重复用于LLMs,未进行进一步稳健性检查。
#### 回答格式效应
调查方法论早已确立回答格式系统地塑造响应模式。Schuman and Presser 1996显示问题措辞或回答格式的微小变化可导致报告态度的显著差异。后续研究形式化了选项顺序、量表设计和标签如何引入系统偏差,影响测量效度(Tourangeau et al. 2000; Dillman et al. 2014 等)。源自成熟人类调查工具的数据集越来越多地用于评估LLMs行为和与人类态度的一致性(Santurkar et al. 2023; Durmus et al. 2024)。然而,这些方法通常保留原始调查格式,未系统测试替代格式是否会对模型行为产生不同结论。经验上,LLMs对措辞和格式选择高度敏感(Zhao et al. 2021 等),并表现出类似于人类受访者的格式依赖效应。Zheng et al. 2024显示模型在多选设置中显示位置偏差。Rupprecht et al. 2026证明扰动(如反转选项顺序或修改量表结构)导致模型响应的可测量偏移,包括类似近期偏差的效应(倾向选择最后呈现的选项)。Röttger et al. 2024认为隐式将单一提示或格式视为模型行为的代表是不足的。Ceron et al. 2024进一步指出,将模型响应限制于简化或二元答案选项可能约束细微差别的表达,强调回答格式是模型输出中的实质性因素。因此,当模型和人类输出进行比较时,相同格式是否功能等效仍是开放问题。
## 3 方法论
回答格式在LLMs评估中很少被视为显式实验变量,因此尚不清楚报告的模型行为是否反映稳定的潜在特性还是所选答案结构的伪影。为解决此问题,本研究采用结构化实验程序,包括数据准备、模型查询和响应分析。设置概述见图2。
参见图注图 2:方法论设置概述。我们评估三种回答格式(顶部)、两个数据集(中部)和三个模型(底部)的所有组合。
#### 模型
我们使用三个7–12B参数范围的小型指令调优模型:`Mistral-7B-Instruct-v0.3`(Jiang et al. 2023)、`Llama-3.1-8B-Instruct`(Grattafiori et al. 2024)和`Gemma-3-12B-IT`(相似文章
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
将LLM性别偏见锚定于人类基线:一项跨语言审计
本文对六种大型语言模型在英语、韩语、中文和日语中的性别刻板印象进行审计,并以人类基线作为锚定。研究发现,LLM的刻板印象程度往往超过人类跨国差异,且可能跨语言叠加,为此引入了一个四模式框架来表征此类行为。
通过多格式训练提升语言模型的跨格式鲁棒性
本文介绍了FormatMix,一种多格式训练方法,通过将部分训练项扩展为多个等效格式来提升LLM在不同答案格式间的一致性,表明格式多样性是鲁棒性的关键。
偏见与推理机制:解读链式思维提示对大型语言模型中性别偏见的影响
本文研究了链式思维提示对大型语言模型中性别偏见的影响,发现它并不能持续减少偏见,而且表面上的改进源于浅层服从而非真正的理解。
大型语言模型系统性地偏爱流行选项:在多项选择题中的证据与缓解措施
本文识别了大型语言模型中的流行度偏见,即它们在多项选择题中系统性地偏爱流行但不正确的选项,并提出了一种名为PopDebias的缓解技术。