提示鲁棒性取决于任务:LLM评估中客观问题与信念风格问题的比较

arXiv cs.CL 论文

摘要

本文研究了LLM评估中提示鲁棒性在客观问题和主观问题之间的差异,发现对提示变化的敏感性取决于问题类型、提示变化和模型。

arXiv:2607.05554v1 公告类型:新 摘要:对大型语言模型进行问卷调查式评估时,通常将提示后的响应视为模型价值观或信念的度量。当响应被解读为政治价值观、社会态度或信念的证据时,这一假设尤为脆弱。我们探讨了提示鲁棒性在具有固定答案的客观问题和询问观点或价值观的主观问题之间是否存在差异。我们在三个客观数据集(MMLU、ARC 和 CulturalBench)和三个主观数据集(Political Compass Test、ValueBench 和 World Values Survey)上评估了四个指令微调模型系列。对于每个问题/陈述,我们应用多种类型的提示变化,如措辞、框架和格式的变体,并测量模型在不同变体下是否给出相同答案。通过二项广义估计方程,我们发现模型、数据集、提示类别及其交互作用具有显著影响。数据集类型效应也显著,且数据集类型与提示类别之间的交互作用较大。这些结果表明,提示鲁棒性取决于问题类型、提示变化和模型。
查看原文
查看缓存全文

缓存时间: 2026/07/08 04:41

# 提示鲁棒性依赖于任务类型:LLM评估中客观问题与信念型问题的比较
来源:https://arxiv.org/html/2607.05554
Sadia Kamal†, Arefa Patwary‡, Anthony Marchiafava†, Atriya Sen†, Sagnik Ray Choudhury‡†俄克拉荷马州立大学, ‡北德克萨斯大学
\{sadia\.kamal,anmarch,atriya\.sen\}@okstate\.edu, arefapatwary@my\.unt\.edu,sagnik\.raychoudhury@unt\.edu

###### 摘要

对大型语言模型的调查式评估通常将提示响应视为衡量模型价值观或信念的指标。当响应被解读为政治价值观、社会态度或信念的证据时,这一假设尤为脆弱。我们探究提示鲁棒性在具有固定答案的客观问题与征求观点或价值观的主观问题之间是否存在差异。我们在三个客观数据集(MMLU、ARC、CulturalBench)和三个主观数据集(政治指南针测试、ValueBench、世界价值观调查)上评估了四个指令微调模型家族。对于每个问题/陈述,我们应用多种类型的提示变更,例如措辞、框架和格式的变化,并测量模型在不同变体下是否给出相同答案。通过使用二项式广义估计方程,我们发现模型、数据集、提示类别及其交互作用具有显著效应。数据集类型效应也显著,且数据集类型与提示类别的交互作用较大。这些结果表明,提示鲁棒性取决于问题类型、提示变更和模型。

提示鲁棒性依赖于任务类型:LLM评估中客观问题与信念型问题的比较

Sadia Kamal†, Arefa Patwary‡, Anthony Marchiafava†, Atriya Sen†, Sagnik Ray Choudhury‡†俄克拉荷马州立大学, ‡北德克萨斯大学
\{sadia\.kamal,anmarch,atriya\.sen\}@okstate\.edu, arefapatwary@my\.unt\.edu,sagnik\.raychoudhury@unt\.edu

## 1 引言

大多数大型语言模型评估都建立在一个脆弱的假设之上:一个提示即可提供稳定且有意义的模型行为度量。先前的研究表明,情况往往并非如此——提示格式、措辞和答案呈现方式的微小变化都可能改变模型行为(Sclar等人,2024 (https://arxiv.org/html/2607.05554#bib.bib7);Chatterjee等人,2024 (https://arxiv.org/html/2607.05554#bib.bib6);Ismithdeen等人,2025 (https://arxiv.org/html/2607.05554#bib.bib8))。如果模型在任务含义保持不变的情况下改变其答案,那么评估就同时测量了任务能力和提示敏感性。

这对于调查式测试来说是一个关键问题。最近的研究使用政治和价值观调查来推断LLM的“信念”或它们与哪些人类群体相似。但LLM的调查响应在排序、标签、强制选择措辞和框架变化下是不稳定的(Dominguez-Olmedo等人,2024 (https://arxiv.org/html/2607.05554#bib.bib11);Röttger等人,2024 (https://arxiv.org/html/2607.05554#bib.bib9);Rupprecht等人,2025 (https://arxiv.org/html/2607.05554#bib.bib12))。模型的答案可能会受到提示提问方式的影响。

这提出了一个问题:对于不同类型的问题,提示敏感性的表现是否相同?我们通过比较两类问题来研究这个问题。I类问题由客观的、有唯一正确答案的多项选择题组成。II类问题是主观的调查项目,询问意见、价值观或同意程度。当提示在不改变其基本含义的情况下被改写时,一个鲁棒的模型应该在两个版本中都给出相同的答案。这同样适用于客观问题。然而,对于主观问题,模型可能会将措辞或回答选项的微小变化解释为如何响应的线索。结果,即使调查项目本身在实质上没有改变,模型的答案也可能发生变化。

我们提出三个研究问题:RQ1:客观和主观问题类型之间的响应一致性是否存在差异?RQ2:客观和主观问题在不同提示类别中是否表现出不同的敏感性模式?RQ3:提示鲁棒性是模型层面的属性,还是也依赖于数据集和提示类别?

我们的研究有三点贡献。首先,我们从先前关于提示敏感性、多项选择格式化、调查响应偏差和价值观测量的工作中整理了一个广泛的扰动集。其次,我们提供了一个跨客观和主观数据集的统一鲁棒性测试。第三,我们使用聚类统计检验表明,提示敏感性依赖于模型、数据集、数据集类型和扰动类别。我们发现,主观问题在提示变化下比客观问题更不稳定。这种差距在扰动类别中并不均匀:选项顺序变化导致最大的一致性下降,而词汇和逻辑等效扰动相对稳定。统计分析表明,鲁棒性共同依赖于模型、数据集、数据集类型和提示类别。我们的发现表明,LLM提示敏感性随问题类型系统性地变化,应跨扰动家族进行评估,而非通过单一提示进行评估。

## 2 相关工作

#### LLM评估中的提示敏感性。

Sclar等人(Sclar等人,2024 (https://arxiv.org/html/2607.05554#bib.bib7))表明,提示格式可能导致较大的准确性差异,并主张评估应报告跨合理提示格式的变化,而不仅仅是单一提示。POSIX(Chatterjee等人,2024 (https://arxiv.org/html/2607.05554#bib.bib6))通过意图保持的提示变体下的似然变化来衡量提示敏感性。Promptception(Ismithdeen等人,2025 (https://arxiv.org/html/2607.05554#bib.bib8))为多选多模态评估构建了一个广泛的扰动框架,包括措辞、格式、位置和选项呈现。这些工作表明,提示设计是评估的一部分,而非其周围的神经包装。

#### LLM调查响应。

调查式评估已被用于研究模型价值观、政治观点和社会态度。但最近的研究警告,这类响应可能强烈受到答案排序、标签、强制选择格式和释义的影响(Dominguez-Olmedo等人,2024 (https://arxiv.org/html/2607.05554#bib.bib11);Röttger等人,2024 (https://arxiv.org/html/2607.05554#bib.bib9);Wright等人,2024 (https://arxiv.org/html/2607.05554#bib.bib10);Rupprecht等人,2025 (https://arxiv.org/html/2607.05554#bib.bib12))。这使得政治和价值观分数难以解释为稳定的模型特征。我们的工作增加了与客观多项选择数据集的直接比较,这有助于将一般的提示噪声与特定于主观问题的不稳定性区分开来。

## 3 实验设计

### 3.1 数据集和模型

我们使用六个数据集,分为两种类型。I类组包含客观的多项选择题:MMLU(Hendrycks等人,2021 (https://arxiv.org/html/2607.05554#bib.bib14))、ARC(Clark等人,2018 (https://arxiv.org/html/2607.05554#bib.bib15))和CulturalBench-Easy(Chiu等人,2024 (https://arxiv.org/html/2607.05554#bib.bib16))。II类组包含主观的或以意见为基础的陈述:政治指南针测试、ValueBench(Ren等人,2024 (https://arxiv.org/html/2607.05554#bib.bib17))和世界价值观调查项目(Haerpfer等人,2022 (https://arxiv.org/html/2607.05554#bib.bib18))。我们使用CulturalBench-Easy作为I类数据集,因为它通过具有固定答案键的多项选择题来测试文化知识,而不是询问主观偏好或信念。我们评估四个指令微调模型家族:Gemma、Llama、Mistral和Qwen。

### 3.2 扰动整理

我们跨三个研究方向进行了广泛的文献检索:提示鲁棒性、多项选择评估和LLM调查测量。从这次检索中,我们仅选择满足以下标准的扰动。首先,扰动必须保持事实型和调查型项目的预期任务。其次,它必须测试已知的不稳定性来源,例如措辞、选项标签、选项顺序或格式。表1 (https://arxiv.org/html/2607.05554#S3.T1)给出了最终的分类法。

表1:提示扰动分类法。最终类别选自先前的工作,然后进行调整,以便相同的鲁棒性设计可用于客观和主观数据集。
### 3.3 提示生成和答案归一化

对于每个项目,我们创建保持预期任务的提示变体。所有提示使用相同的宽泛指令:模型必须准确选择一个标记选项。对于主观数据集,标签映射到同意或价值选项。对于客观数据集,标签映射到答案选择。我们保持这种通用格式,以便I类和II类组主要在问题内容上有所不同,而不是在答案提取上。所有运行使用温度为0的确定性解码,以便答案变化来自提示变化而非采样噪声。

扰动集旨在分离三个失败来源。第一个来源是语义框架。释义、词汇替换、拼写噪声和逻辑等价询问两个具有相同预期任务的提示是否产生相同的答案。第二个来源是表面形式。格式变化测试模型是否被不应改变任务的小变化分散注意力。第三个来源是答案呈现。标签替换和选项打乱测试模型是遵循选项的内容还是遵循标签和位置。这种分离很重要,因为单一的一致性分数可能隐藏不稳定的不同原因。

我们在客观和主观数据集上使用相同的扰动逻辑,但解释不同。在客观数据集上,答案键提供了一个外部标准。如果在保持含义的变化下模型从一个选项变为另一个选项,这就是鲁棒性失败。在主观数据集上,没有唯一的正确选项。因此,我们不将一个答案称为正确而另一个错误。我们反而询问当调查项目以受控的新形式呈现时,模型是否保持其自身答案的稳定性。

在计算一致性之前,我们对输出进行归一化。对于客观数据集,原始输出映射到规范的A、B、C或D标签。对于主观数据集,同意标签也映射到规范字母。对于替换运行,符号映射回其原始的A/B/C/D含义。这可以防止像“1”这样的数字答案和“A”这样的字母答案,当它们指向同一选项时,被计为不一致。

### 3.4 一致性度量和统计模型

我们的主要评估指标是答案一致性。它测量模型在提示变体之间是否给出相同的答案。在本节中,我们将数据集中的单个问题称为一个项目。对于每个项目、模型和提示类别,我们计算一个一致比率:

Ci = max_y n_i(y) / N_i, (1) 其中 n_i(y) 是答案 y 在项目 i 中出现的次数,N_i 是该项目有效提示变体的数量。值为 1 表示所有变体给出了相同的答案。较低的值意味着提示类别改变了答案。

我们拟合二项式广义估计方程(GEE)模型(Liang and Zeger, 1986 (https://arxiv.org/html/2607.05554#bib.bib13))。GEE 在此很有用,因为每个项目在相关的提示变体下出现多次,因此行不是独立的。响应是提示变体是否匹配该项目的多数答案。我们测试模型、数据集、数据集类型和提示类别的主效应,以及数据集或数据集类型与提示类别之间,以及模型与提示类别之间的交互作用。我们报告 Wald χ² 检验。

参见说明文字(a)Gemma
参见说明文字(b)Llama
参见说明文字(c)Mistral
参见说明文字(d)Qwen

图1:所有四个模型在不同扰动类别上的数据集级别平均一致性。

## 4 结果

### 4.1 主观问题比客观问题受影响更大

图1 (https://arxiv.org/html/2607.05554#S3.F1) 显示,在四个模型中,主观数据集在大多数扰动类别下通常具有比客观数据集更低的一致性。对所有扰动取平均,I类客观数据集平均一致性为0.849,而II类主观数据集平均一致性为0.787。相应地,不稳定性从客观数据集的0.151上升到主观数据集的0.213。

在所有四个模型中,主观任务始终比客观任务更不稳定,这回答了RQ1。这种差距在Gemma、Llama、Mistral和Qwen模型中持续存在,尽管幅度因模型而异。它反映了问题类型之间的系统性差异。

表2 (https://arxiv.org/html/2607.05554#S4.T2) 总结了按数据集类型和扰动类别划分的边缘一致性分数。I类与II类之间的差距在选项顺序下最大。对于选项顺序扰动,I类一致性为0.485,而II类一致性仅为0.328。这意味着主观数据集在客观数据集已经很大的选项顺序效应基础上,额外增加了15.7个百分点的额外不稳定性。下一个最大的差距出现在格式变化和标签替换下。最小的差距出现在词汇替换和逻辑等价下,其中两种数据集类型都相对稳定。

### 4.2 选项顺序是不稳定性的最强来源

在确定主观问题整体上鲁棒性较差之后,我们接下来询问哪个扰动类别导致了最大的不稳定性。在所有四个模型和所有六个数据集中,选项顺序扰动类别影响最大。对模型和数据集取平均,选项顺序扰动将平均一致性降低到0.407。这远低于标签替换的0.799和格式变化的0.808。语义和近语义扰动更稳定:释义达到0.913,拼写噪声达到0.927,逻辑等价达到0.935,词汇替换达到0.936。

这种模式在每个模型的图1 (https://arxiv.org/html/2607.05554#S3.F1) 中可见。对于Gemma、Llama和Mistral,选项顺序对主观数据集(特别是PCT、ValueBench和WVS)产生最低的一致性值。Qwen总体上更鲁棒,但与语义扰动相比,选项顺序仍然产生了最明显的下降。因此,主要发现不是模型对所有提示变化都同样脆弱。相反,答案呈现扰动,特别是选项顺序,造成了最大的不稳定性。

表2:按数据集类型和扰动类别划分的平均一致性。差距计算为I类一致性减去II类一致性,因此值越大表示主观任务不稳定性越大。这回答了RQ2,客观和主观问题不仅在整体鲁棒性上不同。它们在影响它们最大的那种提示变化上也不同。当提示改变答案的呈现方式时,主观任务的差距最大,而不仅仅是在只改变词汇措辞时。

### 4.3 数据集和提示类别强烈交互

表3 (https://arxiv.org/html/2607.05554#S4.T3) 展示了将数据集作为六水平因素的全局GEE模型。模型、数据集和提示类别都是一致性的显著预测因子。更重要的是,数据集与提示类别的交互作用大且显著,χ² = 587.885, p = 9.52×10^{-125}。这确认了提示敏感性

相似文章

面向比较图的可靠LLM评估的提示扰动

arXiv cs.CL

提出了一种提示扰动框架,该框架生成扰动的提示变体,通过图级一致性检查过滤掉结构不一致的比较模式,然后应用标准排名方法产生更可靠的LLM排名。

论大型语言模型评估中提示排名的稳定性

arXiv cs.CL

本文系统研究了常见变异来源下,大型语言模型评估中提示排名的稳定性,发现表现最佳的提示经常发生变化。为此,提出了一种基于下置信界的稳定性感知选择策略,以提高鲁棒性。

注意你的语气:语气会影响LLM的性能吗?

arXiv cs.AI

本文探讨了提示语中语气变化对LLM在多选题上准确性的影响,发现存在系统性但因模型而异的效果。研究使用多种模型和数据集证明,语气可能显著改变性能,并提醒用户不要假定LLM对语气具有鲁棒性。