基于交互的LLM提示敏感性评估与解释

arXiv cs.LG 论文

摘要

本文介绍了一种基于交互的提示敏感性 (IPS) 指标,通过分析交互来评估和解释大语言模型中的提示敏感性。该指标应用于50个开源LLM,识别了如微调和模型规模等因素通过低阶交互降低敏感性。

arXiv:2608.18539v1 公告类型:新 摘要:大语言模型 (LLM) 的显著能力常因不稳定性而受损。即使提示中微小且语义无关的变化也可能导致性能剧烈波动,这种现象称为提示敏感性。以往的研究通常通过比较提示变化时LLM的最终输出来评估提示敏感性。然而,这种粗粒度的指标无法解释提示敏感性的内在原因。在本文中,我们引入交互作为分析LLM提示敏感性的细粒度工具。具体而言,我们将LLM的输出分数分解为一组交互。每个交互代表涉及一组输入变量的非线性关系。我们发现,即使LLM的输出保持不变,对提示的微小变化也可能在交互中引发严重不稳定性。为此,我们提出了一种基于交互的提示敏感性 (IPS) 指标,通过量化引入提示微小变化时交互的变化来实现。我们将IPS指标应用于50个开源LLM,揭示了降低LLM提示敏感性的四个因素,包括监督微调、增加的模型规模、密集架构和少样本学习。更关键的是,我们发现了这四个因素降低提示敏感性的共同机制:所有四个因素都倾向于降低低阶交互(即涉及较少输入变量的交互)的提示敏感性。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:28

# 利用交互作用评估与解释大语言模型的提示敏感性
来源:https://arxiv.org/html/2608.18539

**作者**  
秦锐阳、王庆卓  
所属机构:同济大学计算机科学与技术学院,上海,中国  
王天  
所属机构:同济大学计算机科学与技术学院,上海,中国  
魏志华  
所属机构:同济大学计算机科学与技术学院,上海,中国  
沈文  
所属机构:同济大学计算机科学与技术学院,上海,中国  
通讯作者:[[email protected]](mailto:[email protected])

###### 摘要
大语言模型(LLMs)的卓越能力常常因其不稳定性而受到影响。即使是提示中细微且语义无关的改变,也可能导致性能的剧烈波动,这种现象被称为提示敏感性。以往的研究通常通过比较提示改变时大语言模型的最终输出来评估提示敏感性。然而,这种粗粒度的度量无法解释提示敏感性的内部原因。在本文中,我们引入交互作用作为分析大语言模型提示敏感性的细粒度工具。具体而言,我们将大语言模型的输出分数分解为一组交互作用。每个交互作用代表涉及一组输入变量的非线性关系。我们发现,对提示的细微改变可能触发交互作用的严重不稳定,即使大语言模型的输出保持不变。为此,我们提出了一种基于交互作用的提示敏感性(IPS)度量,通过量化我们在提示中引入细微改变时交互作用的变化来实现。我们将IPS度量应用于50个开源大语言模型,并揭示了降低大语言模型提示敏感性的四个因素,包括监督微调、模型规模增大、稠密架构和少样本学习。更关键的是,我们发现这四个因素降低提示敏感性的共同机制:它们都倾向于降低低阶交互作用(即涉及少量输入变量的交互作用)的提示敏感性。

## 1 引言
大语言模型在众多自然语言处理任务中展现出了卓越的能力,这一成功在很大程度上得益于提示的有效性。然而,这种能力因提示敏感性而受损。也就是说,对提示进行语义上不重要的改变,可能导致输出的分歧。当前关于评估提示敏感性的研究仅关注大语言模型的最终输出。这些基于输出的度量通常测量性能的变化,例如任务准确率或输出一致性。作为粗粒度的衡量标准,这些指标仅揭示了提示敏感性的后果(例如,大语言模型的预测从一个答案变为另一个答案),但未能解释其根本原因。在本文中,我们旨在从细粒度的角度评估大语言模型的提示敏感性,并研究某些因素能够降低大语言模型提示敏感性的根本原因。近期的研究已经利用交互作用来解释深度神经网络(DNNs)的细粒度推理逻辑。受这些研究启发,我们引入交互作用框架来细粒度地分析大语言模型的提示敏感性。具体而言,给定一个包含n个输入变量(例如,单词或词元)的句子x,这些变量由索引集N={1,2,...,n}标记,一个交互作用代表与特定输入变量组合相关的复杂非线性关系。考虑句子x=“He is a green hand.”。在此上下文中,习语“green hand”意为“新手”。输入变量集合S={green, hand}⊆N中的变量共同存在,触发了一个特殊的交互作用效应。这个交互作用效应,记为I_S,将网络的推理推向“新手”的语义含义。已有研究从数学上证明,深度神经网络的标量输出v(x)等价于一个基于交互作用的逻辑模型φ(x)的输出,即v(x) = φ(x) = Σ_{S⊆N} I_S。因此,深度神经网络的推理逻辑可以通过一组交互作用来解释。

图1:利用交互作用对提示敏感性进行细粒度分析。给定一个输入x和一个提示模板T,大语言模型的输出分数v("B"|x, T)等价于一个基于交互作用的逻辑模型φ(x)的输出,即v("B"|x, T) = φ(x) = Σ_{S⊆N} I_S。通过这种方式,我们可以通过分析详细的交互作用模式来揭示大语言模型提示敏感性的根本原因。具体而言,我们将交互作用分为对提示改变稳定的(即稳定交互作用)和不稳定的(即不稳定交互作用)两类。**粗粒度分析 vs. 细粒度分析。** 传统的提示敏感性分析只能粗略地反映当提示改变时大语言模型的预测是否发生变化。除此之外,我们引入了一个基于交互作用的逻辑模型φ(x)作为细粒度分析工具,来分析大语言模型为每个特定样本编码的稳定和不稳定交互作用。如图1所示,当我们保持相同的输入x但对提示模板T引入语义等价的改变(例如,将“Answers”改为“ANSWERS”)时,传统的粗粒度分析只能揭示大语言模型的预测从正确答案“B”变为了错误答案“A”,但无法解释为什么或如何发生这种变化。相比之下,我们基于交互作用的分析精确识别了可能导致大语言模型提示敏感性的不稳定交互作用。如果一个交互作用的效应变化最小(例如,I_{lay, eggs}从0.6242变为0.6076),则认为它是稳定的。相反,如果其效应剧烈波动(例如,I_{NOT, lay, eggs, dogs}从0.5175变为-0.0594),则认为它是不稳定的。值得注意的是,我们发现即使在大语言模型最终输出保持不变的情况下,不稳定交互作用依然存在。这表明我们的细粒度分析揭示了传统、输出层面的度量完全无法察觉的潜在不稳定性。基于这些发现,我们利用交互作用框架提出了一种细粒度度量来评估大语言模型的提示敏感性,称为基于交互作用的提示敏感性(IPS)。该度量量化了大语言模型处理不同提示时交互作用模式的变化。我们将提出的IPS度量应用于评估50个开源大语言模型的提示敏感性。然而,从这个排名中得出哪些大语言模型家族更敏感或更不敏感的结论是具有挑战性的,因为大语言模型的提示敏感性源于多个相互交织的因素。为此,我们进行了一系列对比实验来解耦这些因素,发现了四个能降低大语言模型提示敏感性的因素:
(1) 监督微调降低提示敏感性。经过监督微调的指令/聊天模型比基础模型表现出更低的提示敏感性。
(2) 参数数量更多的大语言模型表现出更低的提示敏感性。
(3) 稠密模型通常比混合专家(MoE)模型敏感性更低。
(4) 与零样本学习相比,少样本学习显著降低了提示敏感性。
更关键的是,我们探索并揭示了一个共同的底层机制,解释了上述四个因素如何降低提示敏感性:它们主要降低了低阶交互作用(即涉及少量输入变量的交互作用)的不稳定性。这一发现是反直觉的,因为我们的实验表明高阶交互作用(即涉及大量输入变量的交互作用)往往表现出最高的敏感性,而低阶交互作用本身敏感性较低。出乎意料的是,这些因素进一步稳定了本来就已经稳定的低阶交互作用,但在解决高阶交互作用更显著的敏感性方面仍然收效甚微。

## 2 相关工作
**大语言模型的提示敏感性。** 先前的研究表明,大语言模型对提示的微小扰动或语义不重要的改变高度敏感,这可能导致显著的性能波动。这种提示敏感性对大语言模型的可靠性构成了相当大的风险。现有的评估大语言模型提示敏感性的度量通常测量最终输出的偏移,例如任务准确率或输出一致性。然而,这些度量是粗粒度的,无法探究大语言模型的内部逻辑。在本文中,我们提出了一种基于交互作用的细粒度度量来评估提示敏感性。该框架使我们能够揭示大语言模型提示敏感性的底层机制。**利用博弈论交互作用解释深度神经网络。** 传统的解释方法往往缺乏忠于原始模型的数学保证,这意味着其输出可能无法准确反映深度神经网络所使用的内部逻辑。为此,有研究提出使用输入变量之间的交互作用来解释深度神经网络,并为该方法的有效性提供了一系列理论保证。此外,已有研究经验性地发现并从理论上证明,深度神经网络通常只编码稀疏的交互作用集。在应用层面,交互作用框架已在广泛复杂的任务中被证明有效,包括对抗迁移性、模型泛化、模型训练过程、过拟合以及其他任务。在本文中,我们使用交互作用框架来分析大语言模型的提示敏感性。

## 3 基于交互作用的大语言模型提示敏感性分析
### 3.1 预备知识:交互作用
本小节介绍交互作用的定义,以及基于交互作用的解释的数学保证。给定一个深度神经网络v和一个包含n个输入变量(例如,单词)的输入句子x,这些变量由索引集N={1,2,...,n}标记,令v(x)∈ℝ表示深度神经网络的标量输出。这里我们设定v(x)=log[p(y=y*|x)/(1-p(y=y*|x))]∈ℝ,其中p(y=y*|x)表示在给定输入x时生成真实标记y*的概率。我们定义一个代理逻辑模型φ(x)来匹配深度神经网络的标量输出v(x)。近期的研究已经证明了定理3.1,该定理表明,在任何随机掩码的输入x_T上的输出分数v(x_T)都可以通过以下代理逻辑模型φ(·)精确计算:
φ(x_T) ≜ φ(x_∅) + Σ_{S⊆N} 1_{S|x_T} · I_S,  (1)
其中AND触发函数1_{S|x_T}∈{0,1}表示S中输入变量之间的AND关系,也可以称为AND交互作用模式。标量权重I_S量化了AND关系的效应,也可以称为交互作用效应。AND关系仅在集合S中所有输入变量同时存在时被激活,即S中的所有输入变量都未被掩码。例如,给定输入句子x=“He is a green hand,”,集合S={green, hand}中的输入变量的共同出现贡献了一个数值效应I_S,将代理逻辑模型的推理推向“新手”的语义含义。如果AND交互作用S被触发,即1_{S|x_T}=1,则相应的交互作用效应I_S被添加到逻辑模型的输出中。否则,如果S中的任何词被掩码且AND交互作用未被触发,即1_{S|x_T}=0,则其相应的交互作用效应I_S不会被添加到逻辑模型的输出中。x_∅表示N中的所有输入变量都被掩码。

###### 定理 3.1(通用匹配性质,证明见附录B)。
给定一个具有n个输入变量的输入x,我们随机掩码任何输入变量组合以生成2^n个掩码输入{x_T | T⊆N}。对于每个掩码输入x_T,当逻辑模型φ(·)中的标量权重I_S被设置为I_S= Σ_{S'⊆S} (-1)^{|S|-|S'|} · v(x_{S'}), φ(x_∅)=v(x_∅)时,该逻辑模型能够精确匹配深度神经网络在所有掩码输入上的标量输出。

相似文章