大规模语言模型的概率归因

arXiv cs.CL 论文

摘要

本文提出了一种与模型无关的基于概率的令牌归因度量,利用贝叶斯规则反转下一个令牌的对数概率,捕捉模型对令牌序列的内部表示,并通过熵分析提高可解释性。

arXiv:2605.21726v1 公告类型:新 摘要:大型语言模型(LLMs)的生成性质体现在它们根据前一个令牌计算每个响应令牌的条件概率上。这些概率编码了模型在训练中学习并在推理中利用的分布结构。在这项工作中,我们利用这些概率将LLMs置于随机过程的数学理论中。我们使用这一框架设计了一种与模型无关的基于概率的令牌归因度量,利用贝叶斯规则反转下一个令牌的对数概率,以捕捉模型对令牌序列分布的内部表示。该表示独立于模型的计算结构。该表示给出了在给定提示下响应的条件概率,以及在给定提示且忽略某个令牌的情况下响应的条件概率。我们的归因得分是这些概率的比值的对数。我们进一步计算单个提示的令牌分布的熵,条件于剩余上下文。熵与归因得分之间的相互作用揭示了LLM的行为。我们评估了7个提示下的8个模型,并研究了异常、令牌敏感性、响应稳定性、模型稳定性和训练收敛性,从而提高了可解释性,并引导用户关注生成过程中不确定或不稳定的部分。
查看原文
查看缓存全文

缓存时间: 2026/05/22 08:43

# 面向大语言模型的概率归因 Source: https://arxiv.org/html/2605.21726 \\nameShilpika\\emailshilpika@anl\.gov \\addrArgonne Leadership Computing Facility Argonne National Laboratory Lemont, IL, USA\\nameCarlo Graziani\\emailcgraziani@anl\.gov \\addrMathematics and Computer Science Division Argonne National Laboratory Lemont, IL, USA\\nameBethany Lusch\\emailblusch@anl\.gov \\addrArgonne Leadership Computing Facility Argonne National Laboratory Lemont, IL, USA\\nameVenkatram Vishwanath\\emailvenkat@anl\.gov \\addrArgonne Leadership Computing Facility Argonne National Laboratory Lemont, IL, USA\\nameMichael E\. Papka\\emailpapka@anl\.gov \\addrArgonne Leadership Computing Facility Argonne National Laboratory Lemont, IL, USA \\addrDepartment of Computer Science University of Illinois Chicago Chicago, IL, USA ###### 摘要 大语言模型(LLMs)的生成性质体现在它们为根据先前标记采样每个响应标记而计算的条件概率中。这些概率编码了模型在训练中学到的分布结构,并在推理中加以利用。本文利用这些概率将LLMs置于随机过程的数学理论框架中。我们利用该框架设计了一种与模型无关的概率性标记归因度量,通过贝叶斯规则逆向处理下一个标记的对数概率,以捕捉模型对标记序列分布的内部表示。该表示独立于模型的计算结构。由此得到的表示给出了在给定提示下响应的条件概率,以及在给定提示但将某个标记边缘化后响应的条件概率。我们的归因分数是这两个概率之比的对数。我们还计算了在给定剩余上下文条件下单个提示标记分布的熵。熵与归因分数之间的相互作用揭示了LLM的行为特征。我们对7个提示下的8个模型进行了评估,并研究了异常现象、标记敏感性、响应稳定性、模型稳定性以及训练收敛性,从而提升了可解释性,并引导用户关注生成过程中不确定或不稳定的部分。 关键词:人工智能,可解释性,可解释人工智能,XAI,可解释性,熵,概率论 ## 1 引言 人工智能对科学建模日益增长的影响,要求采用更为严谨的新方法来分析人工智能模型做什么、如何做,以及人工智能驱动的预测和决策应伴随哪些不确定性。关键问题包括模型的适当规模(直接影响训练能耗)、输出有效性/正确性以及输出不确定性等。这些构成了重大挑战,因为模型的复杂性排除了第一性原理数学/统计模型所具有的直接可解释性,因此有必要间接解决这些问题。为了理解人工智能模型(尤其是大语言模型)的决策过程,人们开发了多种技术、框架和方法,这些统称为可解释人工智能(XAI)。XAI 为“黑盒”人工智能模型如何根据输入生成响应提供了透明度。XAI 的动机源于在人工智能应用中建立信任、监管、问责、公平性和安全性的需求,尤其是在医疗、金融和法律等高风险领域,不透明的决策可能带来严重的伦理和社会后果(Phillips et al., 2021 (https://arxiv.org/html/2605.21726#bib.bib2);Rudin, 2019 (https://arxiv.org/html/2605.21726#bib.bib3))。XAI 包含的方法大致可分为两类:模型特定方法,它们针对特定类型的模型(例如,深度神经网络中的显著性图和基于梯度的可视化);以及模型无关方法,它们可以普遍应用,不受底层算法限制(Barredo Arrieta et al., 2020 (https://arxiv.org/html/2605.21726#bib.bib4))。诸如 SHAP(SHapley Additive exPlanations)和 LIME(Local Interpretable Model-agnostic Explanations)等模型无关方法依赖于输入-输出行为而非内部架构,因此在不同机器学习模型中特别通用(Lundberg and Lee, 2017 (https://arxiv.org/html/2605.21726#bib.bib24);Ribeiro et al., 2016b (https://arxiv.org/html/2605.21726#bib.bib23))。在本文中,我们将大语言模型(LLMs)的推理操作置于随机过程的数学理论框架中。利用这一框架,我们为 LLMs 开发了一种与模型无关的概率归因分数(AS)。AS 根据生成的响应确定提示中标记的重要性。LLMs 本质上是自回归的,这意味着它们通过基于所有先前标记对下一个输出标记的计算概率分布进行采样,从而逐个生成文本。LLMs 之所以有效,是因为它们成功地从训练语料库中推断出标记序列的统计属性,并利用这些属性做出接近最优的提示-响应决策。这一过程直接基于概率的链式法则,该法则允许将随机变量序列的联合概率分解为条件概率的乘积。随机过程理论提供了一个有用的数学框架,可以以与模型无关的方式理解这些操作,从而便于不同类型 LLM 之间的比较。该框架还允许对 LLM 响应进行有用的概率分析,AS 就是一个例子。我们的工作有以下贡献: - C1. AS 是模型无关的,适用于文本生成任务,尽管它可以扩展到任何基于 NLP 的任务。 - C2. 我们的方法无参数,使其对用户的任意选择不那么敏感,并提高了可重复性和客观性,适合用于其他 XAI 方法的超参数调优。 - C3. 我们的上下文和替换熵是模型稳定性的度量,可以指示这些模型收敛到其训练数据分布的程度。 - C4. AS 具有内建敏感性,因为它基于统计第一原理,因此作为其核心方法论的一部分,它评估可解释结果的正确性。 本文的其余部分组织如下:背景部分回顾了与研究相关的关键概念、先前工作和理论基础。LLMs 作为随机过程、实验和评估部分随后描述了所提出的方法、实验设置、实现细节、比较分析以及用于评估性能的标准。最后,结论部分总结了主要发现,讨论了它们的意义,并概述了未来研究的可能方向。代码可在以下网址获取:https://github.com/sshilpika/probabilistic-attribution-score/。 ## 2 背景:面向 NLP 和大语言模型的可解释人工智能 自然语言处理(NLP)中的可解释人工智能(XAI)已从线性模型和早期神经架构的事后可解释性方法,演变为针对 Transformer 编码器和当代大语言模型的多样化方法论格局(Luo and Specia, 2024 (https://arxiv.org/html/2605.21726#bib.bib32);Rogers et al., 2020 (https://arxiv.org/html/2605.21726#bib.bib30))。当前研究涵盖三个广泛层面:对单个预测的局部解释、对模型行为和内在化知识的全局分析,以及旨在识别产生模型输出的内部计算结构的机制可解释性(Luo and Specia, 2024 (https://arxiv.org/html/2605.21726#bib.bib32);Elhage et al., 2021 (https://arxiv.org/html/2605.21726#bib.bib31))。 NLP XAI 的早期工作集中在局部特征归因方法上,这些方法旨在估计哪些输入标记或 n-gram 对模型的预测影响最大。LIME 通过局部拟合的可解释替代模型(通常使用基于扰动的标记删除)来解释预测,代表了重大进步(Ribeiro et al., 2016b (https://arxiv.org/html/2605.21726#bib.bib23))。密切相关的是基于 Shapley 值的方法,特别是 SHAP,它提供了一个更严谨的加性归因框架,并在基于文本的可解释性流程中被广泛采用(Lundberg and Lee, 2017 (https://arxiv.org/html/2605.21726#bib.bib24))。对于神经 NLP 模型,基于梯度的方法(如 Integrated Gradients)因其计算可扩展性和公理基础而变得特别有影响力(Sundararajan et al., 2017 (https://arxiv.org/html/2605.21726#bib.bib25))。像 Captum 这样的工具包进一步标准化了基于 PyTorch 工作流中归因方法的实现和比较(Kokhlikyan et al., 2020 (https://arxiv.org/html/2605.21726#bib.bib26))。然而,很快就清楚,标记级归因在释义下可能不稳定,并且对扰动策略敏感(Sinha et al., 2021 (https://arxiv.org/html/2605.21726#bib.bib15))。这些局限性促使了基于理性的解释的发展,这些解释旨在识别旨在证明预测合理性的文本片段。这一工作线通过诸如 ERASER 等基准进行了整合,该基准区分了合理性与忠实性:合理性即与人标注的理性一致,而忠实性则是理性在多大程度上真正支持模型的预测(DeYoung et al., 2020 (https://arxiv.org/html/2605.21726#bib.bib27))。这一区别已成为 LLM 可解释性中的基础,因为令人信服的解释可能仍然无法反映响应的实际计算基础(Luo and Specia, 2024 (https://arxiv.org/html/2605.21726#bib.bib32))。 基于注意力的可解释性引发了另一场重大辩论。由于注意力图在视觉上直观,它们最初被视为 Transformer 行为的自然解释。然而,Jain 和 Wallace 表明,注意力权重通常与其他重要性度量相关性较弱,并且截然不同的注意力分布可以产生相似的预测(Jain and Wallace, 2019 (https://arxiv.org/html/2605.21726#bib.bib28))。后续工作认为,注意力的解释价值取决于解释的定义和所采用的评估协议(Wiegreffe and Pinter, 2019 (https://arxiv.org/html/2605.21726#bib.bib29))。 与此同时,全局可解释性研究考察了模型编码了哪些语言知识、存储在哪里以及如何跨层演化。这一传统通常被称为“BERTology”,采用探测分类器、表征分析和行为测试来表征模型表征中的句法和语义信息(Rogers et al., 2020 (https://arxiv.org/html/2605.21726#bib.bib30))。最近,机制可解释性通过尝试将 Transformer 逆向工程为电路、特征和信息通路,扩展了这一议程(Elhage et al., 2021 (https://arxiv.org/html/2605.21726#bib.bib31))。在 LLM 时代,可解释性还必须解决提示敏感性、自生成理性以及检索增强系统中的检索溯源问题(Luo and Specia, 2024 (https://arxiv.org/html/2605.21726#bib.bib32))。总的来说,该领域可以沿几个维度进行组织:固有方法与事后方法、局部范围与全局范围、解释的对象以及评估标准。在这些范式之间,核心挑战仍然不变:产生不仅仅是合理的,而且是因果上忠实、稳定且在实际部署中有用的解释(Luo and Specia, 2024 (https://arxiv.org/html/2605.21726#bib.bib32);DeYoung et al., 2020 (https://arxiv.org/html/2605.21726#bib.bib27))。我们的工作是与模型无关的,并且不试图归因任何与“知识表示”或“模型决策过程”相关的内容,因为它只关注 LLM 推理的文本分布属性。 ## 3 LLMs 作为随机过程 我们对 LLMs 的方法是概率性的,并且明确设计为遮蔽计算性 Transformer 模型的细节。相反,我们在这里专注于 Transformer 架构明确声称建模的内容:标记的条件概率,即以标记序列中先前标记为条件。实际上,训练好的 LLM 定义了文本(即标记序列)上的概率分布。从这个角度来看,人们可以认识到 LLM 与数理统计学中一个古老主题之间的联系:随机过程理论。这种联系很有趣,因为它提供了将 LLM 置于一个发展完善的数学理论体系中的可能性,并利用该理论来洞察 LLM 及其输出。我们提醒读者回顾此类对象的定义。*随机过程*定义为概率空间 \((\Omega, \mathcal{F}, \mathrm{Pr})\) 上的一族随机变量 \(\{X_t: t \in T\}\),其中 \(T\) 是任意索引集(Billingsley, 1995 (https://arxiv.org/html/2605.21726#bib.bib8), p. 482)。进一步回顾概率空间的要素:\(\Omega\) 是结果集,称为*样本空间*;\(\mathcal{F}\) 是 \(\Omega\) 中元素集合的 \(\sigma\)-域(可测集族);而 \(\mathrm{Pr}: \mathcal{F} \mapsto [0,1]\) 是满足 \(\mathrm{Pr}(\Omega)=1\)、\(\mathrm{Pr}(\emptyset)=0\)、且对任意可数不相交集族 \(A_k \in \mathcal{F}\) 有 \(\mathrm{Pr}(\cup_k A_k) = \sum_k P(A_k)\) 的概率测度。在 LLM 的背景下,索引集是包括零在内的自然数,即 \(T = \mathbb{N}_0\)。随机变量对应于 LLM 推理过程中在文本序列的每个位置发出的标记。为了进一步将 LLM 的操作与随机过程理论对应起来,需要引入一些记号。 ### 3.1 记号 本文感兴趣的对象是从 LLM 在训练期间学到的文本分布中抽取的语言标记序列。我们用希腊索引(如 \(\mu\))表示标记序列中的位置,以区别于表示标记身份的罗马索引(如 \(l\))。词汇表大小是固定的,记为 \(V\),因此标记 ID(TID)索引 \(l\) 满足 \(0 \le l < V\)。表示序列中第 \(\mu\) 个位置的随机变量的标准符号是 \(L_\mu\),其具体实现为 \(l_\mu\)。为了简洁,我们用粗体小写字母表示整个已实现序列(如 \(\bm{l}\)),粗体大写字母表示随机序列(如 \(\bm{L}\))。序列变量的子序列用下标表示:例如,\(\bm{L}_{<\mu} \equiv [L_0, L_1, \ldots, L_{\mu-1}]\),\(\bm{L}_{>\mu} \equiv [L_{\mu+1}, \ldots, L_{M-1}]\),对于序列实现 \(\bm{l}_{<\mu}\)、\(\bm{l}_{\le \mu}\)、\(\bm{l}_{>\mu}\) 也类似。那么记号 \(\bm{L} - L_\mu \equiv \bm{L}_{<\mu} \cap \bm{L}_{>\mu}\) 表示所有除了位置 \(\mu\) 之外的 \(L_\nu\)、\(0 \le \nu < M\) 构成的有限子序列,这将用于条件定义。此外,我们注意到 LLM 推理产生一个变长“提示”序列,后面跟着一个变长“响应”序列。我们将组成提示和响应部分的随机变量分别标注为 \(P_\mu\) 和 \(R_\mu\),这样序列长度同样可以表示为 \(M\)。提示部分结束于某个索引值(例如 \(m-1\)),响应部分从位置 \(m\) 开始。我们假设提示和响应之间没有间隙,即响应从提示结束的下一个位置开始。### 3.2 从 LLM 中可读的量 标准的因果自回归 LLM 设计用于从标记 \(n-1\) 的输入序列开始,针对每个位置 \(n\) 为下一个标记的概率分布提供参数估计——即 \(l_n\) 对前一个标记 \(\bm{l}_{<n}\) 的条件概率。这个由模型提供的估计概率分布是在词汇表 \(V\) 上的分类分布。我们按惯例使用标准的(因果)序列记号来读取每个时间步的该分布:\[\mathrm{Pr}(L_n = l | \bm{L}_{<n} = \bm{l}_{<n}).\tag{1}\] 实际上,LLM 的推理循环通过报告一个对数概率(或 logit)向量来揭示这一点,该向量通过 softmax 函数转换为(1)中的概率。这种机制允许从“旁通道”读取每步的条件概率,而无需干扰token生成的主流程。因此,我们可以将 LLM 视为一个黑盒,可以在序列逐步构建时,按需报告条件分布(1)。LLM 提供的这种概率条件性信息足以让我们根据概率论的基本链式法则计算任何整个序列(\(\bm{l}\))的联合概率:\[
\mathrm{Pr}(\bm{L} = \bm{l}) = \prod_{n=0}^{M-1} \mathrm{Pr}(L_n = l_n | \bm{L}_{<n} = \bm{l}_{<n}).\tag{2}
\] 这种分解使我们能够从黑盒 LLM 中读取任何序列的实现概率。同样,我们可以计算任意条件概率。考虑序列 \(\bm{L} = \{P_0, \ldots, P_{m-1}, R_m, \ldots, R_{M-1}\}\),其中提示包含前 \(m\) 个位置,响应占据最终位置 \(m, \ldots, M-1\)。我们感兴趣的量是响应 \(\bm{r} \equiv \bm{r}_{>m-1}\) 在给定提示 \(\bm{p} \equiv \bm{p}_{<m}\) 下的条件概率:\[
\mathrm{Pr}(\{\bm{R} = \bm{r}\} | \{\bm{P} = \bm{p}\})
= \mathrm{Pr}(\bm{L}_{>m-1} = \bm{r} | \bm{L}_{<m} = \bm{p})\\
= \prod_{n=m}^{M-1} \mathrm{Pr}(L_n = r_n | \bm{L}_{<n} = \bm{p}_{<n})\tag{3}
\] 其中 \(\bm{p}_{<n}\) 仅包含提示部分,直到 \(n < m\) 为止;对于 \(n = m\),它是 \(\bm{p}\),而对于 \(n > m\),它是 \(\bm{p}\) 再加上已经生成的响应标记。特别是,当我们有完整的提示和完整的响应,并且我们想要计算响应在提示下的概率时,我们可以使用(3)。如果响应是通过下一个标记采样生成的,则该乘积中的每个因子在采样时已知。然而,在本文中,我们使用 LLM 来计算给定包含提示和(部分)响应文本的输入序列时下一个标记的概率。这意味着一旦响应被生成,我们可以通过将响应作为上下文提供给 LLM 并读取下一个标记概率,来计算给定提示和响应时下一个标记的条件概率(即,在响应之后继续下一个标记的概率)。但请注意,我们对响应在提示下的概率感兴趣,而不是响应之后继续的无意义文本。因此,我们小心使用(3)来计算给定提示的响应概率。### 3.3 通过贝叶斯规则进行归因 现在我们考虑一个场景:我们有一个系统,它接收提示文本 \(\bm{p}\) 并通过 LLM 生成响应 \(\bm{r}\)。我们希望量化提示中每个标记对该特定响应的“重要性”。为此,我们希望衡量在给予(或扣除)该标记信息的情况下,响应概率的改变程度。我们通过边缘化标记 \(p_\mu\) 来评估其重要性。我们关注的量是给定提示的响应概率与给定缺失该标记的提示的响应概率之比。具体来说,对于提示中位置 \(\mu\)(其中 \(\mu < m\)),我们考虑提示移除该标记后的响应条件概率:\[
\mathrm{Pr}(\{\bm{R} = \bm{r}\} | \{\bm{P}_{<\mu} = \bm{p}_{<\mu}\} \cap \{\bm{P}_{>\mu} = \bm{p}_{>\mu}\}).
\] 所需表达式必须只包含诸如方程(1)–(2)中的因子,以便可以从 LLM 的旁通道读取序列中下一个标记的分类概率。假设响应紧随提示之后,两者之间没有间隙,并且提示和响应都由连续的序列位置组成。我们从定义开始:\[
\mathrm{Pr}(\{\bm{R} = \bm{r}\} | \{\bm{P} = \

相似文章

修正影响:利用正交潜在空间解构LLM输出

arXiv cs.LG

本文介绍了一个框架,通过稀疏自编码器学习正交潜在空间,实现对大型语言模型中词元级影响的归因,从而精确识别共同影响预测的训练数据词元,适用于医疗等高风险领域。

归因合同:生成式语言模型中的特征归因

arXiv cs.LG

本文介绍了归因合同(Attribution Contract),这是生成式语言模型中特征归因声明的一种规范,解决了特征定义不清以及归因方法评估方式模糊的问题。论文以自回归模型和扩散模型为例,展示了归因何时具有信息量,何时可能产生误导。

BayesBench: 多轮证据累积下LLM信念轨迹的评估

arXiv cs.AI

BayesBench评估了在多轮证据累积任务中,大语言模型的信念更新与贝叶斯推理的接近程度,发现虽然扩展规模能改善潜在推理,但模型难以将这种理解用于下游预测。