用于企业NLP系统中用户信任的鲁棒解释

arXiv cs.CL 论文

摘要

本文提出了一种统一的黑盒鲁棒性评估框架,用于评估企业NLP中词元级解释的鲁棒性,并对比了编码器(BERT、RoBERTa)和解码器(Qwen、Llama)模型。研究发现,解码器大语言模型产生的解释明显更稳定,且稳定性随模型规模提升而增强,同时提供了部署前模型选择的成本-鲁棒性权衡曲线。

arXiv:2604.12069v4 Announce Type: replace 摘要:在企业NLP中,鲁棒的解释日益成为用户信任的前提,但在常见的黑盒部署(仅API访问)场景下,部署前验证较为困难——此时基于表示的解释器不可行,且现有研究对解释在真实用户噪声下是否保持稳定提供的指导有限,特别是在组织从编码器分类器迁移至解码器大语言模型时。为弥补这一不足,我们提出了一个基于留一法遮挡的统一黑盒鲁棒性评估框架,并利用在多个扰动等级(交换、删除、打乱、回译)下的最高词元翻转率来量化解释鲁棒性。采用该协议,我们在三个基准数据集和六个模型(涵盖编码器与解码器系列:BERT、RoBERTa、Qwen 7B/14B、Llama 8B/70B;共64,800个案例)上进行了系统的跨架构比较。研究发现,解码器大语言模型产生的解释比编码器基线模型稳定得多(平均翻转率降低73%),且稳定性随模型规模扩大而提升(从7B到70B提升44%)。最后,我们将鲁棒性提升与推理成本相关联,得到一条实用的成本-鲁棒性权衡曲线,以支持在合规敏感型应用的部署前进行模型和解释选择。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:38

# 面向企业NLP系统用户信任的稳健解释
来源:https://arxiv.org/html/2604.12069
桂林张,赵凯,杰弗里·弗里德曼,徐楚,阿明·阿努恩,杰瑞·丁 Workday AI研究 \{guilin\.zhang, kai\.zhao, jeffrey\.friedman\}@workday\.com \{xu\.chu, amine\.anoun, jerry\.ting\}@workday\.com

###### 摘要

稳健解释对于企业NLP系统的用户信任日益必要,但在常见的黑箱部署(仅API访问)情况下,预部署验证十分困难——此时基于表示的解释器不可行,且现有研究对于解释在真实用户噪声下是否保持稳定提供的指导有限,尤其在组织从编码器分类器迁移到解码器大语言模型(LLM)时。为填补这一缺口,我们提出一个统一的基于留一遮挡的黑箱稳健性评估框架,用于词级解释,并在多种严重程度下通过现实扰动(交换、删除、打乱和回译)将解释稳健性量化为顶级词翻转率。利用该协议,我们在三个基准数据集和六个涵盖编码器与解码器家族(BERT、RoBERTa、Qwen 7B/14B、Llama 8B/70B;64,800个案例)的模型上进行了系统的跨架构比较。我们发现,在我们评估的模型规模下,解码器LLM产生的解释比编码器基线显著更稳定(平均翻转率低73%),且稳定性随解码器家族内部规模增大而进一步提升(从7B到70B提升44%)。最后,我们将稳健性提升与推理成本关联,得到一条实用的成本-稳健性权衡曲线,支持在合规敏感应用部署前进行模型和解释选择。

面向企业NLP系统用户信任的稳健解释

桂林张,赵凯††感谢:通讯作者。,杰弗里·弗里德曼,徐楚,阿明·阿努恩,杰瑞·丁 Workday AI研究 \{guilin\.zhang, kai\.zhao, jeffrey\.friedman\}@workday\.com \{xu\.chu, amine\.anoun, jerry\.ting\}@workday\.com

## 1 引言

稳健解释对于企业NLP系统的用户信任日益必要,特别是在金融和人力资源平台中,文本分类器支持高影响决策(例如风险筛查、政策合规、案例分类和工单路由)。同时,许多组织正从基于编码器的模型(如BERT Devlin et al. (2019 (https://arxiv.org/html/2604.12069#bib.bib2)) 和 RoBERTa Liu et al. (2019 (https://arxiv.org/html/2604.12069#bib.bib3)))迁移到基于解码器的LLM(如GPT Brown et al. (2020 (https://arxiv.org/html/2604.12069#bib.bib4))、Llama Touvron et al. (2023 (https://arxiv.org/html/2604.12069#bib.bib5));Grattafiori et al. (2024 (https://arxiv.org/html/2604.12069#bib.bib36)) 和 Qwen Bai et al. (2023 (https://arxiv.org/html/2604.12069#bib.bib7));Yang et al. (2024 (https://arxiv.org/html/2604.12069#bib.bib38))),因其改进的准确性和灵活性,尤其在少样本和零样本设置中 Wei et al. (2022 (https://arxiv.org/html/2604.12069#bib.bib9))。然而,除了准确性之外,这种架构转变是否提升了企业部署所需的*解释稳健性*仍不清楚。

这一差距因一种常见的生产现实而被放大:企业模型通常通过受管服务或第三方API访问,仅暴露输入和输出,从而施加了*黑箱约束*,无法获取梯度或内部表示。在此约束下,团队依赖于基于查询的、模型无关的解释器,并必须确保解释在常规的用户类噪声(编辑、改写、重排序)下*稳定*。不稳定的解释会损害可审计性和用户信任,并可能使合规义务复杂化,包括新兴的对一致且可追溯理由的需求。这些考虑引出一个实际的预部署问题:*在黑箱访问和现实输入扰动下,解码器LLM是否比编码器模型提供更稳定的解释,以及成本与延迟方面会出现哪些权衡?*

先前工作提出了广泛的NLP解释方法,包括注意力可视化 Vaswani et al. (2017 (https://arxiv.org/html/2604.12069#bib.bib1))、基于梯度的归因 Sundararajan et al. (2017 (https://arxiv.org/html/2604.12069#bib.bib13)),以及基于扰动的技术如LIME Ribeiro et al. (2016 (https://arxiv.org/html/2604.12069#bib.bib11)) 和 SHAP Lundberg and Lee (2017 (https://arxiv.org/html/2604.12069#bib.bib12))。然而,稳健性分析主要集中于单一架构 Alvarez-Melis and Jaakkola (2018 (https://arxiv.org/html/2604.12069#bib.bib19));Lyu et al. (2024 (https://arxiv.org/html/2604.12069#bib.bib22)),或比较解释器而非模型家族 Atanasova et al. (2023 (https://arxiv.org/html/2604.12069#bib.bib39));Edin et al. (2025 (https://arxiv.org/html/2604.12069#bib.bib43))。另外,关于对抗性文本扰动 Jin et al. (2020 (https://arxiv.org/html/2604.12069#bib.bib23));Morris et al. (2020 (https://arxiv.org/html/2604.12069#bib.bib24)) 和 LLM 行为稳健性 Ackerman et al. (2024 (https://arxiv.org/html/2604.12069#bib.bib50));Zhang et al. (2025 (https://arxiv.org/html/2604.12069#bib.bib45)) 的工作展示了对输入变化的敏感性,但*跨架构的解释稳定性*——在统一的黑箱协议下评估并映射到部署权衡——仍未被充分刻画。

为填补这一空白,我们设计了一项预部署研究,模拟企业NLP系统中当模型仅通过受管端点或第三方API访问时如何评估可解释性。我们构建了一个统一的基于留一遮挡的黑箱评估框架,用于词级解释,并将稳健性操作化为在现实用户类扰动(包括交换、删除、打乱和回译,在多种严重程度下)下的解释稳定性。然后,我们将该框架一致应用于六个代表性模型,涵盖编码器和解码器家族(BERT、RoBERTa、Qwen 7B/14B、Llama 8B/70B),在三个文本分类基准上,生成了64,800对在匹配扰动和相同解释程序下的配对评估。

通过这一受控设置,我们观察到了一组明确的部署相关发现。解码器LLM产生的解释比编码器基线显著更稳定,平均翻转率低73%,并且解释稳定性随模型规模增大而进一步提升,从7B到70B参数提升44%。解码器的优势在破坏性扰动(如删除和重排序)下最为显著,这些扰动在企业真实文本流中常见,而保持语义的扰动对两类模型家族都产生低翻转率。最后,通过将稳定性增益与推理成本关联,我们的结果形成了一条实用的成本-稳定性权衡曲线,支持在合规敏感的企业部署中进行模型和解释选择。

参见说明图1:四阶段黑箱评估流水线。六个模型(跨越编码器和解码器家族)通过预测API访问;应用多级扰动(字符/词/句子,三个严重程度);统一的LOO遮挡解释器为原始和扰动输入生成重要性分数;翻转率和规模分析提供部署指导。各阶段对应§2.1–§2.4。
## 2 方法

我们的方法能够在反映现实企业部署约束的同时,公平比较编码器和解码器架构之间的解释稳健性。我们假设模型通常通过受管端点或第三方API提供服务,仅能获得输入输出访问,无法查询内部信号(如梯度或隐藏状态)。在此设置下,我们通过以下步骤评估稳健性:(i) 生成用户类输入扰动,(ii) 通过一个适用于两种架构的统一黑箱解释器生成词级解释,以及 (iii) 基于统计置信区间测量原始输入与扰动输入之间解释的稳定性。

### 2.1 黑箱评估设置

设X\\mathcal\{X\}表示自然语言文本空间,Y=\{y1,...,yK\}\\mathcal\{Y\}=\\\{y\_\{1\},\\ldots,y\_\{K\}\\\}为标签集。模型MM仅通过一个返回标签概率分布的预测接口访问:

M:X→Δ\(Y\),M:\\mathcal\{X\}\\rightarrow\\Delta\(\\mathcal\{Y\}\),\(1\)其中Δ\(Y\)\\Delta\(\\mathcal\{Y\}\)是Y\\mathcal\{Y\}上的概率单纯形。预测类记为

y^\(x\)=arg⁡maxy∈Y⁡P\(y∣x\),\\hat\{y\}\(x\)=\\arg\\max\_\{y\\in\\mathcal\{Y\}\}P\(y\\mid x\),\(2\)置信度为P\(y^\(x\)∣x\)P\(\\hat\{y\}\(x\)\\mid x\)。

黑箱约束禁止访问模型参数θ\\theta、中间表示hlh\_\{\\ell\}、梯度∇θ\\nabla\_\{\\theta\}或∇x\\nabla\_\{x\}、注意力权重AA,以及任何其他内部归因信号。这一假设匹配企业模型服务环境,其中出于安全、知识产权或合规原因访问受限。它也确保了跨架构的可比性:编码器模型暴露具有直接标签logits的分类头,而解码器LLM暴露自回归词元分布;允许白盒访问将允许架构特定的解释器并混淆跨家族比较。

为最小化与扰动无关的变化,我们尽可能进行确定性推理。对于依赖随机性的扰动和引导重采样,我们固定全局随机种子。对于解码器LLM,我们使用确定性解码(例如贪婪解码/温度设为0),使得解释的变化归因于输入修改而非采样噪声。

### 2.2 扰动框架

我们定义一个扰动算子πt,s:X→X\\pi\_\{t,s\}:\\mathcal\{X\}\\rightarrow\\mathcal\{X\},由扰动类型t∈Tt\\in\\mathcal\{T\}和严重程度s∈Ss\\in\\mathcal\{S\}参数化。给定原始输入xx,扰动输入为x~=πt,s\(x\)\\tilde\{x\}=\\pi\_\{t,s\}\(x\)。我们设S=\{0\.05,0\.10,0\.20\}\\mathcal\{S\}=\\\{0\.05,0\.10,0\.20\\\},控制字符级和词级扰动中修改位置的比例。

我们考虑跨越三个语言层次的扰动分类。字符级扰动模拟企业文本流(如工单、笔记和自由格式表单输入)中常见的拼写错误和微小编辑噪声。相邻字符交换操作随机交换选定位置的相邻字符,而字符删除操作删除随机选定的字符。对于具有CC个字符的输入,每个字符级算子修改⌊s⋅C⌋\\lfloor s\\cdot C\\rfloor个位置,受边界和有效性约束。

词级扰动模拟小规模编辑和部分改写。同义词替换使用WordNet Miller (1995 (https://arxiv.org/html/2604.12069#bib.bib32)) 替换选定词元;随机词删除删除选定词元;局部词打乱在有限窗口内对词进行重排序,反映现实重排序而非完全排列。对于具有nn个词的输入,每个词级算子修改⌊s⋅n⌋\\lfloor s\\cdot n\\rfloor个词。对于同义词替换,我们仅替换WordNet提供有效候选的词元,并避免替换仅标点或停用词;若无合适同义词,则跳过该位置并重新采样。

句子级改写通过回译实现,以捕获保留语义但改变表面形式的释义:

πbt\(x\)=MTde→en\(MTen→de\(x\)\)。\\pi\_\{\\text\{bt\}\}\(x\)=\\mathrm\{MT\}\_\{\\text\{de\}\\rightarrow\\text\{en\}\}\\big\(\\mathrm\{MT\}\_\{\\text\{en\}\\rightarrow\\text\{de\}\}\(x\)\\big\)。\(3\)回译作用于整个输入,其有效严重程度由翻译过程和输入长度决定,而非固定的词元比例。

为避免破坏意义或格式的退化扰动,我们应用基本保护措施。我们确保删除后至少保留一个内容词,并保留用于解码器分类的任何固定提示脚手架,使得扰动仅影响实例文本。对于每个\(t,s\)\(t,s\)配置,我们生成配对示例\(x,x~\)\(x,\\tilde\{x\}\),并跨模型保持配对固定,从而允许在相同扰动下进行配对稳定性比较。

### 2.3 基于遮挡的解释方法

为在不依赖内部信息的情况下比较编码器和解码器架构,我们采用统一的留一遮挡(LOO)解释器,仅需重复调用预测API。给定一个由nn个词组成的输入x=\[w1,...,wn\]x=\[w\_\{1\},\\ldots,w\_\{n\}\],首先计算模型对xx的预测y^\(x\)\\hat\{y\}\(x\)。对于每个词wiw\_\{i\},我们通过删除wiw\_\{i\}(保持其他词不变)创建遮挡输入x−ix\_\{\-i\},然后再次查询模型。我们将wiw\_\{i\}的重要性分数定义为原始预测类置信度的变化:

Imp\(wi;x\)=P\(y^\(x\)∣x\)−P\(y^\(x\)∣x−i\)。\\mathrm\{Imp\}\(w\_\{i\};x\)=P\(\\hat\{y\}\(x\)\\mid x\)\-P\(\\hat\{y\}\(x\)\\mid x\_\{\-i\}\)。\(4\)具有较大Imp\(wi;x\)\\mathrm\{Imp\}\(w\_\{i\};x\)的词被认为对模型决策更具影响力,解释是按重要性排序的词列表。此公式跨架构一致,并与向用户界面突出显示少数显著词元的做法一致。

对于编码器模型(BERT, RoBERTa),P\(y∣x\)P\(y\\mid x\)直接从分类头logits的softmax获得。对于解码器LLM(Qwen, Llama),我们将分类构建为指令遵循,并从固定提示下的下一个词元分布中提取标签概率。具体地,对于每个类yky\_\{k\},我们指定一个规范标签词元(或短字符串),并从模型关于标签集的归一化概率中计算P\(yk∣x\)P\(y\_\{k\}\\mid x\)。若一个类标签映射到多个词元,我们使用一致的聚合规则(例如序列对数概率之和)贯穿所有实验。相同的提示和概率提取过程用于原始输入和扰动输入,确保解释稳定性差异源于模型行为而非解释机制变化。

该解释器的计算成本与输入长度成比例,每个实例需要\(n\+1\)\(n\+1\)次查询。虽然对于始终在线的生产解释可能过于昂贵,但它非常适合预部署验证和选择性审计工作流,其中在黑箱访问下需要对解释稳定性进行稳健评估。

### 2.4 评估指标

我们的主要稳健性指标是翻转率(FR),衡量扰动后最重O要词发生变化的频率。设x~i=πt,s\(xi\)\\tilde\{x\}\_\{i\}=\\pi\_\{t,s\}\(x\_\{i\}\)表示xix\_\{i\}的扰动版本。令

top1\(x\)=arg⁡maxj∈\{1,...,n\}⁡Imp\(wj;x\)\\mathrm\{top\}\_\{1\}\(x\)=\\arg\\max\_\{j\\in\\\{1,\\ldots,n\\\}\}\\mathrm\{Imp\}\(w\_\{j\};x\)\(5\)表示在输入xx上由LOO重要性选出的顶级词。对于数据集D=\{xi\}i=1N\\mathcal\{D\}=\\\{x\_\{i\}\\\}\_\{i=1\}^\{N\},我们定义

FRt,s\(M,D\)=1N∑i=1N1\[top1\(xi\)≠top1\(x~i\)\]。\\mathrm\{FR\}\_\{t,s\}\(M,\\mathcal\{D\}\)=\\frac\{1\}\{N\}\\sum\_\{i=1\}^\{N\}\\mathbf\{1\}\\\!\\left\[\\mathrm\{top\}\_\{1\}\(x\_\{i\}\)\\neq\\mathrm\{top\}\_\{1\}\(\\tilde\{x\}

相似文章

应用于大语言模型的可解释性研究:对比分析

arXiv cs.CL

一项对比研究,评估了三种可解释性技术(Integrated Gradients、Attention Rollout、SHAP)在微调 DistilBERT 模型上的表现,用于情感分类任务,重点突出了基于梯度、基于注意力和模型无关方法在大语言模型可解释性中的权衡。