通过句子级能量景观解释黑盒大语言模型
摘要
本文提出了一种基于句子级能量景观的模型无关、事后解释框架,用于黑盒大语言模型。一个替代能量模型模拟目标LLM,一个轻量级解释器网络识别哪些提示句子对给定输出的影响最大,无需进一步的API调用。
arXiv:2608.02879v1 公告类型:新
摘要:专有大型语言模型(LLM)的广泛采用,且仅通过封闭API访问,给负责任部署带来了关键挑战:根本缺乏可解释性。为解决这一问题,我们提出了一种在句子级别运行的模型无关、事后归因解释器。我们的方法训练一个能量模型(EBM)作为替代,以捕捉LLM在提示和响应之间的内部概念一致性。该能量景观指导轻量级解释器网络的训练。独特的是,我们的解释器作为独立工具运行;一旦训练完成,它就能量化提示句子对用户指定目标输出的影响,而无需进一步向LLM发起API查询。通过在多样输入上全局训练本地解释器,我们的框架捕捉更广泛的生成模式并减轻实例特定偏差。实验表明,我们的EBM能准确模拟目标LLM,使解释器能够有效识别对生成特定目标输出最具影响力的提示句子。
查看缓存全文
缓存时间: 2026/08/05 07:38
# 解读黑盒大型语言模型:基于句子级能量景观 来源:https://arxiv.org/html/2608.02879 Maryam Rezaee、Pooriya Safaei、Maryam Asgarinezhad、S. Fatemeh Seyyedsalehi 伊朗德黑兰谢里夫理工大学数学科学系 [email protected], [email protected] [email protected], [email protected] ###### 摘要 通过严格封闭的API访问的专有大型语言模型(LLM)被广泛采用,这带来了一个关键挑战:根本性的可解释性缺失,进而对负责任的部署构成严峻考验。为解决这一问题,我们提出了一种模型无关的事后归因解释器,在句子层级上运作。我们的方法训练一个基于能量的模型(EBM)作为代理,以捕捉LLM在提示与响应之间的内部概念一致性。这一能量景观指导了一个轻量级解释器网络的训练。独特之处在于,我们的解释器作为独立工具运行;一旦训练完成,它便能量化提示句子对用户指定目标输出的影响,而无需再向LLM发起API查询。通过在多样化的输入上全局训练局部解释器,我们的框架能够捕捉更广泛的生成模式,并缓解实例特定的偏差。实验表明,我们的EBM能够准确模拟目标LLM,使解释器能有效识别出在生成特定目标输出时最具影响力的提示句子。 解读黑盒大型语言模型:基于句子级能量景观 Maryam Rezaee、Pooriya Safaei、Maryam Asgarinezhad、S. Fatemeh Seyyedsalehi 伊朗德黑兰谢里夫理工大学数学科学系 [email protected], [email protected] [email protected], [email protected] ## 1 引言 参见图注 图1:所提出框架的概述。黑盒LLM的提示和响应被分割为句子,并通过预训练模型进行嵌入。一个编码模块将这些嵌入映射到概念空间,在该空间中,接近度反映相关性。随后,一个交互模块评估输入与输出概念之间的一致性,以识别最具影响力的提示句子。这些模块利用一个模拟目标LLM生成过程的能量网络的信号进行训练。 大型语言模型(LLM)在复杂任务中展现了非凡的性能。因此,研究人员和开发者正迅速将其应用于各种场景。然而,这一应用进程面临的关键挑战是根本性的可解释性缺失。大多数强大的LLM都是专有的,并且只能通过封闭式API访问。即使架构和预训练数据集可用,其复杂性也掩盖了输出生成的确切方式。在医学和法律等高风险领域,这种不透明性是不可接受的,因为专家无法对照领域知识验证生成结果,也无法检测隐藏的偏差。这使得无法达到负责任的部署所要求的应用落地标准(Doshi-Velez 和 Kim,2017年 (https://arxiv.org/html/2608.02879#bib.bib30))。 事后归因是应对这种不透明性的主要方法。这类方法通过执行实例级特征选择来解释模型行为——这是一种可解释性范式,用于识别一个重要性向量,该向量衡量每个特定输入特征对给定实例预测的影响程度(Chen 等人,2018年 (https://arxiv.org/html/2608.02879#bib.bib2))。然而,标准的归因技术,包括白盒方法和模型无关方法,在LLM场景中面临重重困难。白盒方法依赖梯度或激活,与封闭式API不兼容。此外,诸如注意力权重等常用代理指标的忠实性也受到质疑(Jain 和 Wallace,2019年 (https://arxiv.org/html/2608.02879#bib.bib36))。模型无关的方法确实存在(Ribeiro 等人,2016年 (https://arxiv.org/html/2608.02879#bib.bib41);Lundberg 和 Lee,2017年 (https://arxiv.org/html/2608.02879#bib.bib39);Seyyedsalehi 等人,2024年 (https://arxiv.org/html/2608.02879#bib.bib34)),但通常面向具有明确定义输出的判别模型。解释生成模型要困难得多,因为该问题从根本上是不适定的。这类模型利用复杂的表示来产生文本等高维输出。因此,输出的交互性和海量体积阻碍了有效解释(Schneider,2024年 (https://arxiv.org/html/2608.02879#bib.bib42))。 基于提示的自我解释等替代方案(Wei 等人,2022年 (https://arxiv.org/html/2608.02879#bib.bib48))同样存在问题;它们依赖于我们试图验证的同一过程,导致循环论证和动机性推理。因此,模型常常产生听起来合理但不够忠实的虚构内容(Turpin 等人,2023年 (https://arxiv.org/html/2608.02879#bib.bib47))。虽然自动化提示工程可以引导模型行为以缓解偏差,但它并不适合解释任务。这些方法针对预定义目标优化指令(Zhou 等人,2023年 (https://arxiv.org/html/2608.02879#bib.bib53);Clemmer 等人,2024年 (https://arxiv.org/html/2608.02879#bib.bib14)),使其无法用于模糊的解释任务。 为应对这些局限,我们提出了一种模型无关的事后归因解释器。我们与标准方法的不同之处在于,将解析粒度从有噪声的token转移到连贯的句子,我们将其定义为"概念",目标是在这一概念层级上将输出的元素直接关联到用户提示。虽然近期机制性研究将概念定义为潜在激活向量(Gao 等人,2025年 (https://arxiv.org/html/2608.02879#bib.bib4))或不同的架构瓶颈(Sun 等人,2025年 (https://arxiv.org/html/2608.02879#bib.bib3)),我们则采用一种适合黑盒分析的命题性定义。根据语境原则(Frege,1991年 (https://arxiv.org/html/2608.02879#bib.bib8)),没有命题结构,单个token在语义上仍然模糊;而句子代表一个完整的思想(Kintsch,1998年 (https://arxiv.org/html/2608.02879#bib.bib9)),可作为稳健的操作性概念,捕捉LLM生成所必需的因果关系。 形式上,给定提示x\mathbf{x}和LLM响应y\mathbf{y},我们针对输出y的特定子集yT⊂y\mathbf{y}_T \subset \mathbf{y}。然后生成一个重要性向量,以识别提示x中在生成yT\mathbf{y}_T时最具影响力的句子子集xS⊂x\mathbf{x}_S \subset \mathbf{x}。我们采用一种独特的范式来全局训练局部解释器。与仅观察紧邻区域的局部解释器(如LIME(Ribeiro 等人,2016年 (https://arxiv.org/html/2608.02879#bib.bib41)))不同——后者常导致可解释性幻觉(Friedman 等人,2024年 (https://arxiv.org/html/2608.02879#bib.bib32))——我们在更广泛的分布上进行训练。这使我们的模型能够捕捉全局生成模式并缓解内在偏差。图1 (https://arxiv.org/html/2608.02879#S1.F1) 展示了该方法的总体概览。 我们首先训练一个基于Transformer的能量模型(EBM),作为黑盒LLM的代理。我们选择EBM的动机源于**生成**与**解释**之间的区别。自回归模型在局部生成文本,而解释一个思想可以依赖于提示与响应之间的**全局**一致性。EBM将句子映射到一个潜在的"概念空间",该空间模拟目标LLM中嵌入的概念级关系,并学习一个标量能量函数来度量这种兼容性;这避免了在庞大的可能输出句子空间上对概率进行归一化这一棘手的难题。然后,我们利用这一能量景观来指导解释器网络的训练。给定一个提示和目标输出子集,解释器生成一个重要性向量,以分离出对生成该响应最具影响力的提示句子。 总而言之,我们的框架做出了三项核心贡献:(1)将分析单元从有噪声的token转移到句子,以实现人类可理解的概念级归因;(2)引入一种基于Transformer的EBM,配备新颖的采样方法,能够学习提示与响应上的代理随机场,旨在稳健地建模真实的输入-输出动态;(3)提出一种事后、模型无关的黑盒LLM解释框架,能够找到触发LLM输出的目标子集的特定提示句子。 ## 2 相关工作 ### 2.1 事后解释方法 归因方法对输入特征对于特定模型输出的重要性进行评分。白盒归因方法通常利用梯度,将显著的输出信号传播回输入token(Simonyan 等人,2014年 (https://arxiv.org/html/2608.02879#bib.bib44);Sundararajan 等人,2017年 (https://arxiv.org/html/2608.02879#bib.bib45);Shrikumar 等人,2017年 (https://arxiv.org/html/2608.02879#bib.bib43);Chefer 等人,2021年 (https://arxiv.org/html/2608.02879#bib.bib27))。其他方法则使用内部注意力权重作为特征重要性的代理(Xu 等人,2015年 (https://arxiv.org/html/2608.02879#bib.bib50);Li 等人,2017年 (https://arxiv.org/html/2608.02879#bib.bib38);Xie 等人,2017年 (https://arxiv.org/html/2608.02879#bib.bib49);Hao 等人,2021年 (https://arxiv.org/html/2608.02879#bib.bib35))。然而,对于专有API而言,梯度不可获取,而注意力权重往往无法忠实反映生成过程(Jain 和 Wallace,2019年 (https://arxiv.org/html/2608.02879#bib.bib36))。同样,影响函数提供了以数据为核心的解释(Koh 和 Liang,2017年 (https://arxiv.org/html/2608.02879#bib.bib20)),但在无法访问基础数据或模型Hessian矩阵的情况下仍然不可行。 基于扰动的方法(Ribeiro 等人,2016年 (https://arxiv.org/html/2608.02879#bib.bib41);Lundberg 和 Lee,2017年 (https://arxiv.org/html/2608.02879#bib.bib39);Yin 和 Neubig,2022年 (https://arxiv.org/html/2608.02879#bib.bib51))通过度量对输入改动的敏感性提供了一种模型无关的替代方案,Hackmann 等人(2024年 (https://arxiv.org/html/2608.02879#bib.bib33))采用这一策略来识别LLM提示中的关键词语。其他基础性工作,如Chen 等人(2018年 (https://arxiv.org/html/2608.02879#bib.bib2)),将这一问题框架化为实例级特征选择,通过训练解释器网络来最大化互信息。然而,这些方法在生成任务上的计算成本高得令人望而却步(Enouen 等人,2024年 (https://arxiv.org/html/2608.02879#bib.bib31);Zhao 和 Shan,2024年 (https://arxiv.org/html/2608.02879#bib.bib52))。因此,近期工作探索训练语言模型以生成答案分解,作为归因的中间步骤(Balasubramanian 等人,2025年 (https://arxiv.org/html/2608.02879#bib.bib6)),或提出代理框架来模拟LLM的思考过程(Chen 等人,2026年 (https://arxiv.org/html/2608.02879#bib.bib7))。与这些需要模型微调或内部访问权限的方法不同,我们的方法在黑盒约束下采用模拟和分解策略。最后,基于提示的自我解释利用了LLM自身的生成能力。最引人注目的是,思维链(CoT)等技术要求模型生成一个推理过程来证明其输出的合理性(Wei 等人,2022年 (https://arxiv.org/html/2608.02879#bib.bib48))。虽然颇具说服力,但这些解释缺乏忠实性保证;它们往往代表合理的"事后合理化"(post-hoc rationalization),而非真实的内部计算路径(Turpin 等人,2023年 (https://arxiv.org/html/2608.02879#bib.bib47))。 ### 2.2 NLP中的基于能量的模型 基于能量的模型(EBM)为建模文本等高维结构化输出提供了独特优势,因为它们不需要归一化的概率分布(LeCun 等人,2006年 (https://arxiv.org/html/2608.02879#bib.bib10))。标准概率模型必须对所有可能的输出求和为一,这在语言领域是难以处理的。EBM通过学习标量兼容性分数来规避这一问题,其中低能量对应高数据密度。在自然语言处理(NLP)中,有几种范式将EBM直接集成到生成过程中以优化输出。残差EBM方法在自回归对数概率上添加一个修正能量项,以捕捉连贯性等高层次属性(Deng 等人,2020年 (https://arxiv.org/html/2608.02879#bib.bib28);Bakhtin 等人,2021年 (https://arxiv.org/html/2608.02879#bib.bib24))。或者,EBM通过知识蒸馏为学生网络定义目标能量景观(Tu 等人,2020年 (https://arxiv.org/html/2608.02879#bib.bib46))。最近,Xu 等人(2025年 (https://arxiv.org/html/2608.02879#bib.bib5))将这些原理扩展到扩散语言模型,验证了能量景观能够有效建模现代文本生成中复杂的高维分布。 除了直接生成之外,EBM作为整体评估器和事后排序器也表现出色。Bakhtin 等人(2019年 (https://arxiv.org/html/2608.02879#bib.bib23))证明了基于Transformer的判别器可以作为EBM来区分人类文本与机器文本。这种评估能力自然延伸到事后精炼流程中,EBM在其中充当重排序器以选择最高质量的候选(Bhattacharyya 等人,2021年 (https://arxiv.org/html/2608.02879#bib.bib26)),或显式建模奖励分布以在无需重新训练的情况下稳健地对齐语言模型(Lochab 和 Zhang,2025年 (https://arxiv.org/html/2608.02879#bib.bib1))。 ### 2.3 基于概念的解释 可解释性研究正转向基于概念的解释方法,即将决策映射到人类可理解的思想上(Kim 等人,2018年 (https://arxiv.org/html/2608.02879#bib.bib37))。虽然机制性方法如今主导了白盒场景——利用稀疏自编码器来解耦多义神经元(Gao 等人,2025年 (https://arxiv.org/html/2608.02879#bib.bib4))或使用概念瓶颈层(Sun 等人,2025年 (https://arxiv.org/html/2608.02879#bib.bib3))——但它们需要内部访问权限。我们则通过将决策映射到命题而非潜在特征来处理黑盒场景。这种粒度与要求以命题证据而非孤立token来保证忠实性的理由评估标准相一致(DeYoung 等人,2020年 (https://arxiv.org/html/2608.02879#bib.bib16))。我们的工作将"句子"定义为基本概念单元并付诸实践,依托其表达完整思想的能力来支撑解释。 将句子作为语义对象的做法在语言建模历史上具有充分依据。BERT等基础架构使用下一句预测来学习逻辑关系(Devlin 等人,2019年 (https://arxiv.org/html/2608.02879#bib.bib29))。后续的Sentence-BERT工作证实,经过微调的句子表示会将相似含义映射到向量空间中邻近的不同点上(Reimers 和 Gurevych,2019年 (https://arxiv.org/html/2608.02879#bib.bib40))。通过将句子用作概念,我们的工作与近期架构创新(如大型概念模型,Large Concept Models)相呼应,后者将核心计算单元从token转移到句子级表示(Barrault 等人,2024年 (https://arxiv.org/html/2608.02879#bib.bib25))。 ## 3 方法 参见图注 (a) 参见图注 (b) 图2:架构概述。(a) 能量函数ELM\mathcal{E}_的示意图
相似文章
EnvSimBench:用于评估和改善基于大语言模型的环境模拟的基准
本文介绍了 EnvSimBench,这是一个用于评估大语言模型在智能体训练中模拟环境能力的基准。它指出了当前大语言模型中存在的“状态变化悬崖”问题,并提出了一种约束驱动的流水线以减少幻觉和降低成本。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。
@hillbig: 大型语言模型被认为不仅预测下一个token,还会在内部维持中间概念……
本文引入雅可比透镜(J-lens)和J-空间,表明像Claude Sonnet 4.5这样的LLM维护着可语言化的内部表征,这些表征像一个全局工作空间,因果性地用于灵活推理——通过干预实验进行了验证。
理解大型语言模型
本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。
评估大语言模型作为动力系统的可解释控制器
本文评估了大语言模型是否可以作为动力系统的可解释控制器,特别是针对热环境。研究发现,高复杂度模型如Qwen-3 14B和GPT-4o能够实现精确的控制和连贯的推理,而较小模型则表现不佳,凸显了混合基于模型和语言驱动的控制策略的潜力。