从看似合理到可行:关于LLM自我解释的立场

arXiv cs.CL 论文

摘要

本文(立场论文)认为,LLM自我解释可能看似合理、忠实度存疑,但具有高度可行性,并提出了超越传统指标的评估指南。

arXiv:2607.15957v1 公告类型:新 摘要:大型语言模型(LLMs)能够生成解释自身决策的自然语言解释,这种现象通常被称为自我解释。这类解释已成为可解释人工智能(XAI)的一个有前途的方向,特别是在解释LLM行为方面。然而,尽管自我解释通常看起来合理,但它们是否忠实反映了模型内部推理过程仍是一个悬而未决的问题。在这篇观点论文中,我们认为自我解释可能高度合理、忠实度存疑,但极具可行性。从传统XAI角度出发,我们指出了针对LLM生成的自我解释的标准评估协议的局限性,并提出了评估其合理性和忠实度的实用指南。此外,我们认为评估应超越这些标准,扩展到可行性,突出LLM理性化能力在支持不同利益相关者做出明智决策和采取适当行动中的应用。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:36

# 从可信到可行动:关于LLM自我解释的立场
来源:https://arxiv.org/html/2607.15957
Benedetta Muscato Scuola Normale Superiore,意大利比萨 比萨大学,意大利比萨 benedetta\.muscato@sns\.it Elize Herrewijnen1,2,Benedetta Muscato3,4,Gizem Gezici3,Fosca Giannotti3 1乌得勒支大学,荷兰乌得勒支 2荷兰警察AI实验室,荷兰警察,德里贝亨,荷兰 3Scuola Normale Superiore,意大利比萨 4比萨大学,意大利比萨 通讯作者:e\.herrewijnen@uu\.nl(https://arxiv.org/html/2607.15957v1/mailto:email@domain)

###### 摘要

大型语言模型(LLMs)能够生成自然语言解释,为其自身决策提供合理解释,这种现象通常被称为自我解释。这类解释已成为可解释人工智能(XAI)的一个有前景的方向,尤其在解释LLM行为方面。然而,尽管自我解释通常显得可信,它们是否真实反映模型的底层推理过程仍是一个悬而未决的问题。在这篇观点文章中,我们认为自我解释可能高度可信,但忠实性存疑,然而却极具可行动性。从传统XAI视角出发,我们指出现有LLM生成自我解释评估协议中的局限性,并提出评估其可信度与忠实性的实用指南。此外,我们认为评估应超越这些标准,扩展到可行动性,强调LLM理性化能力在支持不同利益相关者做出知情决策和采取适当行动方面的应用。

从可信到可行动:关于LLM自我解释的立场

## 1 引言

大型语言模型(LLMs)的出现改变了可解释人工智能(XAI)的格局,在创造新机遇的同时也带来了重大挑战。随着LLMs越来越多地集成到实际应用中,它们的解释应适应不同利益相关者的多样化目标、专业知识和技术背景,从而培养基于信息的信任(Calderon and Reichart,2025(https://arxiv.org/html/2607.15957#bib.bib112))。

传统的后验XAI方法生成特征归因,通常使用LIME等代理模型(Ribeiro等人,2016(https://arxiv.org/html/2607.15957#bib.bib71))。这些方法通常产生直观的解释,例如通过高亮影响预测的输入标记,使其相对易于被利益相关者理解。然而,其计算成本限制了在拥有数千亿参数的现代LLM上的可扩展性(Jean-Quartier等人,2023(https://arxiv.org/html/2607.15957#bib.bib106))。机械可解释性通过逆向工程模型的内部表示和计算机制提供了一种补充方法(Somvanshi等人,2026(https://arxiv.org/html/2607.15957#bib.bib56);Bereska,2022(https://arxiv.org/html/2607.15957#bib.bib55);Ranaldi,2025(https://arxiv.org/html/2607.15957#bib.bib54)),但其复杂性限制了只有具备高级专业知识的利益相关者才能使用(Wilde and Rugolon,2025(https://arxiv.org/html/2607.15957#bib.bib4))。

LLM生成的自我解释(以下简称自我解释)已成为弥合这一差距的有前途方向。LLM无需依赖外部解释方法或探测内部机制,即可生成其输出的自然语言解释(Fayyaz等人,2024(https://arxiv.org/html/2607.15957#bib.bib27);Palta等人,2026(https://arxiv.org/html/2607.15957#bib.bib31);Ajwani等人,2025(https://arxiv.org/html/2607.15957#bib.bib83)),或通过思维链(CoT)提示生成中间推理(Wei等人,2022(https://arxiv.org/html/2607.15957#bib.bib39))。自我解释的自然语言形式常常营造出透明性与人类推理一致性的强烈印象(Chen等人,2026(https://arxiv.org/html/2607.15957#bib.bib34);Barez等人,2025(https://arxiv.org/html/2607.15957#bib.bib35)),使其在高风险应用中尤其具有吸引力。例如,在医疗保健领域,LLMs越来越多地被探索用于临床决策支持和面向患者的应用,可理解的解释有助于在临床医生和患者间建立信任(Afolabi等人,2026(https://arxiv.org/html/2607.15957#bib.bib105))。

尽管自我解释在说明LLM决策方面看起来很有前途,同时仍保持对许多利益相关者的可及性,但这并不必然意味着自我解释符合人类期望或真实反映模型的底层决策过程。这一区别由XAI中的两个核心概念捕捉:可信度和忠实性。*可信度*指一个解释看起来有多令人信服或与人类推理一致(Jacovi and Goldberg,2021(https://arxiv.org/html/2607.15957#bib.bib17);Palta等人,2026(https://arxiv.org/html/2607.15957#bib.bib31);Lyu等人,2024(https://arxiv.org/html/2607.15957#bib.bib82)),而*忠实性*指其准确反映模型底层决策过程的程度(DeYoung等人,2020(https://arxiv.org/html/2607.15957#bib.bib91);Lyu等人,2024(https://arxiv.org/html/2607.15957#bib.bib82))。

#### 贡献

在这篇立场论文中,我们认为自我解释可能高度可信但忠实性存疑。我们通过指出现有自我解释评估协议的局限性来支持我们的立场,并提供评估可信度和忠实性的实用指南(§2(https://arxiv.org/html/2607.15957#S2))。鉴于这些局限性,我们主张将焦点转向自我解释的*可行动性*,即它们帮助利益相关者做出知情决策并采取具体行动的能力(Orgad等人,2026(https://arxiv.org/html/2607.15957#bib.bib103))。为此,我们概述了一项研究议程,将自我解释重新定位为不具备技术专业知识的利益相关者的沟通界面,作为支持人类决策和促进不同视角审议的工具(§3(https://arxiv.org/html/2607.15957#S3))。总体而言,我们呼吁超越将可信度和忠实性作为自我解释的主要目标,转而强调其在支持知情决策方面的可行动性价值。

## 2 自我解释:高度可信,忠实性存疑

XAI方法生成的解释通常沿两个关键维度进行评估:可信度和忠实性(Doshi-Velez and Kim,2017(https://arxiv.org/html/2607.15957#bib.bib72);Hase and Bansal,2020(https://arxiv.org/html/2607.15957#bib.bib68))。接下来,我们审视将标准XAI评估协议应用于自我解释的局限性,并提出评估其可信度和忠实性的实用指南。

### 2.1 可信度

先前工作已表明,自我解释通常高度可信且与人类期望高度一致(Palta等人,2026(https://arxiv.org/html/2607.15957#bib.bib31);Ajwani等人,2025(https://arxiv.org/html/2607.15957#bib.bib83);Fan等人,2026(https://arxiv.org/html/2607.15957#bib.bib14))。促成这种高可信度的一个因素是LLM的谄媚行为,即模型倾向于同意或讨好利益相关者(Malmqvist,2025(https://arxiv.org/html/2607.15957#bib.bib22);Wang等人,2026(https://arxiv.org/html/2607.15957#bib.bib24))。结果,利益相关者更可能接受与其期望或既有信念一致的解释。此外,Palod等人(2026(https://arxiv.org/html/2607.15957#bib.bib90));Agarwal等人(2024(https://arxiv.org/html/2607.15957#bib.bib15))指出,LLM被优化以生成连贯且有用的回应,这加上自然语言解释的可及性,可以增加其感知到的可解释性(Madsen等人,2024a(https://arxiv.org/html/2607.15957#bib.bib110);Kunz and Kuhlmann,2024(https://arxiv.org/html/2607.15957#bib.bib111))。

自我解释的高可信度也可归因于可信度的评估方式。在大多数研究中,可信度要么通过人类评分评估(Palta等人,2026(https://arxiv.org/html/2607.15957#bib.bib31);Ajwani等人,2025(https://arxiv.org/html/2607.15957#bib.bib83);Fan等人,2026(https://arxiv.org/html/2607.15957#bib.bib14)),要么通过将生成的解释与人类解释进行比较来评估(例如,Fayyaz等人(2024(https://arxiv.org/html/2607.15957#bib.bib27));DeYoung等人(2020(https://arxiv.org/html/2607.15957#bib.bib91));Di Bonaventura等人(2024(https://arxiv.org/html/2607.15957#bib.bib42)))。虽然这些方法捕捉了可信度的重要方面,但我们认为它们忽略了两个关键要素。

#### 可信度评估未考虑利益相关者的专业知识。

Doshi-Velez and Kim (2017)(https://arxiv.org/html/2607.15957#bib.bib72)提出了包括任务专家(例如医生)和普通用户在内的解释评估,其中专家评估侧重于任务上下文中的解释质量,而普通用户评估则捕捉更一般的解释质量概念。这一区分对于评估可信度至关重要,因为利益相关者判断解释的能力取决于其专业知识。例如,在医疗诊断任务中,非专家利益相关者可能认为带有技术术语的解释令人信服,而医生可能会识别出有缺陷的推理或幻觉内容,并认为其可信度较低。因此,可信度评估取决于利益相关者的专业知识和背景,应当相应地进行收集和评估。

#### 可信度评估未包容变异。

通常,可信度通过将模型的解释与人类解释进行比较来衡量,越接近则意味着可信度越高。然而,这种方法忽略了人类在解释同一决策时的差异,尤其是对于模糊或主观性任务。例如,在仇恨言论检测中,标注者可能根据其背景和价值观对相同内容做出不同理解,并提供不同的标签和解释。这种差异自然源于实例难度、任务模糊性和主观解释(Plank,2022(https://arxiv.org/html/2607.15957#bib.bib115);Kulmizev等人,2026(https://arxiv.org/html/2607.15957#bib.bib109))。因此,依赖单一参考解释可能会将多样化但合理的观点压缩为一种标准。为了更好地反映人类推理,可信度评估应通过将评估指标与任务对齐并由领域专家验证,容纳多种有效解释(Muscato等人,2026(https://arxiv.org/html/2607.15957#bib.bib93))。因此,在模糊或主观任务中,可信度评估应包容变异,因为可能存在多种有效解释,而不应依赖单一参考解释作为确定性标准。

### 2.2 忠实性

越来越多的研究质疑自我解释是否满足忠实性要求(Paul等人,2024(https://arxiv.org/html/2607.15957#bib.bib6);Lanham等人,2023(https://arxiv.org/html/2607.15957#bib.bib5);Turpin等人,2023(https://arxiv.org/html/2607.15957#bib.bib7);Lewis-Lim等人,2025(https://arxiv.org/html/2607.15957#bib.bib89);Madsen等人,2024b(https://arxiv.org/html/2607.15957#bib.bib29);Colegado等人,2026(https://arxiv.org/html/2607.15957#bib.bib30))。我们认为自我解释忠实性存疑,主要原因有三。

首先,LLM无法访问生成其输出的内部过程。正如Sarkar (2024b)(https://arxiv.org/html/2607.15957#bib.bib18)所论证的,自我解释通过与预测相同的过程生成,无法获取关于预测过程本身的元信息。因此,自我解释不太可能反映真正的内省分析。其次,忠实性解释需要将决策制定与解释生成分离。然而,提示模型解释其预测可能影响决策过程本身,这从自我解释对预测准确性的观察影响中可见一斑(Li等人,2023(https://arxiv.org/html/2607.15957#bib.bib116))。第三,LLM可能因谄媚行为、幻觉或偏见而提供连贯但误导性的理由(Feng等人,2026(https://arxiv.org/html/2607.15957#bib.bib21)),令人怀疑自我解释是否反映了其决策的真正原因。因此,当模型产生不正确或幻觉输出时(Lin等人,2025(https://arxiv.org/html/2607.15957#bib.bib25)),其解释仍可能呈现连贯但误导性的正当理由,引发对所报告理由是否真正对应于决策根本原因的担忧。

尽管存在上述担忧,仍有几项研究调查了自我解释的忠实性(Paul等人,2024(https://arxiv.org/html/2607.15957#bib.bib6);Huang等人,2023(https://arxiv.org/html/2607.15957#bib.bib74);Mayne等人,2026(https://arxiv.org/html/2607.15957#bib.bib13);Turpin等人,2023(https://arxiv.org/html/2607.15957#bib.bib7))。虽然我们鼓励调查自我解释的忠实性,但我们认为现有忠实性评估方法并不适用于自我解释。其中许多方法基于扰动,即扰动模型输入(例如移除解释中的词语),并比较这些扰动输入下的模型输出(即预测)(Ribeiro等人,2016(https://arxiv.org/html/2607.15957#bib.bib71);Huang等人,2023(https://arxiv.org/html/2607.15957#bib.bib74);Fayyaz等人,2024(https://arxiv.org/html/2607.15957#bib.bib27);DeYoung等人,2020(https://arxiv.org/html/2607.15957#bib.bib91))。这些方法依赖于Jacovi and Goldberg (2020)(https://arxiv.org/html/2607.15957#bib.bib26)提出的三个假设:模型假设、预测假设和线性假设。对于LLM和自我解释而言,这些假设不成立,主要原因有三。

#### 忠实性评估忽略了LLM中的非确定性。

Jacovi and Goldberg (2020)(https://arxiv.org/html/2607.15957#bib.bib26)确定的第一个假设是*模型假设*,即“两个模型当且仅当使用相同推理过程时才会做出相同预测”。这一假设对于LLM来说有问题,因为其非确定性本质意味着相同输入在多次运行中不一定产生相同输出,这种变异性也延伸至其自我解释(Astekin等人,2024(https://arxiv.org/html/2607.15957#bib.bib75);Atıl等人,2025(https://arxiv.org/html/2607.15957#bib.bib70))。此外,Bogaert等人(2025(https://arxiv.org/html/2607.15957#bib.bib84))提供了经验证据,表明具有等效预测性能的模型仍可为其决策生成显著不同的解释。因此,忠实性评估应考虑LLM的非确定性行为,而不应依赖单次运行输出作为忠实性的确凿证据。

#### 忠实性评估未考虑LLM中的提示敏感性。

第二个假设是*预测假设*,即“在相似输入上,当且仅当推理相似时,模型做出相似决策”。

相似文章

LLMs 并非你所认为的黑箱

Hacker News Top

一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。

言行而非推理:定位LLM智能体中的忠实度缺口

arXiv cs.AI

本文通过使用德州扑克作为受控环境,将LLM智能体中的忠实度缺口分解为推理→结论和结论→行动两个步骤。研究发现,结论→行动步骤是可靠的,而推理→结论步骤是不一致的主要来源。