FCx:一种寻找可行反事实解释的算法

arXiv cs.LG 论文

摘要

本文提出了FCx,一种通过使用改进的Variational Autoencoder和因果推断来生成可行反事实解释的算法,以确保修改是现实的、低成本的,并与现实世界的变化兼容。

arXiv:2609.19383v1 公告类型:新 摘要:反事实(CF)解释识别改变输入分类的变化。虽然现有方法生成现实且低成本的CF,但它们往往无法确保可行性,建议非建设性的修改或与未来变化不兼容(例如,改变个人的种族以获得工作机会)。我们引入了CF解释的细化,以明确强制执行可行性。我们的方法是第一个高效生成现实、低成本且可行的CF的方法。我们同时适应由领域知识用户指定的硬性可行约束,以及通过因果推断从数据集中自动推断的软性可行约束。我们的方法,可行反事实解释(FCx),基于一个改进的Variational Autoencoder(VAE),使用多因子损失函数进行优化。我们基于值的绝对变化(接近度)和特征变化的数量(稀疏性)来衡量变化的成本,而现实性则基于LOF的密度估计来衡量,保证CF位于密集区域。在四个公共数据集上的大量实验表明,我们的方法在多个指标上匹配最先进的性能,同时保证可行性。
查看原文
查看缓存全文

缓存时间: 2026/09/18 08:54

# FCx:一种寻找可行反事实解释的算法
来源:https://arxiv.org/html/2609.19383
马尔库·克列奥帕特拉 邮箱:[[email protected]](mailto:[email protected]) 所属机构:雅典国立卡波季斯蒂安大学,信息与通信系,希腊雅典
瓦娜·卡洛格拉基 邮箱:[[email protected]](mailto:[email protected]) 所属机构:雅典经济与商业大学,信息系,希腊雅典
古诺普洛斯·迪米特里奥斯 邮箱:[[email protected]](mailto:[email protected]) 所属机构:雅典国立卡波季斯蒂安大学,信息与通信系,希腊雅典

© 无

###### 摘要

反事实(CF)解释用于识别能改变输入分类结果的变化。虽然现有方法能生成真实且低成本的反事实,但它们常常无法确保可行性,可能提出非建设性的修改建议或与未来变化不兼容的方案(例如,为获得工作录用而改变个人的种族)。我们提出了一种反事实解释的改进方法,明确地强制执行可行性约束。我们的方法首次能够高效地生成真实、低成本且可行的反事实。我们既考虑由领域知识用户指定的硬性可行约束,也考虑通过因果推断从数据集中自动推断出的软性可行约束。我们的方法——可行反事实解释(FCx)——基于一个经过多因素损失函数优化的改进变分自编码器(VAE)。我们基于值的绝对变化(邻近性)以及改变特征的数量(稀疏性)来衡量变化的成本,而真实性则通过LOF密度估计来衡量,确保反事实位于数据密集区域。在四个公共数据集上的大量实验表明,我们的方法在多个指标上达到了最先进的性能,同时保证了可行性。

###### 关键词:

可行性,反事实解释,稀疏性,密度估计,因果性

## 1. 引言

理解预测输出是任何机器学习(ML)模型的关键要素。研究人员经常质疑模型的预测是否具有可解释性且适用于现实场景。在包括刑事司法、临床医疗、贷款审批和招聘决策在内的各个领域,系统提供有效解释的能力对于指导未来行动至关重要。此外,(Wachter等人,2018)详细阐述了个人在个人数据被用于类似场合时,就输出结果获得解释所拥有的法律权利。鉴于这些考虑,使ML模型更具可解释性,并为个人提供关于如何获得期望预测结果的可操作见解至关重要(Miller,2019)。反事实(CF)解释(Wachter等人,2018)作为一种广泛使用的局部解释形式,因为它们与ML模型保持一致,同时保持可解释性。一个局部的CF解释指的是输入特征的微小扰动,这些扰动保持与原始实例接近,但导致不同的模型预测。

一个常用来解释这个概念的例子是回答“个人应该做出哪些改变才能获得当前被拒绝的贷款?”任何将模型的决策从原始类别转变为所需类别的潜在修改都被视为CF示例。图1(https://arxiv.org/html/2609.19383#S1.F1)展示了两个反事实示例的视觉说明,两者在技术上都是有效的;然而,它们是被归类为可行还是不可行,取决于它们在多大程度上满足了模型的预定义约束。

(请参见图例)图1. 可行与不可行反事实解释的示例

然而,关于这些示例出现了几个问题。这些修改实际上都适用于现实世界吗?所有的CF解释都容易适应现实世界的应用吗?答案是否定的。机器学习模型可以从数据分布中学习模式并尝试模仿,但它缺乏逻辑。它产生的结果无法应用于多因素的现实场景。因此,看到CF示例建议不可能实现的目标是很常见的(见图1(https://arxiv.org/html/2609.19383#S1.F1))。例如,一个招聘申请会建议候选人获得一个两个月内完成的学位,或者在极端情况下,变年轻以获得特定工作,而这些建议对用户来说都是不可行且无用的。解决可行性至关重要,因为反事实解释通常被解释为如何获得期望结果的实践指南(例如,确保未来的贷款批准)。当反事实不可行或依赖于特征空间中稀疏、不可靠区域的模型行为时,它们可能会误导甚至在某些情况下冒犯接收者,破坏信任并降低其实用性(Poyiadzi等人,2020;Mothilal等人,2020;Verma等人,2024)。

我们通过强制执行能促进(i)现实世界适用性、(ii)真实性以及(iii)特征间因果约束一致性的约束来处理可行性问题,从而产生既有效又有意义的反事实场景。制定此类约束有两种主要方法。首先,领域专家可以提供先验知识来手动建立逻辑约束(Mahajan等人,2019)(硬性因果可行性约束)。其次,可以使用因果发现算法来识别数据集内的现有依赖关系,从而构建完全或部分的因果图(软性因果可行性约束)。在这项工作中,我们介绍了一种简单有效的方法,可以在确保遵守这两种因果约束的同时,有效地生成CF示例。

一个CF示例可能潜在可行,但根据我们看到的概率分布,它可能不太可能出现。重要的是提供高概率位于数据密集区域的CF示例。因此,为了使我们的模型稳健,除了可行性之外,我们还采用了其他标准来确定是否选择一个CF示例。在我们的工作中,我们使用了一种统计上的先进技术,该技术首先帮助我们估计潜在空间的密度,然后学习在这些密集区域生成CF示例,从而消除异常值。图2(https://arxiv.org/html/2609.19383#S1.F2)展示了我们的目标之一:识别一个点更可能是可行CF示例的密集区域。我们的网络被训练为在数据密集区域(灰色区域)生成CF示例,并排除异常值。橙色点代表可行的CF示例,蓝色点代表不可行的CF示例,绿色点则是异常值。这项技术可以通过让模型学会位于更密集的区域,而不是分散在整个空间中,从而增加找到可行CF示例的概率。我们选择使用基于密度的LOF技术(Breunig等人,2000)来消除CF异常值。我们在变分自编码器模型(Kingma和Welling,2013)的低维潜在空间z中应用该技术,因为基于密度的技术在低维空间中效果更好。直观地说,我们的目标是生成可能是真实示例并位于数据密集区域的CF示例。这是在训练VAE并构建其损失函数以满足我们的要求后实现的。

(请参见图例)图2. 展示了位于密集数据区域之外的异常值CF示例存在的示意图

反事实(CF)解释必须为个人提供可操作的替代方案,帮助他们找到适应现实情况的解决方案。然而,一个重要的考虑是确定解决方案因过度修改而变得不切实际的点。用户通常倾向于通过最少的调整来实现他们期望的结果。这突出了量化所需变更数量指标的需求。

为了解决这个问题,我们在方法中引入了稀疏性约束,在减少不必要更改的同时提高了模型的稳健性(Virgolin和Fracaros,2023)。如图3(https://arxiv.org/html/2609.19383#S1.F3)所示,三个可行的CF示例建议了个人获得贷款的不同方式。最理想的CF示例是所需修改最少的那个(用橙色点表示,并用蓝色虚线突出显示)。在这项工作中,我们将稀疏性作为指导原则,使模型能够在生成CF示例时,以最小的变更成本实现期望结果。

(请参见图例)图3. 可能重构的可行建议示例图,其中箭头(加粗虚线)指向对最终用户变更最少的建议

最后,在本文中,我们的主要贡献可总结如下:

- 我们引入了可行反事实解释(FCx),这是一种新颖的方法,可高效生成反事实(CF)解释,确保真实性、低成本修改和可行性,同时纳入硬性可行性约束(来自领域知识)和软性可行性约束(通过因果推断推导)。
- 我们将稀疏性纳入模型,旨在通过生成CF示例时尽可能少的变更来实现低成本修改。
- 此外,我们确保生成的CF位于数据密集区域,避免不切实际或异常的情况。为此,我们在降维空间中使用了局部异常因子(LOF)技术。
- FCx成功地有效整合了多种要素,如因果约束、稀疏性和基于密度的验证,以适应不同的数据集特征,并确保生成真实且可行的反事实示例。

## 2. 相关工作

近年来,围绕可解释机器学习(XAI)的研究大幅增长(Bodria等人,2023;Verma等人,2024;Karimi等人,2021;Dhurandhar等人,2018;Mothilal等人,2020;Joshi等人,2019;Pawelczyk等人,2020;Mahajan等人,2019;Wang等人,2023;Salimi等人,2023),其中反事实(CF)示例受到了广泛关注。(Verma等人,2024)全面回顾了该领域的算法多样性,指出了现有差距并概述了未来的研究方向。此外,(Karimi等人,2021)提出了一系列专注于算法补救的方法,旨在通过为受影响的个体提供解释和可操作的建议来系统地扭转不利的算法决策。

一些方法超越了传统的监督学习技术,融入了自监督方法。例如,(Dhurandhar等人,2018)使用对比学习来证明黑盒分类器预测的合理性。其他研究探讨了CF解释的不同方面:(Mothilal等人,2020)强调CF示例的多样性,并已被实现为一个用于生成它们的Python库;而(Joshi等人,2019)则专注于通过最小化所需变更的数量来产生可操作的CF示例。(Pawelczyk等人,2020)的工作强调了CF解释保真度的重要性,通过平衡邻近性(确保CF示例不是局部异常值)和连通性(确保CF保持在有效输入值附近)。类似地,(Mahajan等人,2019)利用结构因果模型优先考虑可行性。

进一步的贡献包括(Rugolon等人,2023),该研究基于稀疏性和LOF评估CF解释。稀疏性衡量患者为达到积极结果所需的最小变更,而LOF评估生成的CF是否接近期望类别的数据分布。(Poyiadzi等人,2020)研究了合成和图像数据集上的可行性,该研究利用数据流形内的高密度路径来提出可实现且真实的反事实变化。此外,可行性的研究也涵盖了群体和个人层面:(Fragkathoulas等人,2026)为公平审计生成可行的群体/子群体反事实,而(Bove等人,2023)研究了如何为单个实例呈现多个可行的反事实选项。

最近的工作进一步探索了用于生成真实且可行的CF解释的生成和因果感知机制。在(Hellemans等人,2025)中,作者介绍了FCEGAN,一个基于反事实模板的生成框架,允许用户在推理时指定可变特征,从而在用户定义的约束下灵活生成CF。类似地,(Guyomard等人,2026)提出了VCNet和ImmutableVCNet,使用条件变分自编码器生成真实且类别一致的CF,而(Crupi等人,2024)将CF解释表述为潜在空间中的干预,以纳入因果关系并提供可行的建议。

## 3. 问题定义

在本节中,我们深入介绍问题定义,随后是模型的基本组件。

令 **x** ∈ ℝ^d, y ∈ {0, 1} 表示具有 d 个特征的输入数据点,y 为输入类别。给定一个示例 (**x**) 和目标类别 y',我们希望生成一个 CF 示例以最小化以下目标:

(1) min_{x^{cf} ∈ C} Dist(**x**, x^{cf}) + ∑_{(p,q) ∈ C} Penalty_h(x_p^{cf}, x_q^{cf})

相似文章

用于算法补偿的解释驱动主动特征获取

arXiv cs.LG

本文提出了一种解释驱动特征获取(EDFA)方法,该方法统一了反事实、半事实和替代事实解释,以联合解决算法补偿和特征获取问题,旨在以更低的成本和更高的可操作性提供有效性保证的补偿方案。

基于概念的扩散模型反事实视觉解释

arXiv cs.AI

介绍C-VCE,这是一种扩散框架,它在生成模型中内置了一个可解释的概念瓶颈层,从而无需依赖外部噪声鲁棒分类器即可实现人类引导的视觉反事实解释。