标签
本文介绍了NObSP,一个利用斜子空间投影将神经网络预测分解为每个特征的贡献函数和交互残差的框架,与现有方法相比,提高了可解释性并减少了归因错误。
This paper proposes RelShap, a framework that incorporates relational constraints and data provenance into Shapley value computation, making explanations more faithful to the data-generating process. It is estimator-agnostic and composes with existing SHAP estimators while exploiting functional dependencies to reduce runtime.
本文引入了一个基于分布的框架,通过量化特征排名的可分离性并识别在随机运行中保持可靠的最大top-k排名,来衡量归因方法(解释器)的稳定性。
提出了一种基于Shapley值的特征归因框架,用于数据掩蔽,在特征级别平衡披露风险和数据效用,且不依赖于特定的掩蔽方法。
FADEx 提出了一种新颖的局部逐实例特征归因方法,用于解释降维技术,利用泰勒展开和奇异值分解提供模型无关的解释和失真分析。
提出DAG-SHAP,一种基于边干预的有向无环图特征归因新方法,解决了现有Shapley值方法在捕捉特征交互和因果关系方面的局限性。
本文介绍了归因合同(Attribution Contract),这是生成式语言模型中特征归因声明的一种规范,解决了特征定义不清以及归因方法评估方式模糊的问题。论文以自回归模型和扩散模型为例,展示了归因何时具有信息量,何时可能产生误导。
本文证明,在共线性条件下,没有任何特征排名能同时满足忠实性、稳定性和完备性,刻画了完整的归因设计空间,并提供了一个形式化验证的可解释AI不可能性定理。
一位16岁的开发者创建了sage-explainer,这是一个Python包,用于近似黑盒模型(如随机森林和XGBoost)对特征的预测灵敏度,提供比中心有限差分更稳定的结果。
提出一种基于权重扰动的特征归因方法(XWP和XWPc),用于全连接神经网络,在标准基线指标上取得了有竞争力的性能。
研究人员推出了 PIE,这是一种面向跨层转码器(CLT)的原生框架,通过基于特征归因的剪枝技术实现高效的电路发现。该方法在特征选择上实现了约 40 倍的压缩,同时成功保持了 IOI 和 Doc-String 任务的行为保真度。