基于线性判别树集合的可解释多模态分类
摘要
本文提出了一种基于线性判别树集合的可解释多模态分类框架,该框架在准确性和可解释性之间取得平衡,在F1-mod增益和人工标注者一致性分数上优于Transformer模型。
arXiv:2608.20384v1 Announce Type: new
摘要: 多模态情感和行为分类器融合异构的文本、音频和视觉流,必须同时实现竞争性的准确性并产生人类可理解的解释来指导其决策——这是当前高容量模型(尤其是Transformer)仅部分解决的双重目标。虽然Transformer达到了强大的预测性能,但其分布式表示和深度非线性使得难以给单个多模态特征分配有意义的权重,从而限制了它们在信任敏感应用中的使用,如临床情感监测和教育评估。我们通过开发基于树集合的框架来解决这一差距,该框架平衡了准确性和可解释性。该框架将每个模态编码为标记,提取并聚类概念以降低维度,通过基于树集合的分类器路由融合的模态,并使用一种新颖的修改特征重要性度量来解释趋势。修改后的重要性减少了二元分类任务中负类的影响,从而改进了指标或标记检测。提出的树集合——线性判别树(LDT)、线性判别森林(LDF)和线性判别AdaBoost(LDAB)——在F1-mod上比多模态Transformer高出4.3%的增益,在准确性上比主要的可解释多模态基线(可解释多模态路由(IMR))高出3.0%的增益。提出的多模态特征重要性提取了显著的模态间概念,其人工标注者一致性分数远高于默认特征重要性(在IEMOCAP上为62.2% vs. 43.2%;在CMU-MOSI上为46.7% vs. 32.1%)。
查看缓存全文
缓存时间: 2026/08/24 04:05
# 基于线性判别树集成的可解释多模态分类 来源:https://arxiv.org/html/2608.20384 间距=非法国 Mojtaba Moattari(独立研究者,伊朗设拉子;ORCID:0000-0001-6191-6467,[email protected]) ###### 摘要: 融合异构文本、音频和视觉流的多模态情感与行为分类器,必须同时实现高精度,并生成人类可理解的决策线索解释——这是当前高容量模型(尤其是Transformer)仅部分解决的双重目标。尽管Transformer具有强大的预测能力,但其分布式表示和深度非线性特性使得难以对单个多模态特征赋予有意义的权重,从而限制了它们在临床情感监测和教育评估等信任敏感应用中的使用。我们通过开发一个基于树集成的框架来解决这一差距,该框架平衡了准确性和可解释性。该框架将每种模态编码为令牌,提取并聚类概念以降低维度,通过树集成分类器路由融合的模态,并使用新颖的改进特征重要性度量解释趋势。改进的重要性度量减少了二元分类任务中负类的影响,从而改进了指标或标记的检测。我们在IEMOCAP、CMU-MOSI和自定义的多模态数学数据集上进行评估,报告了准确率、标准F1值以及强调正类性能的改进F1度量(F1-mod)。所提出的树集成——线性判别树(LDT)、线性判别森林(LDF)和线性判别AdaBoost(LDAB)——相比多模态Transformer[tsai2019multimodal],F1-mod增益达4.3%;相比主要的可解释多模态基线——可解释多模态路由(IMR)[tsai2020multimodal],准确率增益达3.0%。所提出的多模态特征重要性提取了显著的跨模态概念,其人类标注者一致性得分显著高于默认特征重要性(在IEMOCAP上为62.2%对比43.2%;在CMU-MOSI上为46.7%对比32.1%)。该框架还描述了跨模态概念关联,这是标准基于注意力的深度学习模型不易提供的能力。 - 关键词:斜树;集成学习;上下文编码;特征重要性;多模态可解释性;多模态融合 - 分类号:I.2.6, I.5.2, I.5.4, H.2.8 - DOI:10.3897/jucs.¡SubmissionNumber¿ ## 1 引言 可解释多模态学习的最新进展已催生出能够融合文本、音频和视频的系统,这些系统在建模情感、行为和临床指标的同时,能够生成对底层多模态线索的可理解解释,以支持诊断或行为推理[poria2017review;pelachaud2009modeling;clore2001behavior]。此类解释既能支持模型故障诊断,也能为临床医生和最终用户提供可行的行为指导。基于Transformer的模型是当前多模态情感和行为分类的最先进方法[tsai2019multimodal;vaswani2017attention;zadeh2019factorized;sahay2020lowrank],然而它们计算需求高,且在分类、解释和特征提取方面提供的透明度有限[sun2017review;kovalerchuk2021survey;gao2020survey]。相比之下,决策树[song2015decision]在大型数据集上准确率较低,但具有内在可解释性[molnar2020interpretable;kovalerchuk2021survey];因此,它们为构建兼具竞争力和可解释性的(集成)分类器提供了一个有前景的基础。基于Transformer的模型面临两个具体的可解释性障碍: - –它们并非在设计上可解释;因此,它们识别为重要的特征可能无法真实反映局部实例级行为[molnar2017review;kovalerchuk2021survey]。 - –其深度、分布式表示和跨模态注意力机制使得直接解释比使用决策树等内在透明模型困难得多[devlin2018bert;nagrani2021attentionbottlenecks]。 此外,最近的基于注意力的分类器计算密集,且无法以易于解释的形式呈现整个数据集的趋势[ribeiro2016model;liang2021attention;gkoumas2021difference]。这一限制源于分布式连接表示(阻止了局部信息编码)或复杂的多阶段流程(模糊了哪一层的权重应构成跨模态或全局重要性信号)。代表性示例包括MMPNet[song2025multimodal](以概念原型为中心的可解释性)、3WD-DRT[jiang20253wd](可靠性感知的多模态门控)、AtCAF[gandhi2024atcaf](因果上下文解释)和MISA[hazarika2020misa](共享模态特定的多模态解释)。现有的设计即为可解释的模型——如斜决策树[murthy1994system]、稀疏斜树[hada2023sparse]和线性判别树(LDT)[yildiz2005linear]——分别存在对上下文不敏感、计算成本高和容易过拟合训练数据的问题。为克服这些限制,我们提出了一种新颖的多模态分类流程和特征编码器。我们专注于决策树(DT)[song2015decision;pal2005random;ying2013advances;an2010new]的集成,并通过归纳偏置、特征编码器和改进的解释性度量对其进行增强。如果基于树的集成分类器能在多模态场景中变得足够表达力强,所得框架可能既能在相对于基于Transformer的模型[tsai2019multimodal;vaswani2017attention;zadeh2017tfn;zadeh2018mfn]具有竞争力准确率的同时,又能提供相对于可解释神经网络替代方案[molnar2020interpretable;ribeiro2016model;kovalerchuk2021survey;kim2018interpretability]的优越可解释性。据我们所知,尚无先前工作在统一的多模态框架中系统地比较不同类型的决策树集成[murthy1994system;hada2023sparse;yildiz2005linear;lemmond2010extended]。 ##### 1.0.0.1 贡献 本工作的主要贡献如下,每项都针对上述已识别的差距: - –在DT、RF、AB中用于多模态融合的LDA节点投影。在每个树节点插入线性判别分析(LDA)投影器是集成学习中未探索过的配置。先前的斜树工作[murthy1994system;hada2023sparse]仅在单个树内应用投影,或使用PCA/ICA而非类判别准则。我们将此思想扩展到多模态DT、随机森林(RF)和AdaBoost(AB),它们共同构成了LDT、LDF和LDAB变体。 - –聚焦正类的特征重要性。标准特征重要性由拒绝负类实例的节点主导,扭曲了正类线索。我们改进的重要性度量提高了正类实例占主导的分支节点的权重,从而产生更具可解释性和可诊断故障的解释。 - –用于多模态令牌的三种上下文集成方案。我们设计并比较了K均值聚类、基于特征值的二元层次聚类和多义聚类作为融合前编码模态特定令牌的替代策略,并证明方案的选择显著影响准确性和可解释性。 - –一个结合上下文编码与适当分类器变体的基于树的集成框架,以改进多模态二分类[gkoumas2021difference;snoek2005earlylate]。 - –跨三种上下文嵌入方案的多模态可视化方法,用于局部(样本级)解释[selvaraju2017grad;kim2018interpretability]。 实验结果在IEMOCAP、CMU-MOSI和自定义的多模态数学数据集上获得。本文中的主要可解释基线是IMR(可解释多模态路由)[tsai2020multimodal];与非可解释模型如MulT[tsai2019multimodal]的比较是次要的。所提出的集成相比MulT实现了4.3%的F1-mod增益,相比IMR实现了3.0%的准确率增益。消融研究(第4.3节 (https://arxiv.org/html/2608.20384#S4.SS3))证实,在非稀疏配置中,n-gram计数与准确率和F1值强烈相关[chelba2017ngram]。可重复性材料——包括代码、预处理特征和训练好的模型——可在https://github.com/moatary/reproducible_multimodal_ensemble获取。此外,所有超参数搜索空间和最终选定值详见表1 (https://arxiv.org/html/2608.20384#S3.T1)。 ##### 1.0.0.2 研究问题 本工作解决以下研究问题: 1. 1. RQ1:基于树的集成模型[pal2005random;ying2013advances;an2010new;lemmond2010extended]能否在多模态设置中达到与基于Transformer的模型[tsai2019multimodal;zadeh2019factorized;sahay2020lowrank]相当的性能? 2. 2. RQ2:改进的特征重要性能否在全局和局部设置中提高多模态可解释性——涵盖模型故障诊断和条件检测[molnar2020interpretable;ribeiro2016model;kovalerchuk2021survey;kim2018interpretability]? 3. 3. RQ3:基于树的集成中的LDA节点投影是否比标准基于树的集成[yildiz2005linear;lemmond2010extended]提高分类准确率? 4. 4. RQ4:特定的上下文聚类方法是否能带来可测量的可解释性改进[kovalerchuk2021survey;kim2017bag;athiwaratkun2018probabilistic]? 本文其余部分组织如下:第2节 (https://arxiv.org/html/2608.20384#S2)回顾相关工作。第3节 (https://arxiv.org/html/2608.20384#S3)提出所提议的框架和特征重要性推导。第4节 (https://arxiv.org/html/2608.20384#S4)报告结果、比较、消融研究和可解释性分析。第5节 (https://arxiv.org/html/2608.20384#S5)总结并概述未来方向。 ## 2 相关工作 ### 2.1 随机森林、自适应提升和梯度提升 随机森林通过在每个树上使用数据的自助样本并行训练每棵树来构建集成[pal2005random]。最终预测由多数投票决定。AdaBoost[ying2013advances;an2010new]迭代地重新加权训练实例,将后续弱学习器导向先前被错误分类的示例。最终预测聚合所有弱学习器的加权投票。XGBoost按顺序生长树以最小化集成的残差误差,定义复杂度惩罚为:Ω(ft)=γLt+12λ∑j=1Ltωj2\\Omega(f_\{t\})=\\gamma L_\{t\}+\\tfrac\{1\}\{2\}\\lambda\\sum_\{j=1\}^\{L_\{t\}\}\\omega_\{j\}^\{2\} (1)其中LtL_\{t\}是叶子数,ωj\\omega_\{j\}是叶子j的得分。 ### 2.2 线性判别树(LDT) 线性判别树使用线性判别分析(LDA)提取的线性投影来分割输入,寻求最小化节点不纯度的斜超平面[yildiz2005linear;murthy1994system]。Fisher的LDA最大化类间方差与类内方差之比。在两类情况下,投影向量w\\mathbf\{w\}和截距b为: w=Σ−1(μ1−μ0)\\mathbf\{w\}=\\Sigma^\{\-1\}(\\boldsymbol\{\\mu\}\_\{1\}\\-\\boldsymbol\{\\mu\}\_\{0\}) (2) b=−12(μ1+μ0)⊤Σ−1(μ1−μ0)b=-\\tfrac\{1\}\{2\}(\\boldsymbol\{\\mu\}\_\{1\}+\\boldsymbol\{\\mu\}\_\{0\})^\\{\\!\\top\\}\\Sigma^\{\-1\}(\\boldsymbol\{\\mu\}\_\{1\}\\-\\boldsymbol\{\\mu\}\_\{0\}) (3) 其中Σ−1\\Sigma^\{\-1\}是合并协方差矩阵的逆,μk\\boldsymbol\{\\mu\}\_\{k\}是第k类的均值。在这项工作中,我们将基于LDA的节点投影扩展到RF、AB和XGBoost(XGB),并在这些投影器之上构建了新颖的特征重要性,该重要性通过每个节点对正类的贡献来加权——这是标准或稀疏斜树所不具备的能力,因为在后者中特征仅影响节点的一个子集[hada2023sparse]。参见说明:图1:节点分割的轴对齐(左)与LDA斜(右)决策边界。LDA超平面更清晰地分离两个类别,误分类计数更低。算法1 (https://arxiv.org/html/2608.20384#alg1)通过选择产生最高不纯度减少的LDA斜边界(图1 (https://arxiv.org/html/2608.20384#S2.F1))来优化路由到每个DT节点的数据子集。 算法1 节点不纯度优化器 输入:判别成分/特征向量;降维后的上下文数据;dim:节点投影器成分数;上下文标签 输出:选定的候选成分;节点决策(正或负);具有最高和最低成分值的mm特征 1: for each component do 2: 找到dim个最大化投影器目标(第3.4节 (https://arxiv.org/html/2608.20384#S3.SS4))的权重向量。 3: 选择具有最大不纯度减少的组合。 4: 对成分投影器进行argsort。 5: 记录选定的投影器成分和决策。 6: end for ### 2.3 与现有斜树和基于概念方法的对比 ##### 2.3.0.1 斜树和基于LDA的树 Murthy等人murthy1994system引入了具有多元分割的斜决策树,但未在集成学习器内应用判别投影器。Hada等人hada2023sparse提出了稀疏斜树,通过稀疏性降低了计算成本,但仍为单树模型,且未利用类判别投影。Yildiz和Alpaydin yildiz2005linear提出了LDT,但将其限制为单棵独立树。Lemmond等人lemmond2010extended扩展了判别随机森林,但未推广到提升变体。据我们所知,我们的框架是首个同时在DT、RF和AB内嵌入LDA投影器的框架,从而能够在统一的多模态流程下进行系统比较。 ##### 2.3.0.2 基于概念的可解释性 概念激活向量(CAV)[kim2018interpretability]聚类卷积感受野输出,但不直接适用于令牌化的多模态数据。Concept-GradCAM[selvaraju2017grad]将与标签相关的激活映射到图像区域,但仅限于单模态视觉输入。概念袋(Bag of Concepts)[kim2017bag]将词嵌入聚类成词袋表示,但未提供多模态概念融合的机制。我们的框架解决了所有这三个差距:它构建了多模态概念袋,同时应用于三种模态,并从类判别树节点(而非基于梯度的归因)导出重要性权重。 ### 2.4 可解释性 标准树特征重要性严重加权那些区分负类实例(假阳性)的节点,这可能会扭曲正类特征的重要性分数并误导从业者[molnar2020interpretable]。现有高引用的可解释性方法既未提供多模态数据的样本级也未提供词级的全局解释[ribeiro2016model;kim2018interpretability]。我们设计了基于降维的模态可视化和上下文特征重要性来解决这些差距,使用线性节点投影器对所有节点上每个特征的贡献进行加权[selvaraju2017grad;kim2018interpretability]。 ### 2.5 多模态融合中的准确且可解释模型 Hu等人huh2021interpretable提出了使用典型相关和Grad-CAM[selvaraju2017grad]进行多模态融合的可解释方法。
相似文章
基于一致性和标签解耦的可解释判别性文本表示
本文提出了一种基于注释者间一致性和标签解耦的可解释文本表示的操作性标准,并引入了LLM辅助特征发现(LFD)方法,该方法通过跨LLM一致性筛选和残差预测增益来选择清晰、标签解耦的特征。实验表明,LFD在保持预测性能的同时,产生了更可解释的特征,并通过人工审计进行了验证。
信息论分解用于多模态交互学习
本文提出一种多模态学习的信息论分析,揭示了捕捉样本特定交互的必要性,并提出了DMIL范式,通过变分分解和微调显式建模和学习这些交互,实现了优越性能。
大型语言模型作为统一多模态学习器用于临床预测
该论文提出将多模态患者数据(文本、实验室结果、生命体征)转换为单一自然语言序列,并对大型语言模型进行微调以用于临床预测,在三个任务中实现了与专用融合架构相当或更优的性能。
CL-DMDF:基于对比学习的动态多模态数据融合模型
本文提出了CL-DMDF,一种基于对比学习和双维度注意力机制的动态多模态数据融合模型,用于处理缺失模态并提升判别学习能力。
基于核Fisher判别分析的树集成分类器:KFDA Forest
提出了一种基于树的集成分类器KFDA Forest,它应用核Fisher判别分析进行旋转,通过Bootstrap和随机变量子集促进多样性,提高了分类精度。