标签
论文提出PX-UAP方法,该方法结合概率鲁棒性与可解释人工智能,生成针对基于深度强化学习的入侵检测系统的通用对抗性扰动,并在实验中展示了攻击有效性的提升。
本文介绍了SciGen-Verifier,一个用于科学图像生成可解释验证的多模态推理模型,以及一个新的基准测试和强化学习训练流程。
本文提出XACT框架,该框架用于学习时间频率变换上的稀疏归因掩模,以解释时间序列分类器,并展示了相比基线方法在精确度和可解释性方面的提升。
本文提出了一种知识追踪模型的验证协议,使用XGBoost和深度学习基线模型在ASSISTments数据集上评估预测性能以及解释的稳定性和忠实性。
本文提出一个可解释的仇恨言论检测框架,整合了DistilBERT嵌入、BiLSTM和注意力机制,在基准数据集上针对二分类和多分类任务实现了高F1分数。
本文引入了一种双模型掩码度量,对序列推荐系统中时间归因的十种可解释方法进行基准测试,发现基于梯度的方法如GradientSHAP和Integrated Gradients产生最忠实和稳健的归因。
本文介绍了Signal2Symbol,这是一个神经符号框架,用于在类似ECG和EEG的生理时间序列数据中进行可解释的异常检测,利用符号化分词和时序推理,以产生对异常模式的可解释说明。
论文提出了一种新的机器学习解释评估方法,通过将解释转换为预测器并测试其重现模型预测的能力。研究表明,像SHAP和PDP这样的解释方法的有效性取决于数据中特征的独立性。
本文提出了ProKDA,一种用于可解释仇恨模因检测的渐进式知识-决策对齐方法,通过解耦解释和检测任务实现了最先进的性能。
本文介绍了一种可解释的机器学习方法,使用朴素贝叶斯分类器在小型临床数据集上从炎症生物标志物预测认知障碍,并识别出I-309 (CCL1)作为关键预测特征。
FakeSpotter 是一个与内容和策略无关的工具,旨在通过测量结构性指纹来估算文本内容的病毒性错误信息风险,使用重复的LLM评估和逻辑回归分类器,在标记语料库上报告短文本的宏观F1分数为0.788,长文本为0.793。
本文提出了因果充分必要区域解释(SNRE),该框架利用因果推理来学习输入和输出区域,其中成员资格对于模型预测既是充分的又是必要的,从而提高可解释性。
本文介绍了NObSP,一个利用斜子空间投影将神经网络预测分解为每个特征的贡献函数和交互残差的框架,与现有方法相比,提高了可解释性并减少了归因错误。
SPICE 引入了一个可泛化的框架,用于分析神经网络中的多义性,能够在卷积神经网络和Transformer之间进行系统性比较,并自动确定每个神经元的概念聚类。
论文提出了一个集成框架,用于使用双侧GRF和COP信号进行多类步态障碍分类,结合3D可视化和可解释AI,实现了高准确率。
本文提出了一种解释驱动特征获取(EDFA)方法,该方法统一了反事实、半事实和替代事实解释,以联合解决算法补偿和特征获取问题,旨在以更低的成本和更高的可操作性提供有效性保证的补偿方案。
本文介绍了概念集成Transformer(CIT),该模型利用大型语言模型进行概念监督,以在小规模队列健康研究中从移动传感数据中实现准确且可解释的预测。
本文介绍了XAI-Arena,这是一个LLM-as-a-judge框架,用于可扩展和可复现的AI解释质量评估,显示出与人类判断的强相关性。