标签
本研究引入 SHAP-RTL,一个渲染层,用于校正针对右到左语言的 SHAP 和 LIME 解释可视化,解决标记序列和文本塑形等问题,同时保留原始归因值。
本文回顾了鲁棒性、操作设计域(ODD)和可解释性等关键领域,以构建对铁路应用中人工智能系统的信任,旨在满足严格的安全标准并实现更广泛的应用。
本文针对视频流媒体服务微调大型语言模型,以生成个性化、忠实且无害的推荐解释,在保持原始性能的同时提高了通过率。
该论文研究使用大型语言模型作为事后审核工具,以评估符号回归模型的可解释性和医学合理性,临床医生评估表明,比较性模型排名比单项解释更受欢迎。
CARRE是一个三阶段框架,结合了检索增强生成、反事实评分和大语言模型推理,为客户提供可解释的客户流失处方,展示了相对于基线的风险降低改进。
John Schulman 重点介绍了 Adam Karvonen 及其同事的研究,该研究将反事实可模拟性作为提升 AI 解释质量的指标。他们开发了数据集与流水线,训练模型对自身行为生成更优的事后解释,并在留出评估中展现了泛化能力。
该论文提出了CRAFT,一种以数据为中心的方法,用于微调小语言模型,以在AI原生6G RAN中实现事前可解释性,与现有方法如GRPO相比,实现了更高的准确性和能效。
NVExplain 引入了一种模型无关的框架,通过分析潜在轨迹和语义流来解释时间序列预测,使用结构保持代理模型生成具有竞争力和稳定性的人类可读解释。
Virgil是一个交互式系统,旨在通过精选知识库和统一界面,帮助用户发现和比较用于基于Transformer的语言模型的可解释性工具。
本文介绍了G2I,一个两阶段贪心框架,它使用可解释的图神经网络(GNN)解释来生成可操作的干预假设,相较于现有的基于掩码的反事实方法,提高了在公共卫生和社会科学应用中的效率。
本文介绍了MIL-BERT,这是一种通过选择相关摘录来对任意长文本进行分类的算法,在多个数据集上实现了最先进的性能,并提供了性能与解释保证。
EXPL-FR 是一种方法,通过将视觉语言嵌入与识别空间对齐来解释人脸识别模型,从而实现语义属性的无标签审计和模型比较,而无需访问模型架构。
本文介绍了一种基于交互的提示敏感性 (IPS) 指标,通过分析交互来评估和解释大语言模型中的提示敏感性。该指标应用于50个开源LLM,识别了如微调和模型规模等因素通过低阶交互降低敏感性。
该论文提出了EvalXRL,一个通过使用LLM编程智能体来诊断和修复RL智能体中的错误,从而评估可解释强化学习方法的基准。
Introduces DECAF, a method that decomposes perturbation responses into evidence, contradiction, and fragility components, improving interpretability over raw response magnitude and achieving strong results across vision benchmarks.
本文介绍了Groundedness Drift,一种用于语言模型分类器黑盒审计的评分,利用干净的校准数据和解释性输出来检测后门。它在多种攻击家族和数据集上展示了更高的检测性能。
This paper proposes RelShap, a framework that incorporates relational constraints and data provenance into Shapley value computation, making explanations more faithful to the data-generating process. It is estimator-agnostic and composes with existing SHAP estimators while exploiting functional dependencies to reduce runtime.
介绍开源项目 Semantica,它通过构建 Context Graph / Knowledge Graph 为 AI Agent 提供可追溯的决策依据和支持审计的能力,适用于金融、医疗等对可解释性要求高的场景。
作者分享了一个比人类更准确的分诊智能体如何仍然未能被采纳,直到他们为每个决策添加了通俗易懂的解释,得出结论:可理解性比准确性更能建立信任。
本文构建了一个用于信用风险评分的多尺度堆叠集成,并对LLM生成的解释进行了审计,发现排名提升虽然真实但幅度较小,而叙述性解释往往不忠实,SHAP和LIME在重要特征上一致,但在特征顺序或符号上不一致。