explainability

标签

Cards List
#explainability

当解释无法阅读时:测量和校正面向右到左语言的 SHAP 与 LIME 渲染

arXiv cs.LG ↗ · 昨天 缓存

本研究引入 SHAP-RTL,一个渲染层,用于校正针对右到左语言的 SHAP 和 LIME 解释可视化,解决标记序列和文本塑形等问题,同时保留原始归因值。

0 人收藏 0 人点赞
#explainability

构建对人工智能的信任:铁路应用的必要性

arXiv cs.AI ↗ · 2026-09-17 缓存

本文回顾了鲁棒性、操作设计域(ODD)和可解释性等关键领域,以构建对铁路应用中人工智能系统的信任,旨在满足严格的安全标准并实现更广泛的应用。

0 人收藏 0 人点赞
#explainability

以安全为约束:微调LLM推荐模型以实现自我解释

arXiv cs.AI ↗ · 2026-09-15 缓存

本文针对视频流媒体服务微调大型语言模型,以生成个性化、忠实且无害的推荐解释,在保持原始性能的同时提高了通过率。

0 人收藏 0 人点赞
#explainability

LLMs作为符号回归中生理合理性的事后审核工具:一项临床医生评估的案例研究

arXiv cs.AI ↗ · 2026-09-12 缓存

该论文研究使用大型语言模型作为事后审核工具,以评估符号回归模型的可解释性和医学合理性,临床医生评估表明,比较性模型排名比单项解释更受欢迎。

0 人收藏 0 人点赞
#explainability

CARRE:用于可解释客户流失处方的反事实行动检索与推理评估

arXiv cs.CL ↗ · 2026-09-10 缓存

CARRE是一个三阶段框架,结合了检索增强生成、反事实评分和大语言模型推理,为客户提供可解释的客户流失处方,展示了相对于基线的风险降低改进。

0 人收藏 0 人点赞
#explainability

@johnschulman2: 非常看好这个方向。有了解释质量的衡量指标,就可以通过爬山法来优化,而反事实可模拟性……

X AI KOLs Timeline ↗ · 2026-09-04 缓存

John Schulman 重点介绍了 Adam Karvonen 及其同事的研究,该研究将反事实可模拟性作为提升 AI 解释质量的指标。他们开发了数据集与流水线,训练模型对自身行为生成更优的事后解释,并在留出评估中展现了泛化能力。

0 人收藏 0 人点赞
#explainability

CRAFT: AI原生6G RAN中事前可解释性的微调

arXiv cs.LG ↗ · 2026-09-02 缓存

该论文提出了CRAFT,一种以数据为中心的方法,用于微调小语言模型,以在AI原生6G RAN中实现事前可解释性,与现有方法如GRPO相比,实现了更高的准确性和能效。

0 人收藏 0 人点赞
#explainability

NVExplain: 使用潜在轨迹分析和结构保持代理模型解释时间序列预测

arXiv cs.LG ↗ · 2026-08-27 缓存

NVExplain 引入了一种模型无关的框架,通过分析潜在轨迹和语义流来解释时间序列预测,使用结构保持代理模型生成具有竞争力和稳定性的人类可读解释。

0 人收藏 0 人点赞
#explainability

Virgil: 基于Transformer的语言模型可解释性导航

arXiv cs.CL ↗ · 2026-08-27 缓存

Virgil是一个交互式系统,旨在通过精选知识库和统一界面,帮助用户发现和比较用于基于Transformer的语言模型的可解释性工具。

0 人收藏 0 人点赞
#explainability

使用图可解释解释生成干预假设:G2I,一个两阶段贪心框架

arXiv cs.LG ↗ · 2026-08-26 缓存

本文介绍了G2I,一个两阶段贪心框架,它使用可解释的图神经网络(GNN)解释来生成可操作的干预假设,相较于现有的基于掩码的反事实方法,提高了在公共卫生和社会科学应用中的效率。

0 人收藏 0 人点赞
#explainability

MIL-BERT:基于性能与解释保证的任意大小文本分类

arXiv cs.CL ↗ · 2026-08-24 缓存

本文介绍了MIL-BERT,这是一种通过选择相关摘录来对任意长文本进行分类的算法,在多个数据集上实现了最先进的性能,并提供了性能与解释保证。

0 人收藏 0 人点赞
#explainability

EXPL-FR:通过视觉语言对齐解释人脸识别模型

Hugging Face Daily Papers ↗ · 2026-08-21 缓存

EXPL-FR 是一种方法,通过将视觉语言嵌入与识别空间对齐来解释人脸识别模型,从而实现语义属性的无标签审计和模型比较,而无需访问模型架构。

0 人收藏 0 人点赞
#explainability

基于交互的LLM提示敏感性评估与解释

arXiv cs.LG ↗ · 2026-08-20 缓存

本文介绍了一种基于交互的提示敏感性 (IPS) 指标,通过分析交互来评估和解释大语言模型中的提示敏感性。该指标应用于50个开源LLM,识别了如微调和模型规模等因素通过低阶交互降低敏感性。

0 人收藏 0 人点赞
#explainability

评估强化学习可解释性方法在协助修复智能体故障中的效能

arXiv cs.LG ↗ · 2026-08-19 缓存

该论文提出了EvalXRL,一个通过使用LLM编程智能体来诊断和修复RL智能体中的错误,从而评估可解释强化学习方法的基准。

0 人收藏 0 人点赞
#explainability

Decomposition of Evidence, Contradiction, and Fragility in Perturbation Responses

arXiv cs.AI ↗ · 2026-08-14 缓存

Introduces DECAF, a method that decomposes perturbation responses into evidence, contradiction, and fragility components, improving interpretability over raw response magnitude and achieving strong results across vision benchmarks.

0 人收藏 0 人点赞
#explainability

当解释背叛后门:语言模型分类器的黑盒审计

arXiv cs.CL ↗ · 2026-08-14 缓存

本文介绍了Groundedness Drift,一种用于语言模型分类器黑盒审计的评分,利用干净的校准数据和解释性输出来检测后门。它在多种攻击家族和数据集上展示了更高的检测性能。

0 人收藏 0 人点赞
#explainability

RelShap: Relationally Consistent Shapley Explanations

arXiv cs.LG ↗ · 2026-08-13 缓存

This paper proposes RelShap, a framework that incorporates relational constraints and data provenance into Shapley value computation, making explanations more faithful to the data-generating process. It is estimator-agnostic and composes with existing SHAP estimators while exploiting functional dependencies to reduce runtime.

0 人收藏 0 人点赞
#explainability

@AISuperDomain: 发现一个很有意思的开源项目:Semantica,可以理解成给 AI Agent 加上一层“可追溯的大脑”。 它不是普通 RAG,而是把企业数据、Agent 决策、实体关系和因果链构造成 Context Graph / Knowledge …

X AI KOLs Timeline ↗ · 2026-08-12 缓存

介绍开源项目 Semantica,它通过构建 Context Graph / Knowledge Graph 为 AI Agent 提供可追溯的决策依据和支持审计的能力,适用于金融、医疗等对可解释性要求高的场景。

0 人收藏 0 人点赞
#explainability

我的智能体比它取代的团队更准确,但他们仍然拒绝信任它。

Reddit r/AI_Agents ↗ · 2026-08-11

作者分享了一个比人类更准确的分诊智能体如何仍然未能被采纳,直到他们为每个决策添加了通俗易懂的解释,得出结论:可理解性比准确性更能建立信任。

0 人收藏 0 人点赞
#explainability

精确集成,脆弱叙事:多尺度堆叠与信用风险LLM生成解释的保真度审计

arXiv cs.LG ↗ · 2026-08-11 缓存

本文构建了一个用于信用风险评分的多尺度堆叠集成,并对LLM生成的解释进行了审计,发现排名提升虽然真实但幅度较小,而叙述性解释往往不忠实,SHAP和LIME在重要特征上一致,但在特征顺序或符号上不一致。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈