explainability

标签

Cards List
#explainability

从图到梯度:用于网络物理物联网系统及更广领域的物理启发式结构归因

arXiv cs.AI ↗ · 2026-07-08 缓存

本文提出了一种受物理学启发的框架,用于网络物理物联网系统中的结构归因。该框架采用基于无向能量的表示方法,无需有向因果图即可提供考虑依赖关系的解释。在工业物联网测试平台上的实验表明,与现有基于图的方法相比,该框架在归因准确性、鲁棒性和可扩展性方面均表现更优。

0 人收藏 0 人点赞
#explainability

AIriskEval-edu:用于AI介导的K-12教育解释风险评估的新数据集

arXiv cs.CL ↗ · 2026-07-03 缓存

介绍AIriskEval-edu-db2,这是一个用于AI生成的K-12教育解释的教学风险评估的新数据集,包含1,639条解释和结构化风险标注。还包括比较LLM在风险检测和可解释性方面的验证实验。

0 人收藏 0 人点赞
#explainability

TokenScope: 面向大型语言模型中代码任务的词元级可解释性与可理解性

arXiv cs.CL ↗ · 2026-07-03 缓存

TokenScope是一个面向仅解码器大型语言模型的交互式可解释性工具,在代码生成过程中提供词元级指标、注意力模式及反事实分支,支持系统性地研究模型行为。

0 人收藏 0 人点赞
#explainability

轻量级入侵检测模型在工业物联网网络中的跨域泛化失败

Hugging Face Daily Papers ↗ · 2026-07-01 缓存

本文研究了用于工业物联网入侵检测的轻量级机器学习模型的跨域泛化失败,发现它们依赖于粗糙的端口特征,并且对抗鲁棒性与跨网络性能无关。

0 人收藏 0 人点赞
#explainability

AI代理从演示到生产会遇到哪些问题?

Reddit r/AI_Agents ↗ · 2026-06-29

本文讨论了AI代理从演示过渡到生产时面临的挑战,重点在于需要操作控制平面,提供幂等性、审批追踪和操作可解释性,而不仅仅是模型推理。

0 人收藏 0 人点赞
#explainability

ToE:一种分层可解释的声明验证框架,具有动态多源证据检索与聚合

arXiv cs.AI ↗ · 2026-06-29 缓存

本文介绍了Tree of Evidence (ToE),一种利用强化学习动态检索和聚合多源证据的分层可解释声明验证框架。实验表明,与基线相比,性能提升4至24个百分点,尤其是在面对生成引擎优化(GEO)的对抗性投毒输入时。

0 人收藏 0 人点赞
#explainability

检索预热能量基推理:用于结构推理任务上扩散作为推理的五臂消融方法论

arXiv cs.LG ↗ · 2026-06-26 缓存

本文提出一种五臂消融方法论,用于诊断检索预热能量基推理(RW-EBR)中哪个组件驱动性能提升,应用于图可达性和数独等结构推理任务。该方法分离了类先验偏差、随机预热启动和图对齐值重用三种效应的影响。

0 人收藏 0 人点赞
#explainability

ProvenAI:生成答案中的溯源原生证据追踪

arXiv cs.CL ↗ · 2026-06-26 缓存

ProvenAI 提出了一种框架,将多跳问答中的透明度分解为三个可独立衡量的层次:答案正确性、引用忠实度和每文档影响力,揭示了一个引用-影响力差距,即被引用的来源可能影响力较弱,而未引用的来源却显著影响输出。

0 人收藏 0 人点赞
#explainability

@MSFTResearch:研究人员引入生成式因果测试,将黑盒模型转化为清晰的假设并验证……

X AI KOLs Following ↗ · 2026-06-25 缓存

微软研究院及其合作者提出了生成式因果测试(GCT),该方法将黑盒脑预测模型提炼为可测试的解释,并通过fMRI实验进行验证,揭示了特定脑区对语言概念的反应。

0 人收藏 0 人点赞
#explainability

地球嵌入中有什么?位置编码器的可解释性分析

arXiv cs.LG ↗ · 2026-06-25 缓存

本文介绍了将地理隐式神经表示中的位置嵌入分解为人类可解释特征的方法,例如稀疏潜在概念、自然语言概念和视觉特征,揭示了森林和城市区域等地理结构。

0 人收藏 0 人点赞
#explainability

多传感器融合泛化失败:动物级别和时间分布偏移下的牛姿态分类

arXiv cs.LG ↗ · 2026-06-25 缓存

本文评估了多传感器融合在时间分布偏移下对牛姿态分类的稳健性,发现多模态模型性能显著下降,而更简单的单传感器模型泛化能力更好,揭示了捷径学习问题。

0 人收藏 0 人点赞
#explainability

别让我的LLM崩溃:注意力层剪枝对解释忠实性与置信度校准的影响

arXiv cs.LG ↗ · 2026-06-25 缓存

本文研究了在大型语言模型(LLM)中剪枝注意力层对解释忠实性和置信度校准的影响,发现准确率通常保持较高,但可解释性和可靠性下降,凸显了模型置信度、可解释性与准确率之间的失调。

0 人收藏 0 人点赞
#explainability

复杂性如何促成机器学习中的学习不透明性

arXiv cs.LG ↗ · 2026-06-25 缓存

本文通过将机器学习(尤其是神经网络)的学习过程视为复杂动态系统,分析了其为何在学习过程中保持不透明,指出了导致学习不透明性的三个关键特性,并论证了某些不透明源可能是不可约的。

0 人收藏 0 人点赞
#explainability

良好解释的定义与解释LLM输出的挑战

arXiv cs.AI ↗ · 2026-06-16 缓存

本文基于反事实和先验信念提出了良好解释的定义,并探讨了在此定义下解释LLM输出固有的困难。

0 人收藏 0 人点赞
#explainability

将未来行为预测作为学习任务

arXiv cs.AI ↗ · 2026-06-11 缓存

本文提出了 Behavior Forecasters,一种从推理轨迹中预测 LRM 未来行为(如答案一致性和输入敏感性)的学习方法,以更低的成本超越了 GPT-5.4 和 Claude Opus 4.6。

0 人收藏 0 人点赞
#explainability

将预测未来行为作为一项学习任务

Hugging Face Daily Papers ↗ · 2026-06-09 缓存

本文提出训练行为预测器,从单条推理轨迹预测大型推理模型的输出,在计算成本更低的情况下优于GPT-5.4和Claude Opus-4.6等大型语言模型,绕过了传统的可解释性方法。

0 人收藏 0 人点赞
#explainability

反事实行为的几何视角:决策边界接近性与局部数据支撑的交互作用

arXiv cs.LG ↗ · 2026-06-04 缓存

本文通过几何视角审视机器学习模型中的反事实行为,表明预测性能相似的模型,由于决策边界接近性与局部数据支撑之间的交互作用,其反事实结果可能大相径庭。研究结果将反事实行为视为与预测性能不同的独立维度,对模型选择及反事实解释方法的可靠性具有启示意义。

0 人收藏 0 人点赞
#explainability

模拟、推理、决策:基于LLM的科学推理驱动仿真决策

arXiv cs.AI ↗ · 2026-06-04 缓存

密歇根大学的研究人员推出了MechSim——一个基于机制的神经符号推理框架,使LLM智能体能够对科学模拟器的内部假设、依赖关系和执行行为进行推理,而非将其视为黑盒。该框架在医疗、金融和公共政策等高风险领域提升了解释质量与决策可靠性。

0 人收藏 0 人点赞
#explainability

GridVQA-X:评估多模态可解释性方法的框架

Hugging Face Daily Papers ↗ · 2026-06-02 缓存

GridVQA-X 引入了一个诊断框架,通过区分多模态模型中真正的空间关系推理与跨模态捷径,来评估跨模态可解释性。

0 人收藏 0 人点赞
#explainability

SafeRx-Agent:一个基于知识的多智能体框架,用于安全且可解释的药物推荐

arXiv cs.CL ↗ · 2026-05-29 缓存

介绍了SafeRx-Agent,一种基于知识的多智能体框架,用于安全且可解释的药物推荐,可生成细粒度的ATC代码预测,同时控制药物相互作用和禁忌症,在MIMIC-III和MIMIC-IV数据集上进行了评估。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈