neural-network-interpretability

标签

Cards List
#neural-network-interpretability

NObSP: 通过斜子空间投影实现神经网络的功能分解

arXiv cs.LG ↗ · 2026-09-17 缓存

本文介绍了NObSP,一个利用斜子空间投影将神经网络预测分解为每个特征的贡献函数和交互残差的框架,与现有方法相比,提高了可解释性并减少了归因错误。

0 人收藏 0 人点赞
#neural-network-interpretability

Transformer Circuits 的数学框架(2021)

Hacker News Top ↗ · 2026-09-12 缓存

本文提出了一种数学框架,用于逆向工程 Transformer 模型,以增强机制可解释性并解决 AI 系统中的安全问题。

0 人收藏 0 人点赞
#neural-network-interpretability

扰动如何传播:大型语言模型鲁棒性的多层次分析

arXiv cs.CL ↗ · 2026-09-04 缓存

本文对输入扰动如何通过仅解码器语言模型传播进行多层次分析,评估了通过输出行为、隐藏状态几何和注意力头功能在GPT-2和Qwen2.5等模型中的鲁棒性。

0 人收藏 0 人点赞
#neural-network-interpretability

不稳定特征,可重现子空间:理解稀疏自编码器中的种子依赖性

Hugging Face Daily Papers ↗ · 2026-06-10 缓存

本文研究稀疏自编码器中的种子依赖性,发现稳定特征携带大部分预测信号,而不稳定特征反映了可重现的低维子空间。

0 人收藏 0 人点赞
#neural-network-interpretability

智慧在于知道何时沉默:通过注意力转移实现无幻觉的大语言模型遗忘

arXiv cs.CL ↗ · 2026-04-20 缓存

本论文引入注意力转移(Attention-Shifting, AS)框架,用于大语言模型的选择性机器遗忘,在有效移除敏感信息与防止幻觉和保持模型性能之间取得平衡。该方法采用重要性感知的注意力抑制和保留增强机制,在标准基准上相比现有遗忘方法实现了高达15%的准确度保持率提升。

0 人收藏 0 人点赞
#neural-network-interpretability

激活图谱简介

OpenAI Blog ↗ · 2019-03-06 缓存

# 激活图谱简介 来源:[https://openai.com/index/introducing-activation-atlases/](https://openai.com/index/introducing-activation-atlases/) 理解神经网络内部工作原理不仅仅是科学好奇心的问题——我们的知识缺陷限制了审计神经网络的能力,在高风险场景中,确保其安全性。通常,如果要部署关键软件,可以审查代码的所有执行路径,但

0 人收藏 0 人点赞
← 返回首页

提交意见反馈