neural-network-interpretability

标签

Cards List
#neural-network-interpretability

不稳定特征,可重现子空间:理解稀疏自编码器中的种子依赖性

Hugging Face Daily Papers · 2026-06-10 缓存

本文研究稀疏自编码器中的种子依赖性,发现稳定特征携带大部分预测信号,而不稳定特征反映了可重现的低维子空间。

0 人收藏 0 人点赞
#neural-network-interpretability

智慧在于知道何时沉默:通过注意力转移实现无幻觉的大语言模型遗忘

arXiv cs.CL · 2026-04-20 缓存

本论文引入注意力转移(Attention-Shifting, AS)框架,用于大语言模型的选择性机器遗忘,在有效移除敏感信息与防止幻觉和保持模型性能之间取得平衡。该方法采用重要性感知的注意力抑制和保留增强机制,在标准基准上相比现有遗忘方法实现了高达15%的准确度保持率提升。

0 人收藏 0 人点赞
#neural-network-interpretability

激活图谱简介

OpenAI Blog · 2019-03-06 缓存

# 激活图谱简介 来源:[https://openai.com/index/introducing-activation-atlases/](https://openai.com/index/introducing-activation-atlases/) 理解神经网络内部工作原理不仅仅是科学好奇心的问题——我们的知识缺陷限制了审计神经网络的能力,在高风险场景中,确保其安全性。通常,如果要部署关键软件,可以审查代码的所有执行路径,但

0 人收藏 0 人点赞
← 返回首页

提交意见反馈