激活图谱简介
摘要
# 激活图谱简介 来源:[https://openai.com/index/introducing-activation-atlases/](https://openai.com/index/introducing-activation-atlases/) 理解神经网络内部工作原理不仅仅是科学好奇心的问题——我们的知识缺陷限制了审计神经网络的能力,在高风险场景中,确保其安全性。通常,如果要部署关键软件,可以审查代码的所有执行路径,但
我们与Google研究人员合作创建了激活图谱,这是一种用于可视化神经元之间相互作用所能表示内容的新技术。随着AI系统在越来越多敏感环境中的部署,更好地理解其内部决策过程将帮助我们识别弱点并调查故障。
查看缓存全文
缓存时间: 2026/04/20 14:57
# 激活图谱简介
来源:https://openai.com/index/introducing-activation-atlases/
理解神经网络内部发生的事情不仅仅是科学好奇心的问题——我们的理解不足会限制我们审计神经网络的能力,在高风险情况下,确保它们是安全的。通常,如果要部署一个关键的软件,可以审查代码的所有路径,甚至进行形式化验证,但对于神经网络,我们进行这类审查的能力目前要受限得多。借助激活图谱,人类可以发现神经网络中未预料到的问题——例如,网络依赖虚假相关性来分类图像的地方,或者在两个类别之间重复使用特征导致奇怪错误的地方。人类甚至可以利用这种理解来"攻击(在新窗口中打开) (https://arxiv.org/pdf/1312.6199.pdf)"模型,修改图像来欺骗它。
例如,可以创建一种特殊的激活图谱来展示网络如何区分煎锅和炒锅。我们看到的许多东西都是符合预期的。煎锅更呈方形,而炒锅更圆且更深。但模型似乎也学到了煎锅和炒锅还可以通过周围的食物来区分——特别是,炒锅的识别得到了面条的支持。在图像的角落添加面条会在 45% 的时间内愚弄模型!这与"对抗补丁(在新窗口中打开) (https://arxiv.org/pdf/1712.09665.pdf)"等工作相似,但基于人类的理解。
相似文章
ATLAS:智能体还是隐式视觉推理?一个词足矣
ATLAS提出了一种视觉推理框架,该框架通过功能标记将智能体操作和隐式表示相结合,实现了通过下一个标记预测和强化学习进行高效训练,同时避免了中间图像的生成。
AI Model Atlas – 将机器学习模型群体可视化为互联的3D图
AI Model Atlas 是一款可视化工具,用于将机器学习模型群体表示为互联的3D图,使用户能够探索模型分布。
从激活到因果:发现人脑中因果视觉表征
BrainCause框架利用生成模型和大脑模型来识别人类大脑中的因果神经表征,证明仅凭激活不足以确认概念表征。
AI Engram:探寻人工智能中的记忆痕迹
提出一个几何框架来识别“AI engrams”——深度神经网络中的记忆痕迹——将神经科学标准形式化为一个闭式估计器,使得从MLP到LLM的模型能够进行精确的记忆操作。
我构建了一个工具,能实时展示GPT-2在生成文本时的“思维”过程:每个令牌的概念激活3D图 [R]
一位开发者构建了AXON,该工具利用稀疏自编码器将GPT-2的内部概念激活可视化为实时3D力导向图,使用户能够在令牌生成前看到可解释特征的激活情况。