激活图谱简介

OpenAI Blog 论文

摘要

# 激活图谱简介 来源:[https://openai.com/index/introducing-activation-atlases/](https://openai.com/index/introducing-activation-atlases/) 理解神经网络内部工作原理不仅仅是科学好奇心的问题——我们的知识缺陷限制了审计神经网络的能力,在高风险场景中,确保其安全性。通常,如果要部署关键软件,可以审查代码的所有执行路径,但

我们与Google研究人员合作创建了激活图谱,这是一种用于可视化神经元之间相互作用所能表示内容的新技术。随着AI系统在越来越多敏感环境中的部署,更好地理解其内部决策过程将帮助我们识别弱点并调查故障。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:57

# 激活图谱简介 来源:https://openai.com/index/introducing-activation-atlases/ 理解神经网络内部发生的事情不仅仅是科学好奇心的问题——我们的理解不足会限制我们审计神经网络的能力,在高风险情况下,确保它们是安全的。通常,如果要部署一个关键的软件,可以审查代码的所有路径,甚至进行形式化验证,但对于神经网络,我们进行这类审查的能力目前要受限得多。借助激活图谱,人类可以发现神经网络中未预料到的问题——例如,网络依赖虚假相关性来分类图像的地方,或者在两个类别之间重复使用特征导致奇怪错误的地方。人类甚至可以利用这种理解来"攻击(在新窗口中打开) (https://arxiv.org/pdf/1312.6199.pdf)"模型,修改图像来欺骗它。 例如,可以创建一种特殊的激活图谱来展示网络如何区分煎锅和炒锅。我们看到的许多东西都是符合预期的。煎锅更呈方形,而炒锅更圆且更深。但模型似乎也学到了煎锅和炒锅还可以通过周围的食物来区分——特别是,炒锅的识别得到了面条的支持。在图像的角落添加面条会在 45% 的时间内愚弄模型!这与"对抗补丁(在新窗口中打开) (https://arxiv.org/pdf/1712.09665.pdf)"等工作相似,但基于人类的理解。

相似文章

ATLAS:智能体还是隐式视觉推理?一个词足矣

Hugging Face Daily Papers

ATLAS提出了一种视觉推理框架,该框架通过功能标记将智能体操作和隐式表示相结合,实现了通过下一个标记预测和强化学习进行高效训练,同时避免了中间图像的生成。

AI Engram:探寻人工智能中的记忆痕迹

arXiv cs.AI

提出一个几何框架来识别“AI engrams”——深度神经网络中的记忆痕迹——将神经科学标准形式化为一个闭式估计器,使得从MLP到LLM的模型能够进行精确的记忆操作。