我构建了一个工具,能实时展示GPT-2在生成文本时的“思维”过程:每个令牌的概念激活3D图 [R]

Reddit r/MachineLearning 工具

摘要

一位开发者构建了AXON,该工具利用稀疏自编码器将GPT-2的内部概念激活可视化为实时3D力导向图,使用户能够在令牌生成前看到可解释特征的激活情况。

过去几周我一直在探索机械可解释性的兔子洞,最终构建了名为AXON的东西。理念是:每次GPT-2生成一个令牌时,其残差流会经过一个稀疏自编码器(Joseph Bloom预训练的SAE)。SAE将其分解为人类可解释的特征:例如“欧洲地理”、“首都城市”、“法语”等,并通过WebSocket流式传输到浏览器,在那里它们以实时3D力导向图的形式呈现。节点=SAE特征。边=在同一令牌上共同激活的特征。节点亮度=激活强度。整个图形逐令牌演变。最令我惊讶的是:输入“法国的首都是”,你可以直观地看到地理特征、专有名词特征和完成模式特征在“巴黎”这个词生成之前就点亮了。有趣的不是模型输出了什么,而是它决策之前发生了什么。技术栈:后端使用TransformerLens + SAELens,FastAPI WebSocket用于流式传输,前端使用Three.js + 3d-force-graph。可在CPU(约800毫秒/令牌)或GPU(4050上约35毫秒)上运行。标签来自Neuronpedia的API并本地缓存。你还可以替换其他模型——GPT-2 medium/large/xl、Pythia变体、Gemma-2-2B——只要SAELens中有对应的预训练SAE。GitHub:https://github.com/09Catho/axon 欢迎反馈和星星,特别是来自接触过SAE的人——好奇共激活边在这一层是否有实际意义,还是只是噪音。
查看原文

相似文章

从 GPT-4 中提取概念

OpenAI Blog

OpenAI 推出稀疏自编码器作为从 GPT-4 等大型语言模型中提取和解释概念的方法,解决了理解神经网络行为这一根本挑战。他们发布了研究论文、代码和特征可视化工具,帮助研究人员大规模训练自编码器,并通过更好的可解释性提高 AI 安全性。