标签
这条推文讨论了AI可解释性中的关键问题,特别是将神经网络激活解码为人类可读语言的方法进展。
Anthropic 在 Claude 的激活中发现了静默推理(J-space)。作者在本地将同一雅可比透镜应用于 Qwen3-8B,利用它检测工具调用前的散文偏移,并实现代理防护。
GoodfireAI 推出了块稀疏特征化器(BSFs),这是一种新的研究方法,利用多维块而非单一方向来发现模型激活中的概念。