model-activations

标签

Cards List
#model-activations

@Jack_W_Lindsey: 以下是我目前认为最重要的问题:-- 更好的方法来“解读”模型激活…

X AI KOLs Timeline · 昨天 缓存

这条推文讨论了AI可解释性中的关键问题,特别是将神经网络激活解码为人类可读语言的方法进展。

0 人收藏 0 人点赞
#model-activations

Anthropic 发现 Claude 在静默中推理(J-space)——我们对开源的 Qwen3-8B 使用了同一方法

Reddit r/LocalLLaMA · 2026-07-12

Anthropic 在 Claude 的激活中发现了静默推理(J-space)。作者在本地将同一雅可比透镜应用于 Qwen3-8B,利用它检测工具调用前的散文偏移,并实现代理防护。

0 人收藏 0 人点赞
#model-activations

@IbrahimDagher20: 先是J-space的发现,现在又是探测方面的巨大改进。机械可解释性显然在加速,部分原因是……

X AI KOLs Timeline · 2026-07-08 缓存

GoodfireAI 推出了块稀疏特征化器(BSFs),这是一种新的研究方法,利用多维块而非单一方向来发现模型激活中的概念。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈