标签
Anthropic和Neuronpedia发布了关于自然语言自动编码器(NLA)的研究和工具,用户可以在Gemma 3生成token时查看其内部的“想法”。此次发布包括了Auto Verbalizer和Activation Reconstructor的模型权重,托管在Hugging Face和Neuronpedia上。
Anthropic与Neuronpedia合作,在开放模型上发布了自然语言自编码器(NLAs),使研究人员能够获得这种可解释性工具的实践经验。