@AnthropicAI:为了支持其他研究人员获得NLA的实践经验,我们与Neuronpedia合作,在…上发布了NLA
摘要
Anthropic与Neuronpedia合作,在开放模型上发布了自然语言自编码器(NLAs),使研究人员能够获得这种可解释性工具的实践经验。
查看缓存全文
缓存时间: 2026/05/08 09:59
为帮助其他研究人员获得自然语言自动编码器(NLA)的实操经验,我们与Neuronpedia合作,在开放模型上发布了NLA。
在此处尝试:https://t.co/8duHfPR1Jy
自然语言自动编码器
来源:https://www.neuronpedia.org/nla
© Neuronpedia 2026
隐私与条款(https://www.neuronpedia.org/privacy)
博客(https://www.neuronpedia.org/blog)
GitHub(https://github.com/hijohnnylin/neuronpedia#readme)
Slack(https://join.slack.com/t/opensourcemechanistic/shared_invite/zt-3m2fulfeu-0LnVnF8yCrKJYQvWLuCQaQ)
Twitter(https://twitter.com/neuronpedia)
联系(https://www.neuronpedia.org/contact)
相似文章
自然语言自编码器:将 Claude 的思考转化为文本
Anthropic 推出了自然语言自编码器(NLA),这是一种将内部 AI 激活状态转化为人类可读文本的方法,有助于更好地理解模型的思考过程,并通过揭示隐藏的推理逻辑来提升安全性。
@AnthropicAI:我们还与Neuronpedia合作,在开放权重模型上创建了我们方法的交互式演示。在此尝试:
Anthropic与Neuronpedia合作,发布了Jacobian Lens,这是一个在开放权重模型上解释其方法的交互式演示。
@latkins: 我们很高兴推出 NAC,以及我们扩展版 Open Models API 的测试版。NAC 是我们研究团队的一个内部工具…
Cohere 推出 NAC,这是一个用于长时间运行的异步 AI 研究任务的内部工具,以及其扩展版 Open Models API 的测试版。
你现在可以读懂Gemma 3的想法了
Anthropic和Neuronpedia发布了关于自然语言自动编码器(NLA)的研究和工具,用户可以在Gemma 3生成token时查看其内部的“想法”。此次发布包括了Auto Verbalizer和Activation Reconstructor的模型权重,托管在Hugging Face和Neuronpedia上。
@NousResearch:今天我们发布对比神经元归因(CNA),一种通过识别和消融稀疏电路来引导LLM行为的方法…
NousResearch 发布了对比神经元归因(CNA),该方法通过消融稀疏的 MLP 电路来引导 LLM 行为,无需训练稀疏自编码器或降低基准测试性能,并在多达 70B 参数的模型的拒绝电路上验证了有效性。