我们移除了一个语言模型说德语的能力(3分钟阅读)

TLDR AI 论文

摘要

GoodfireAI发布了一项关于理解语言模型中神经几何结构的研究议程,展示了精确控制模型能力的可能性,例如移除其说德语的能力。

Goodfire AI团队通过仅对4个德语标记进行微调,移除了一个67参数的语言模型预测德语文本的能力。
查看原文
查看缓存全文

缓存时间: 2026/06/26 17:10

# @GoodfireAI 在 Thread Reader App 上的帖子 来源:https://threadreaderapp.com/thread/2070181051801235463.html 神经网络也许会说英语,但它们是按形状思考的。 理解它们丰富的*神经几何*,是理解其运作方式的关键——也是精确调试和控制它们的关键。 从今天开始,我们将陆续发布一系列关于这一研究议程的帖子。🧵 视频海报 正如现实世界具有高度结构,神经网络也充满了丰富的几何结构:时间、空间、数字、颜色、生命之树、新的生物标记物等,都以弯曲的路径和曲面形式被表征。 这一点在模型、模态和领域中都成立!(2/8) 理解这种“神经几何”的新方法,是理解、改进和控制模型的前沿关键所在。(3/8)

相似文章

LLM神经解剖学第三部分 - LLMs似乎以几何而非语言思考

Reddit r/LocalLLaMA

研究人员分析了LLMs在8种语言和多个模型中的内部表示,发现概念思考发生在transformer中间层的几何空间中,且与输入语言无关,这支持了类似于乔姆斯基理论的普遍深层结构假说,而非萨丕尔-沃尔夫语言相对论。

原生可遗忘的大语言模型

arXiv cs.LG

该论文提出了NULLs(原生可遗忘的大语言模型),这是一种模型类别,它将特定来源的贡献隔离到稀疏激活的sinks中,同时共享骨干神经元,从而无需重新训练即可干净地遗忘单个数据源,并保持通用语言能力。

你现在可以读懂Gemma 3的想法了

Reddit r/LocalLLaMA

Anthropic和Neuronpedia发布了关于自然语言自动编码器(NLA)的研究和工具,用户可以在Gemma 3生成token时查看其内部的“想法”。此次发布包括了Auto Verbalizer和Activation Reconstructor的模型权重,托管在Hugging Face和Neuronpedia上。