我们移除了一个语言模型说德语的能力(3分钟阅读)
摘要
GoodfireAI发布了一项关于理解语言模型中神经几何结构的研究议程,展示了精确控制模型能力的可能性,例如移除其说德语的能力。
Goodfire AI团队通过仅对4个德语标记进行微调,移除了一个67参数的语言模型预测德语文本的能力。
查看缓存全文
缓存时间: 2026/06/26 17:10
# @GoodfireAI 在 Thread Reader App 上的帖子
来源:https://threadreaderapp.com/thread/2070181051801235463.html
神经网络也许会说英语,但它们是按形状思考的。
理解它们丰富的*神经几何*,是理解其运作方式的关键——也是精确调试和控制它们的关键。
从今天开始,我们将陆续发布一系列关于这一研究议程的帖子。🧵 视频海报
正如现实世界具有高度结构,神经网络也充满了丰富的几何结构:时间、空间、数字、颜色、生命之树、新的生物标记物等,都以弯曲的路径和曲面形式被表征。
这一点在模型、模态和领域中都成立!(2/8)
理解这种“神经几何”的新方法,是理解、改进和控制模型的前沿关键所在。(3/8)
相似文章
@GoodfireAI:神经网络可能说英语,但它们用形状思考。理解它们丰富的*神经几何*是…
Goodfire AI宣布了一项新的研究议程,专注于神经几何,以提升对神经网络的理解、调试和控制。
LLM神经解剖学第三部分 - LLMs似乎以几何而非语言思考
研究人员分析了LLMs在8种语言和多个模型中的内部表示,发现概念思考发生在transformer中间层的几何空间中,且与输入语言无关,这支持了类似于乔姆斯基理论的普遍深层结构假说,而非萨丕尔-沃尔夫语言相对论。
原生可遗忘的大语言模型
该论文提出了NULLs(原生可遗忘的大语言模型),这是一种模型类别,它将特定来源的贡献隔离到稀疏激活的sinks中,同时共享骨干神经元,从而无需重新训练即可干净地遗忘单个数据源,并保持通用语言能力。
你现在可以读懂Gemma 3的想法了
Anthropic和Neuronpedia发布了关于自然语言自动编码器(NLA)的研究和工具,用户可以在Gemma 3生成token时查看其内部的“想法”。此次发布包括了Auto Verbalizer和Activation Reconstructor的模型权重,托管在Hugging Face和Neuronpedia上。
@mtschannen:过去几年,我的研究重点是跨模态统一模型与训练范式。今天我很激动……
谷歌DeepMind研究员宣布发布Gemma 4 12B,一种无编码器的密集模型,可处理文本、图像和音频输入,延续了跨模态统一模型的研究工作。