LLM神经解剖学第三部分 - LLMs似乎以几何而非语言思考
摘要
研究人员分析了LLMs在8种语言和多个模型中的内部表示,发现概念思考发生在transformer中间层的几何空间中,且与输入语言无关,这支持了类似于乔姆斯基理论的普遍深层结构假说,而非萨丕尔-沃尔夫语言相对论。
大家好,Reddit的朋友们!上个月,我发布了LLM神经解剖学系列文章的第三部分,之后就去度假了🏝️。不幸的是,内容有点'草率',因为我没有时间进行润色,所以我下架了文章并删除了Reddit帖子。上周末,我进行了修订,并加入了Gemma-4 31B的结果!我也正在完成Gemma-4-31B-RYS(分析将整夜运行),并且本周也将发布Qwen3.6-35B-RYS。好了,如果你一直在关注这个系列,你会记得在第二部分里,我说LLMs似乎用一种通用语言思考?那是一个小实验,比较了中文和英文。这次我深入了。
太长不看 太长不看:使用一个有趣的新技术,你可以看到LLMs如何将概念组织为向量。通过比较多种语言中的多个概念这一巧妙的技巧,我们可以看到在transformer栈中,LLM是在根据它读写的语言'思考',还是根据实际主题思考。萨丕尔-沃尔夫假说简单来说就是语言塑造了你所能和所不能思考的内容。博客中的数据表明,语言(对于LLMs而言,我并未声称对人类也是如此)只是输入/输出,而思考发生在中间层,这些层是关于概念的向量。
给那些(我知道)不会读博客的人一个太长不看版:
1. 我将实验从2种语言扩展到8种(英语、中文、阿拉伯语、俄语、日语、韩语、印地语、法语),涵盖4种不同模型(Qwen3.5-27B、MiniMax M2.5、GLM-4.7、GPT-OSS-120B和Gemma-4 31B)。**所有五个模型都显示了相同的结果。** 在中间层,一个关于光合作用的印地语句子更接近日语的光合作用句子,而不是印地语的烹饪句子。语言身份基本上消失了!
2. 然后我做了更难的测试:英文描述、Python函数(仅使用单字母变量,不能通过调用变量'velocity'来作弊)以及相同概念的LaTeX方程。½mv²、`0.5 * m * v ** 2`和"质量乘以速度平方的一半"开始**在模型的内部空间中汇聚到同一区域。**
3. 这一现象在来自五个不同机构的密集transformer和MoE架构中得到了重现。这不是Qwen特有的。不是训练伪影,而似乎是一个收敛的解决方案。
4. 这篇博文将此与萨丕尔-沃尔夫(语言塑造思想→不,这些模型并非如此)和乔姆斯基(普遍深层结构→是的,但它是几何而非语法)联系起来。如果你喜欢这种技术宅的东西,你可能会喜欢这个讨论……
带有可交互PCA可视化的博客,你可以实际操作:[https://dnhkng.github.io/posts/sapir-whorf/](https://dnhkng.github.io/posts/sapir-whorf/)
代码和数据:[https://github.com/dnhkng/RYS](https://github.com/dnhkng/RYS)
在RYS方面:仍在与TurboDerp讨论基于指针的ExLlamaV3格式,以实现零VRAM开销的层复制。没有预计时间,但正在进行中。
再次强调,试试那个组件!它真的很酷,我保证!
相似文章
大脑-LLM对齐受训练数据影响,而非语言类型学
本文利用fMRI数据和多种LLM,研究了英语、中文和法语中的大脑-LLM对齐,发现训练语言主导性和类型距离(而非英语固有的优势)驱动了对齐模式。
多语言中数学推理的LLM参数:共享还是独立?
本文提出了一种跨语言的LLM数学推理机制分析,发现数学相关参数在不同语言之间存在部分重叠,主要集中于中间层。英语拥有最大规模的数学相关参数集,而低资源语言则拥有较小的参数集。
@haider1: Yann LeCun 表示,LLMs 在语言本身就是推理基础的领域(如数学和代码)中最强…
Yann LeCun 指出,LLMs 在语言作为推理基础的领域(如数学和代码)中最强,但它们并非有创造力的数学家、软件架构师或计算机科学家。
揭示大语言模型中的数学推理:内部机制的方法学研究
本文通过早期解码分析大语言模型的内部机制,研究其如何执行算术运算。研究发现,能力强的模型在推理任务中,注意力模块和 MLP 模块之间呈现明确的分工。
语言作为设计的潜在空间
本文探讨了人类语言是一种设计的潜在空间,它将推理约束为模式匹配和符号操作,并论证了LLM无法创造新语言来解决现有语言之外的问题。