@Tiberiu_Musat_: LLM训练中到底发生了什么?我们能否理清那数十亿个相互作用的参数?在最新研究中…

X AI KOLs Timeline 论文

摘要

这份预印本揭示,在特定的数据对称性下,LLM的训练动态可以简化为一个低维子空间,从而使分析更易处理且更具可解释性,每个坐标都对应一个清晰的机制。

LLM训练中到底发生了什么?我们能否理清那数十亿个相互作用的参数?在我们最新的预印本中,我们提出了一个很有前景的方向。 在特定的数据对称性下,参数空间在训练过程中会存在一个具有自洽动态的低维子空间。如果训练从这个子空间开始,它就不会离开。 该子空间维度较低,这意味着我们可以将训练动态简化为少量伪参数。这使得理论和实验分析更加容易处理。 此外,该子空间具有高度的可解释性:每个坐标都对应一个清晰的机制。例如,一个induction head由该子空间中的三个方向组成。 非常感谢我的合著者 @tpimentelms @NicolasZucchet 论文链接见第一条回复
查看原文
查看缓存全文

缓存时间: 2026/07/17 00:24

LLM 训练过程中到底发生了什么?我们能否理解那数十亿个相互作用的参数?在我们最新的预印本中,我们提出了一个很有前景的方向。

在特定的数据对称性条件下,参数空间在训练过程中会呈现出一个具有自包含动态的低维子空间。如果训练从该子空间开始,它就永远不会离开。

该子空间维度很低,这意味着我们可以将训练动态简化为少量伪参数。这使得理论和实验分析变得容易得多。

此外,该子空间具有高度的可解释性:每个坐标对应一个清晰的机制。例如,一个归纳头(induction head)由该子空间中的三个方向组成。

非常感谢我的合作者 @tpimentelms @NicolasZucchet

论文链接见首条回复。

相似文章

LLMs 并非你所认为的黑箱

Hacker News Top

一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。