AstroPT 对星系的了解,以及它能教给我们关于 LLMs 的知识
摘要
本文提出使用 AstroPT(一个在星系图像上训练的 transformer)作为研究训练中概念涌现的测试平台,发现星系属性以固定的难度顺序涌现,这可以为大型语言模型的机制可解释性方法提供参考。
查看缓存全文
缓存时间: 2026/08/26 03:18
论文页面 - AstroPT对星系的认知,以及这如何启发力学可解释性研究
来源:https://huggingface.co/papers/2608.22614
摘要
通过使用具有已知物理概念排序的星系图像Transformer模型,本研究表明线性探测器能够恢复真实结构,并且在训练过程中概念会按照固定的难度顺序出现。
可解释性研究日益关注概念在训练过程中何时出现,以及线性探测器(https://huggingface.co/papers?q=linear%20probes)是否能够恢复真实结构,但在语言模型中这些主张难以验证,因为语言本身缺乏概念的真实排序或其间的明确关系。我们提出利用天文真实数据作为校准测试平台——即通过AstroPT(https://huggingface.co/papers?q=AstroPT),一个在数百万星系图像上训练的Transformer模型。AstroPT(https://huggingface.co/papers?q=AstroPT)是一个类大语言模型,其训练领域内概念难度排序及概念间关系是预先已知的。通过在模型检查点(https://huggingface.co/papers?q=checkpoints)、不同层、不同模型规模及不同训练目标之间探测冻结表示(https://huggingface.co/papers?q=frozen%20representations),我们发现星系属性(https://huggingface.co/papers?q=galaxy%20properties)的出现遵循固定顺序,该顺序与已知难度一致——几乎直接编码在像素中的量(如波段星等(https://huggingface.co/papers?q=band%20magnitude))在训练早期且在网络浅层即可被解码,而基于多波段/光谱的推断量(如红移(https://huggingface.co/papers?q=redshift)和比恒星形成率(https://huggingface.co/papers?q=specific%20star%20formation%20rate))则出现较晚且位于网络深层。此顺序对测试的训练目标具有不变性,其规模随模型容量增大但序列保持不变。我们的线性探测方向进一步恢复了星系属性(https://huggingface.co/papers?q=galaxy%20properties)之间已知的物理结构。研究结果表明,天文学为校准我们通常盲用于大语言模型的力学可解释性(https://huggingface.co/papers?q=mechanistic%20interpretability)方法提供了可控的实验沙箱。
查看arXiv页面 (https://arxiv.org/abs/2608.22614)查看PDF (https://arxiv.org/pdf/2608.22614)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.22614)
在您的Agent中获取此论文:
hf papers read 2608\.22614
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无模型链接此论文 在模型README.md中引用arxiv.org/abs/2608.22614以从此页面链接。
引用此论文的数据集 0
暂无数据集链接此论文 在数据集README.md中引用arxiv.org/abs/2608.22614以从此页面链接。
引用此论文的Space 0
暂无Space链接此论文 在Space README.md中引用arxiv.org/abs/2608.22614以从此页面链接。
包含此论文的收藏 0
暂无收藏包含此论文 将此论文添加到收藏 (https://huggingface.co/new-collection)以从此页面链接。
相似文章
@songhan_mit: 探索简化 OPD 以高效进行 LLM 后训练:
本文介绍了一种简化 OPD 以实现大语言模型高效后训练的方法。
理解大型语言模型
本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。
@v0xium: 我强烈推荐阅读Dan Jurafsky和James H. Martin的《Speech and Language Processing》中的Transformer章节…
推荐阅读Dan Jurafsky和James H. Martin的免费书籍《Speech and Language Processing》中的Transformer章节,这是理解LLM背后数学的最佳资源之一,并包含引用关于LLM预训练的解释。
利用具备上下文学习能力的 LLM 进行算法理论物理研究
本文探讨了利用大型语言模型(特别是 Claude)结合计算机代数系统(Maple)来执行理论物理中的算法计算,例如分析宇宙学扰动。
大型语言模型的地理空间概念探测:抽象性、组合性与接地
本文引入了一个以概念为中心的基准,用于探测LLM对方向、距离和拓扑等地理空间概念的理解,测试不同模型架构和规模下的抽象性、组合性与接地性。研究结果揭示了当前LLM在概念理解上的明显局限。