AstroPT 对星系的了解,以及它能教给我们关于 LLMs 的知识

Hugging Face Daily Papers 论文

摘要

本文提出使用 AstroPT(一个在星系图像上训练的 transformer)作为研究训练中概念涌现的测试平台,发现星系属性以固定的难度顺序涌现,这可以为大型语言模型的机制可解释性方法提供参考。

可解释性研究越来越多地询问概念在训练中何时涌现以及线性探测是否能恢复真实结构,但在语言模型中,这些说法很难验证,因为语言很少提供概念或它们之间关系的 ground-truth 顺序。我们提出通过 AstroPT(一个在数百万星系图像上训练的 transformer)使用天文学 ground-truth 作为校准测试平台。AstroPT 是一个类 LLM 模型,在一个概念的难度顺序及其关系已预先知晓的领域中进行训练。通过在检查点、层、模型大小和目标选择上探测冻结的表示,我们发现星系属性以固定的顺序涌现,该顺序跟踪它们的已知难度——几乎直接写入像素的量(波段星等)在训练早期且在网络浅层即可解码,而基于多波段/光谱和推断的量(如红移和比恒星形成率)则涌现得更晚且更深。这个顺序对我们的测试目标是不变的,并且在规模上随容量增加而增强,但顺序不变。我们的线性探测方向进一步恢复了星系属性之间已知的物理结构。我们的发现表明,天文学提供了一个受控的沙盒环境,用于校准机制可解释性方法,否则我们将盲目地将其应用于 LLMs。
查看原文
查看缓存全文

缓存时间: 2026/08/26 03:18

论文页面 - AstroPT对星系的认知,以及这如何启发力学可解释性研究

来源:https://huggingface.co/papers/2608.22614

摘要

通过使用具有已知物理概念排序的星系图像Transformer模型,本研究表明线性探测器能够恢复真实结构,并且在训练过程中概念会按照固定的难度顺序出现。

可解释性研究日益关注概念在训练过程中何时出现,以及线性探测器(https://huggingface.co/papers?q=linear%20probes)是否能够恢复真实结构,但在语言模型中这些主张难以验证,因为语言本身缺乏概念的真实排序或其间的明确关系。我们提出利用天文真实数据作为校准测试平台——即通过AstroPT(https://huggingface.co/papers?q=AstroPT),一个在数百万星系图像上训练的Transformer模型。AstroPT(https://huggingface.co/papers?q=AstroPT)是一个类大语言模型,其训练领域内概念难度排序及概念间关系是预先已知的。通过在模型检查点(https://huggingface.co/papers?q=checkpoints)、不同层、不同模型规模及不同训练目标之间探测冻结表示(https://huggingface.co/papers?q=frozen%20representations),我们发现星系属性(https://huggingface.co/papers?q=galaxy%20properties)的出现遵循固定顺序,该顺序与已知难度一致——几乎直接编码在像素中的量(如波段星等(https://huggingface.co/papers?q=band%20magnitude))在训练早期且在网络浅层即可被解码,而基于多波段/光谱的推断量(如红移(https://huggingface.co/papers?q=redshift)和比恒星形成率(https://huggingface.co/papers?q=specific%20star%20formation%20rate))则出现较晚且位于网络深层。此顺序对测试的训练目标具有不变性,其规模随模型容量增大但序列保持不变。我们的线性探测方向进一步恢复了星系属性(https://huggingface.co/papers?q=galaxy%20properties)之间已知的物理结构。研究结果表明,天文学为校准我们通常盲用于大语言模型的力学可解释性(https://huggingface.co/papers?q=mechanistic%20interpretability)方法提供了可控的实验沙箱。

查看arXiv页面 (https://arxiv.org/abs/2608.22614)查看PDF (https://arxiv.org/pdf/2608.22614)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.22614)

在您的Agent中获取此论文:

hf papers read 2608\.22614

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

暂无模型链接此论文 在模型README.md中引用arxiv.org/abs/2608.22614以从此页面链接。

引用此论文的数据集 0

暂无数据集链接此论文 在数据集README.md中引用arxiv.org/abs/2608.22614以从此页面链接。

引用此论文的Space 0

暂无Space链接此论文 在Space README.md中引用arxiv.org/abs/2608.22614以从此页面链接。

包含此论文的收藏 0

暂无收藏包含此论文 将此论文添加到收藏 (https://huggingface.co/new-collection)以从此页面链接。

相似文章

理解大型语言模型

arXiv cs.CL

本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。