标签
该预印本以对抗训练作为对照工具,在 GPT-2 Small 上检验表征简单性(SAE 可分解性、集中化归因)是否蕴含回路在因果上的简单性。研究发现,鲁棒模型具有更强的 SAE 可分解性,而回路规模则取决于机制区间:在高忠实度水平(90-95%)下,鲁棒性有所帮助,但在 85% 以下则无此效果。
本文介绍了一种使用GPT-2标记预测意外度来标注儿童语言中有界性的方法,发现儿童模型依赖于句法线索(如动词后限定词),而成人模型更多使用语义特征,支持了句法引导理论。
这个 GitHub 仓库提供了用于执行 GPT-2 的 CMake 脚本,使用 Q16.16 整数算术,包括运行完整模型和玩具模型的说明。
一位研究人员以不到250美元构建了一个拥有10.2亿参数的迷你版Kimi-K3模型,其HellaSwag得分达到33.4%,超过了GPT-2的28%得分。
逆向工程了RK3588 NPU并构建了一个开放编译器和运行时,以从PyTorch、ONNX和JAX运行GPT-2和SigLIP,无需供应商SDK。
本文从头训练了五个GPT-2风格模型,比较了针对泰米尔语、泰卢固语、卡纳达语和马拉雅拉姆语的专用单语模型与一个联合多语言模型,发现单语模型在情感分类和命名实体识别上优于mGPT,且分词器更高效。
Andrej Karpathy 发布了 nanochat,一个极简的 LLM 训练框架,只需约 48 美元就能训练出 GPT-2 级别的模型,涵盖预训练、微调和强化学习全流程,代码量极少且完全透明。
一个后续项目,将GPT-2的32,070个词元可视化为一棵位于庞加莱球中的交互式双曲树,允许用户在嵌入空间中飞越。
本文研究了GPT-2 Small在词元“特朗普”周围的嵌入几何,比较了离散化与连续最近邻方法,以理解表征结构。
本文研究了在不可能语言(信息局部性被破坏)上预训练的GPT-2模型如何恢复自然英语,显示出对更短依赖长度的偏好以及结构恢复与表层恢复之间的分离。
BABEL 编解码器实现了对 GPT-2 small 内部状态的首次完整解码,重构了其 94.7% 的行为,并支持用英语读写模型,同时提供开源资源和演示。
本文介绍了Manifestation Units,这是一种类型化元组协议,用于将机制可解释性分析中的每个组件的统计量组织成结构化、可查询的字段。该协议在视觉(β-VAE、CNN)和语言(GPT-2)模型上进行了演示,展示了改进的检索和因果充分性。
本文从因果中介分析重新推导激活修补,揭示自然间接效应(NIE)不仅捕捉组件的因果效应,还捕捉与其他组件的交互效应。文章在GPT-2 IOI电路中展示了这些隐藏交互,并论证它们是一种诊断工具而非干扰。
NanoEuler 是一个完全用纯 C/CUDA 从头构建的 GPT-2 规模语言模型,不依赖任何机器学习库,包括手写的前向/反向传播、字节级 BPE 分词器和训练流水线。该项目是一个教育示范,展示了 Transformer 训练背后的工程原理,可在单个 RTX 4070 上运行。
本文认为当前世界模型缺乏持久状态核心,提出一种混合方法,通过η-伪酉算子动力学添加时间因果结构,将预训练的GPT-2转化为时间推理模型。
本文探讨了语言模型能否独立发现零的概念,作为分布外泛化的一种形式。研究发现,GPT-2大小的模型在测试时无法做到,但通过零的示例训练后会有显著提升,并且语言预训练减少了所需示例的数量。
本文研究了使用η-伪幺正算子动力学将预训练的GPT-2转换为时间推理模型,提供了数学基础以及在PT对称性破缺转变和可逆/不可逆序列方面的关键发现。