标签
本文介绍了模块化TTT,这是一个将测试时训练的内部学习器表示为有向无环图的框架,能够对组件进行系统的消融和组合。作者在1000亿个token上训练了4.1亿和14.5亿参数规模的模型,取得了与GatedDeltaNet相当的性能。
Fractale-350M-base 是一个386M参数的基础模型,从零开始预训练,采用新颖的训练快速权重记忆库(8个向量)替代长上下文,完全开源,包括权重、代码和研究日志。
FAAST提出了一种前馈方法,通过解析方式将标注样本编译为快速权重,无需反向传播即可实现高效的测试时监督适应,在保持性能的同时提升90%以上的速度和节省95%的内存。