Fractale-350M-base: memory as trained behaviour instead of long context, a fully open research release
摘要
Fractale-350M-base 是一个386M参数的基础模型,从零开始预训练,采用新颖的训练快速权重记忆库(8个向量)替代长上下文,完全开源,包括权重、代码和研究日志。
有些人可能还记得我关于背后研究项目的帖子:一种经过训练的快速权重记忆,论文和完整研究日志在 github.com/kkuette/thought-bank。这是后续。系列中的第一个公开模型已发布。
简要背景:独立研究者,一块 RTX 3090 用于所有低于 97M 参数的工作,公开与 Claude 合作进行实现和撰写。方向与判断由我负责。
它是什么。
Fractale-350M-base 是一个 386M 参数的基础模型,从零开始预训练,使用 10B tokens(代码 + 英文网页)围绕一个想法:模型唯一的长期记忆是一个由 8 个向量组成的库,它自己写入,每个 512 token 块一个要点向量,最旧的 FIFO 驱逐。该库作为快速权重被读回:每个槽位通过超网络扩展成一个小的低秩 MLP,token 流经过其中。不是检索,也不是对存储文本的注意力。记忆成为前向传播的一部分。上下文窗口故意很小(512 token 块)。每个块是一个独立的前向传播,因此任何比当前块更早的内容只能通过那 8 个向量影响预测。预训练目标迫使库变得重要:仅从库(空白输入)预测文档下一个从未见过的块的开头。
可测量的内容。
GAP = CE(重置库)减去 CE(携带库)在保留文档上:代码上 +9.4 nats(CE 12.9 重置 vs 3.45 携带),网页上 +7.3 nats,在最终检查点,从写入 2 到 8 块保持平稳(无 FIFO 悬崖)。并且在训练过程中差距从两侧扩大:仅库分支不断锐化,而无库分支退化,意味着随着预训练进行,模型越来越依赖其记忆。在更小的规模上,精确控制:内容可通过线索寻址,在驱逐后仍存活超过 2000 步,并在文档字符串和代码之间双向传输。从论文(3M 规模机制,Zenodo 上的 DOI):单个 13 token 输入在未见过的查询上以 0.79 到 1.00 的准确率安装一个从未训练过的规则,而测试时训练拟合自己的示例且不转移任何内容,成本是其 138 倍。
它不是什么。
它是一个基础模型,不是聊天模型:没有指令微调,没有对齐,在 386M 和 10B tokens 下,原始流畅度如你所料。库携带要点(领域、语域、结构、声明的事实),而非逐字文本。要求它引用第三行,它做不到。并且 GAP 将模型与没有记忆的自身进行比较,而不是与匹配计算的注意力基线比较。那个强有力论点(是的,我之前在这里承诺过的门控 DeltaNet 那个)存在于研究仓库中。
有趣的部分:记忆是一种你握在手里的状态。
from fractale import BankSession
sess = BankSession.from_pretrained("fractale-lm/Fractale-350M-base")
sess.read(open("long_doc.txt").read()) # any length, no growing prompt
print(sess.continuation(32)) # predicted from the 8 notes ALONE
print(sess.continuation(32, use_bank=False)) # amnesic control: the difference IS the memory
sess.save_bank("doc.bank") # a few kB; restore tomorrow, or transplant into another session
一切都是开放的:模型和卡片(训练混合,包括 NaN 事件)在 huggingface.co/fractale-lm/Fractale-350M-base,使用工具包在 github.com/fractale-lm/fractale,研究日志包含每个声明的精确复现命令在 github.com/kkuette/thought-bank,论文在 Zenodo。仓库还附带一个脚本,可从固定提交(repro/phase1)复现整个预训练。运行总成本:约 320 美元租用的 8xA100 时间,自费。
第二阶段(探索性):教它有意使用记忆。将记忆视为行为的指令微调,然后将库作为工作记忆进行强化学习。乐意回答任何问题,并且真诚地感兴趣当你戳它时什么会坏。
链接
- 权重 + 模型卡片:https://huggingface.co/fractale-lm/Fractale-350M-base
- 使用工具包(推理不同于经典 LM,你携带库状态而不是增长提示):https://github.com/fractale-lm/fractale
- 研究仓库(训练代码、发现、探针):https://github.com/kkuette/thought-bank
- 完整第一阶段复现脚本(8x A100,固定提交):https://github.com/fractale-lm/fractale/tree/main/repro/phase1
相似文章
一种训练好的快速权重记忆:一个3M参数Transformer在推理时安装从未训练过的规则,仅前向传播——其中测试时训练不传递任何内容(单块RTX 3090,完全可复现)
本文介绍了一种用于3M参数Transformer的训练好的快速权重记忆机制,该机制在推理时通过仅前向传播的测试时训练安装从未训练过的规则,且不产生任何迁移。该工作可在单块RTX 3090上完全复现。
介绍 DWARF-55M-Base
DWARF-55M-Base 是一种新型语言模型,采用近乎全稀疏注意力架构(DSQG),仅包含一个完整因果注意力层,能够实现高达2048 token的可靠检索,并可外推至该上下文长度的3倍。该模型作为研究原型发布,供社区实验使用。
nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4
NVIDIA 发布 Nemotron-3-Ultra,一个拥有 5500 亿参数的开源权重模型,采用结合 Mamba-2、MoE 和注意力的混合架构,支持高达 100 万 token 的上下文长度和可配置的推理模式。
@Ex0byt: 一个必须收藏的.. 小但厉害的团队, 4个H100节点, 开源三阶段训练方案, 在8k合成评分任务上训练, fu…
一个小团队在学术预算下,仅使用32块H100和8K个合成样本,训练了一个前沿级别的深度研究智能体,并完全公开了从2B到35B模型的权重、代码和论文,这些模型在关键基准测试中匹配或超越了封闭的前沿智能体。
DeepReinforce 发布 Ornith-1.0 开源编程模型(2分钟阅读)
DeepReinforce 开源了 Ornith-1.0,这是一系列自我改进的编程模型,参数从 9B 到 397B 不等,基于 Gemma 4 和 Qwen 3.5 基础模型训练,采用了一种新颖的强化学习方法,能够学习生成自己的脚手架。