fast-weights

标签

Cards List
#fast-weights

模块化TTT:将测试时训练重新构想为可组合模块

Hugging Face Daily Papers · 2026-08-07 缓存

本文介绍了模块化TTT,这是一个将测试时训练的内部学习器表示为有向无环图的框架,能够对组件进行系统的消融和组合。作者在1000亿个token上训练了4.1亿和14.5亿参数规模的模型,取得了与GatedDeltaNet相当的性能。

0 人收藏 0 人点赞
#fast-weights

Fractale-350M-base: memory as trained behaviour instead of long context, a fully open research release

Reddit r/LocalLLaMA · 2026-07-20

Fractale-350M-base 是一个386M参数的基础模型,从零开始预训练,采用新颖的训练快速权重记忆库(8个向量)替代长上下文,完全开源,包括权重、代码和研究日志。

0 人收藏 0 人点赞
#fast-weights

语言模型需要睡眠

Hugging Face Daily Papers · 2026-05-25 缓存

本文提出了一种针对Transformer模型的类睡眠巩固机制,该机制利用快速权重和递归传递来改进长上下文处理,同时保持推理速度。

0 人收藏 0 人点赞
#fast-weights

FAAST:通过闭式快速权重实现的前馈联想学习,用于测试时监督适应

Hugging Face Daily Papers · 2026-05-08 缓存

FAAST提出了一种前馈方法,通过解析方式将标注样本编译为快速权重,无需反向传播即可实现高效的测试时监督适应,在保持性能的同时提升90%以上的速度和节省95%的内存。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈