一种训练好的快速权重记忆:一个3M参数Transformer在推理时安装从未训练过的规则,仅前向传播——其中测试时训练不传递任何内容(单块RTX 3090,完全可复现)

Reddit r/LocalLLaMA 论文

摘要

本文介绍了一种用于3M参数Transformer的训练好的快速权重记忆机制,该机制在推理时通过仅前向传播的测试时训练安装从未训练过的规则,且不产生任何迁移。该工作可在单块RTX 3090上完全复现。

暂无内容
查看原文

相似文章

语言模型需要睡眠

Hugging Face Daily Papers

本文提出了一种针对Transformer模型的类睡眠巩固机制,该机制利用快速权重和递归传递来改进长上下文处理,同时保持推理速度。

Maglev:滑动循环记忆

arXiv cs.LG

提出了Maglev,一种具有固定大小记忆的循环Transformer架构,它在训练期间保持可并行化的同时,推广了滑动窗口注意力。它使用预填充器和解码器,并采用记忆一致性损失,在验证损失和下游基准测试上优于基线。