PSSA,一种塑性状态空间模型,在留出文本上超越了参数匹配的Transformer,并在CPU上生成速度快约12倍

Reddit r/artificial 模型

摘要

一种名为PSSA的新AI架构在文本生成任务中超越了参数匹配的Transformer,并且在CPU上速度快12倍,其实现细节和代码可在GitHub上获取。

我从零开始构建了一个名为PSSA(塑性状态空间架构)的架构,并在相同的语料库、相同的12.7M tokens、相同的分词器和调度器下,与参数匹配的Transformer基线进行训练。在双方都未见过的198,939 token切片上的留出结果:交叉熵3.997 vs 4.429,困惑度54.4 vs 83.8,下一个token准确率24.1% vs 18.0%。我在未见过的文本上评分了每次运行的所有检查点(64个PSSA检查点,43个Transformer检查点),曲线从未交叉。在同一个CPU上,使用相同的提示和采样器生成200个token耗时226毫秒 vs 2735毫秒,快约12倍。它是用Rust编写的,具有CPU和CUDA后端,没有PyTorch。损失曲线、完整设置和评估命令在这里:https://github.com/Sparticle62ops/pssa
查看原文

相似文章

更好的语言模型及其影响

OpenAI Blog

OpenAI 推出 GPT-2,这是一个拥有 15 亿参数的基于 Transformer 的语言模型,在 40GB 的互联网文本上进行训练,在语言建模基准上达到了最先进的性能,并在阅读理解、翻译、问答和摘要生成等任务上展示了零样本学习能力。出于安全考虑,仅公开发布了较小的模型和技术论文,而非完整的训练模型。

我仅能腾出小规模来摆弄Transformer

Reddit r/LocalLLaMA

一名学生介绍了Silia,这是一种新颖的Transformer架构,将注意力机制和前馈网络合并为统一操作,以在≤10M参数规模下节省参数,尽管计算资源有限,仍以更少的参数实现了与GPT-2相当的性能。

Kathleen写作:无注意力机制的自回归生成与数据规模扩展

arXiv cs.CL

Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。