byte-level-language-model

标签

Cards List
#byte-level-language-model

Kathleen写作:无注意力机制的自回归生成与数据规模扩展

arXiv cs.CL · 2026-08-06 缓存

Kathleen系列的这篇论文表明,一个约0.5M参数、无注意力机制的字节级模型在WikiText-103语言建模和生成上可以击败参数匹配的transformer;引入了一种非参数的“形式距离”(Form Distance)度量来评估文本真实感;并证明从模型自身训练语料库进行检索增强解码能提高生成质量。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈