stream-factorized-attention

标签

Cards List
#stream-factorized-attention

大规模下的Hidden Decoding: 大型语言模型的潜在计算扩展

arXiv cs.CL · 2026-07-10 缓存

本文介绍了Hidden Decoding,这是一种针对LLM的序列长度扩展方法,通过将每个令牌扩展为多个具有独立嵌入表的流,并在每个令牌内增加内部计算,同时使用Stream-Factorized Attention来保持低成本。在多达617B参数的模型上的实验显示,该方法较基线有一致的改进,展示了一条实用的固定骨干扩展路径。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈