stateful-models

标签

Cards List
#stateful-models

SpecLA:面向线性注意力模型的高效推测解码

arXiv cs.CL · 2026-07-21 缓存

SpecLA 提出了一种专为有状态线性注意力模型设计的推测解码运行时,在搭载 GDN-1.3B 目标模型的 NVIDIA H100 上,相比自回归解码实现了最高 1.70 倍的端到端加速。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈