linear-recurrence

标签

Cards List
#linear-recurrence

GLIDE: 引导的逐层混合注意力实现高效LLM推理

arXiv cs.AI · 4天前 缓存

GLIDE 引入一种逐层自适应机制,策略性地整合滑动窗口 softmax 注意力和线性循环聚合,实现高效 LLM 推理,在处理长上下文时减少 KV 缓存 I/O 和延迟,同时不牺牲质量。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈