标签
本文介绍了 Adaptive-Scalable Entmax (ASEntmax),一种可学习的稀疏注意力机制,在transformers中实现高达1000倍的长度外推,提升长上下文泛化能力的同时保持短上下文性能。
EntmaxKV提出了一种面向entmax注意力的支持感知稀疏解码框架,通过利用加载页面之前的稀疏性来减少KV缓存内存流量,在长上下文基准测试中实现了显著的加速,同时保持输出质量。