long-context-models

标签

Cards List
#long-context-models

HeadWiseKV:针对混合长上下文语言模型的预算化每头缓存驻留

arXiv cs.AI · 2026-09-03 缓存

HeadWiseKV 是一个无需训练的框架,用于压缩混合长上下文语言模型中的KV缓存,在保持质量的同时减少GPU内存使用并扩展上下文长度。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈