标签
作者通过将提示分割成重叠的块来实验KV缓存混合,在Ling3-tiny上实现了预填充速度提升3倍,而不影响检索任务。
对13个本地LLM在65K-128K上下文下的广泛基准测试表明,预填充速度主导了代理工作负载性能(占实际时间的94-99%),使tg128指标具有误导性,并且KV头数量是比参数量或MoE/密集设计更关键的架构因素。
本文解释了在RAG应用中,预填充速度比解码速度更重要,并讨论了为何AMD的Strix Halo APU在交互式使用场景中表现不佳。