@somi_ai: 如果这个有效,你就不用每个应用都选一个模型了。便宜的模型处理无聊的任务。遇到困难的任务时,你把整个对话交给大模型,它不需要重新阅读。
摘要
NVIDIA的论文介绍了一种在AI模型之间传输KV缓存的方法,使目标模型可以完全跳过预填充阶段,并实现2.7到25倍更快的转换速度,这可能会提高多模型应用的效率。
查看缓存全文
缓存时间: 2026/09/09 11:51
若这项技术得以实现,我们便无需为每个应用单独选择一个模型。
廉价模型处理那些例行任务,当遇到复杂难题时,你将整个对话交给大模型,它无需重读任何先前内容。这种交接目前需要完整的预填充过程,正因如此人们通常懒得这么做。
除非在长对话中亲眼见证,否则我难以相信其可行性。
Akshay 🚀 (@akshay_pachaar): NVIDIA 这篇论文太精妙了。
他们找到了实现模型间 KV 缓存迁移的方法。
目标模型可完全跳过预填充步骤,转换速度比重新处理上下文快 2.7 到 25 倍。
让我们理解为何此突破在当下如此重要。
大语言模型API目前
相似文章
@akshay_pachaar: NVIDIA的精彩论文。他们找到了一种使KV缓存可在模型间转移的方法。目标模型跳过预填充…
NVIDIA的论文介绍了一种在LLM模型间传输KV缓存的方法,使目标模型能够跳过预填充,实现比重新处理上下文快2.7到25倍的转换。
@QuixiAI: 教训总结:始终使用BF16 KV缓存。我之前用的是turboquant。是的,VRAM消耗很糟糕——所以另一个技巧是…
作者分享了使用BF16 KV缓存而非turboquant进行AI模型优化的技术经验,并在SlimServe中为Qwen模型实现了CPU卸载以管理VRAM消耗。
模型在预填充阶段做笔记:KV缓存可编辑且可组合
本文提出,Transformer中的KV缓存充当了记忆化结论的笔记本,使得无需完全重计算即可进行精确编辑和组合。该方法在保持跨模型规模决策等价性的同时,实现了显著的延迟降低。
AI成本的很大一部分只是模型一遍又一遍地重读相同的文本。有趣的修复尝试,带有公开证明
Corbenic AI声称为大语言模型提供无损KV缓存重用,允许存储的模型内存在不同机器和GPU代际之间逐比特恢复,并通过公开校验和进行验证。该项目包括一个开源的小模型,训练成本约600欧元,使整个流程可审查。
Nvidia的Switchyard路由器在任务中途重新编排AI模型,自测任务成本降至三分之一(8分钟阅读)
Nvidia发布了Nemotron 3.5 Lightning,这是一个300亿参数的开源混合专家模型,以及NeMo Switchyard,一个开源路由库,可动态地将AI智能体工作流的每一步分配给最合适的模型。Nvidia声称,这种组合可以将智能体任务成本降低至约三分之一,同时保持前沿水平的性能。