kv-caching

标签

Cards List
#kv-caching

Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models

arXiv cs.CL · 5天前 缓存

Introduces Archer, a training-free KV caching method for diffusion language models that adaptively reuses cached hidden states to reduce recomputation while preserving rollback capabilities, achieving up to 2.95x speedup and improved generation quality.

0 人收藏 0 人点赞
#kv-caching

@shubh6200: 周末花了些时间阅读这篇文章,老实说真希望它早几年就存在。我们看的每个AI教程都…

X AI KOLs Timeline · 2026-08-02 缓存

一条推文推荐了一篇arXiv论文,该论文为应用数学家讲解了Transformer的数学基础,涵盖分词、嵌入、多头注意力和KV缓存。

0 人收藏 0 人点赞
#kv-caching

我将一份40页的PDF扔给ChatGPT,它瞬间回复了。我们来揭秘是怎么做到的。

Reddit r/artificial · 2026-07-13

详细解析了为什么向ChatGPT上传大型PDF不会显著减慢响应时间,涉及流式传输、KV缓存和并行预填充阶段等技术。

0 人收藏 0 人点赞
#kv-caching

@akshay_pachaar: 你在Anthropic参加机器学习工程师面试。面试官问:"我们的模型在42秒内生成100个token。H…

X AI KOLs Timeline · 2026-07-07 缓存

解释了KV缓存如何通过消除注意力键和值的冗余重计算来加速LLM推理,在速度与内存之间进行权衡,并介绍了生产级缓存管理挑战。

0 人收藏 0 人点赞
#kv-caching

@athleticKoder:一篇关于LLM推理原理的1600字笔记,涵盖:1. 注意力机制——token交互的唯一场所 2. KV缓存——为何...

X AI KOLs Timeline · 2026-07-02 缓存

一篇详细阐述LLM推理关键概念的推文:注意力机制、KV缓存、分块预填充以及批处理技术,包括vLLM和SGLang中使用的连续批处理。

0 人收藏 0 人点赞
#kv-caching

@nathanrs: 新帖子!扩散LLM的一个缺点是双向注意力机制导致键值跨步骤漂移,破…

X AI KOLs Timeline · 2026-06-28 缓存

一篇新帖子强调了扩散LLM的一个缺点:双向注意力机制导致键值跨步骤漂移,破坏了KV缓存。不过,生成质量对轻微的KV漂移具有鲁棒性,研究重点已放在最大化陈旧KV重用而不导致质量下降上。

0 人收藏 0 人点赞
#kv-caching

我是如何解决持续运行的Anthropic智能体循环中上下文窗口膨胀问题的(Opus + Sonnet架构)

Reddit r/AI_Agents · 2026-06-09

一位开发者分享了一种架构模式,用于管理持续运行的Anthropic智能体循环中的上下文窗口膨胀问题,采用KV缓存、动态工具模式加载,以及通过Claude 3.5 Sonnet和Claude 3 Opus解耦执行器与顾问角色。

0 人收藏 0 人点赞
#kv-caching

为扩散语言模型启用共享前缀的KV缓存

arXiv cs.LG · 2026-06-09 缓存

本文提出BiCache,一种面向扩散语言模型共享前缀的新型KV缓存技术,通过动态重用浅层中缓存的键和值来避免精度崩溃,并实现36.3%–98.3%的吞吐量提升。

0 人收藏 0 人点赞
#kv-caching

KV Packet: 免重计算的上下文无关KV缓存用于大语言模型

Hugging Face Daily Papers · 2026-04-14 缓存

KV Packet 提出了一种免重计算的缓存复用框架,用于大语言模型。该框架使用可训练的软标记适配器来弥合上下文不连续性,消除了开销,同时在 Llama-3.1 和 Qwen2.5 上的性能与完全重计算基线相当。

0 人收藏 0 人点赞
#kv-caching

jundot/omlx

GitHub Trending (daily) · 2026-05-10 缓存

oMLX 是一个用于在 Apple Silicon Mac 上进行优化 LLM 推理的新开源工具,具备持续批处理和分层 KV 缓存功能,并通过菜单栏应用进行管理。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈