kv-caching

标签

Cards List
#kv-caching

FastGuide:加速扩散大语言模型的奖励引导

arXiv cs.CL ↗ · 昨天 缓存

FastGuide 是一种自适应的并行与自回归混合解码方法,通过复用奖励模型反向传播计算、利用 KV 缓存和稀疏注意力重计算来加速扩散大语言模型的梯度奖励引导,在三个奖励基准上实现最高 4.4× 加速同时保持相近生成质量。

0 人收藏 0 人点赞
#kv-caching

KV缓存如何节省令牌的工作原理

Reddit r/ArtificialInteligence ↗ · 2天前

本文讨论了如何通过优化KV缓存的上下文结构来显著降低运行AI代理的成本,基于OpenAI在迁移到GPT 5.6过程中的播客洞察。

0 人收藏 0 人点赞
#kv-caching

Flash-dLLM:IO感知的KV缓存和并行解码,用于快速、内存高效的扩散LLMs

Hugging Face Daily Papers ↗ · 2026-09-22 缓存

Flash-dLLM是一个用于扩散LLMs的免训练推理加速框架,它通过IO感知的KV缓存和并行解码来实现显著的加速和内存效率提升。

0 人收藏 0 人点赞
#kv-caching

TierKV: 通过预测性多层KV缓存实现长上下文设备端大型语言模型

arXiv cs.LG ↗ · 2026-09-21 缓存

TierKV提出一种预测性多层KV缓存框架,用于优化长上下文大型语言模型在移动设备上的内存使用和吞吐量,在最小精度损失下实现显著的性能提升。

0 人收藏 0 人点赞
#kv-caching

Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models

arXiv cs.CL ↗ · 2026-08-11 缓存

Introduces Archer, a training-free KV caching method for diffusion language models that adaptively reuses cached hidden states to reduce recomputation while preserving rollback capabilities, achieving up to 2.95x speedup and improved generation quality.

0 人收藏 0 人点赞
#kv-caching

@shubh6200: 周末花了些时间阅读这篇文章,老实说真希望它早几年就存在。我们看的每个AI教程都…

X AI KOLs Timeline ↗ · 2026-08-02 缓存

一条推文推荐了一篇arXiv论文,该论文为应用数学家讲解了Transformer的数学基础,涵盖分词、嵌入、多头注意力和KV缓存。

0 人收藏 0 人点赞
#kv-caching

我将一份40页的PDF扔给ChatGPT,它瞬间回复了。我们来揭秘是怎么做到的。

Reddit r/artificial ↗ · 2026-07-13

详细解析了为什么向ChatGPT上传大型PDF不会显著减慢响应时间,涉及流式传输、KV缓存和并行预填充阶段等技术。

0 人收藏 0 人点赞
#kv-caching

@akshay_pachaar: 你在Anthropic参加机器学习工程师面试。面试官问:"我们的模型在42秒内生成100个token。H…

X AI KOLs Timeline ↗ · 2026-07-07 缓存

解释了KV缓存如何通过消除注意力键和值的冗余重计算来加速LLM推理,在速度与内存之间进行权衡,并介绍了生产级缓存管理挑战。

0 人收藏 0 人点赞
#kv-caching

@athleticKoder:一篇关于LLM推理原理的1600字笔记,涵盖:1. 注意力机制——token交互的唯一场所 2. KV缓存——为何...

X AI KOLs Timeline ↗ · 2026-07-02 缓存

一篇详细阐述LLM推理关键概念的推文:注意力机制、KV缓存、分块预填充以及批处理技术,包括vLLM和SGLang中使用的连续批处理。

0 人收藏 0 人点赞
#kv-caching

@nathanrs: 新帖子!扩散LLM的一个缺点是双向注意力机制导致键值跨步骤漂移,破…

X AI KOLs Timeline ↗ · 2026-06-28 缓存

一篇新帖子强调了扩散LLM的一个缺点:双向注意力机制导致键值跨步骤漂移,破坏了KV缓存。不过,生成质量对轻微的KV漂移具有鲁棒性,研究重点已放在最大化陈旧KV重用而不导致质量下降上。

0 人收藏 0 人点赞
#kv-caching

我是如何解决持续运行的Anthropic智能体循环中上下文窗口膨胀问题的(Opus + Sonnet架构)

Reddit r/AI_Agents ↗ · 2026-06-09

一位开发者分享了一种架构模式,用于管理持续运行的Anthropic智能体循环中的上下文窗口膨胀问题,采用KV缓存、动态工具模式加载,以及通过Claude 3.5 Sonnet和Claude 3 Opus解耦执行器与顾问角色。

0 人收藏 0 人点赞
#kv-caching

为扩散语言模型启用共享前缀的KV缓存

arXiv cs.LG ↗ · 2026-06-09 缓存

本文提出BiCache,一种面向扩散语言模型共享前缀的新型KV缓存技术,通过动态重用浅层中缓存的键和值来避免精度崩溃,并实现36.3%–98.3%的吞吐量提升。

0 人收藏 0 人点赞
#kv-caching

KV Packet: 免重计算的上下文无关KV缓存用于大语言模型

Hugging Face Daily Papers ↗ · 2026-04-14 缓存

KV Packet 提出了一种免重计算的缓存复用框架,用于大语言模型。该框架使用可训练的软标记适配器来弥合上下文不连续性,消除了开销,同时在 Llama-3.1 和 Qwen2.5 上的性能与完全重计算基线相当。

0 人收藏 0 人点赞
#kv-caching

jundot/omlx

GitHub Trending (daily) ↗ · 2026-05-10 缓存

oMLX 是一个用于在 Apple Silicon Mac 上进行优化 LLM 推理的新开源工具,具备持续批处理和分层 KV 缓存功能,并通过菜单栏应用进行管理。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈