paged-attention

标签

Cards List
#paged-attention

Minima-KV:基于混合格式分页注意力的保持保留KV缓存压缩

arXiv cs.AI · 3天前 缓存

Minima-KV 提出了一种基于混合格式分页注意力的保持保留KV缓存压缩方法,旨在减少长上下文LLM服务中的内存占用,并在基准测试中评估了其性能。

0 人收藏 0 人点赞
#paged-attention

@dejavucoder: 现在很多人在讨论提示缓存和推理优化。我曾经写过一篇很长的博客…

X AI KOLs Timeline · 6天前 缓存

本文解释了提示缓存如何在LLM推理中使用分页注意力和前缀缓存工作,并提供了开发者优化性能的实用技巧。

0 人收藏 0 人点赞
#paged-attention

PagedAttention:KV Cache的虚拟内存(15分钟阅读)

TLDR AI · 2026-08-21 缓存

PagedAttention将虚拟内存概念应用于语言模型中的KV cache,减少内存碎片化,并使推理引擎能够在每个GPU上服务2-4倍的用户。

0 人收藏 0 人点赞
#paged-attention

深入vLLM:高吞吐量LLM推理系统剖析(2025)

Hacker News Top · 2026-08-06 缓存

深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。

0 人收藏 0 人点赞
#paged-attention

@maxxfuu: 推理工程第6/90天 我写了一个用于一维卷积的CUDA内核,只是为了练习写未优化的……

X AI KOLs Timeline · 2026-07-12 缓存

一位开发者分享了他们在推理工程的第6天,编写了一个用于一维卷积的CUDA内核,解释了PagedAttention的内存效率,并概述了GPU内存层次结构(全局、寄存器、本地、常量、共享)。

0 人收藏 0 人点赞
#paged-attention

@neural_avb: 非常棒的LLM服务、推理基础以及VLLM(分页注意力、连续批处理等)介绍。强烈推荐…

X AI KOLs Timeline · 2026-06-24 缓存

推荐了一篇关于LLM服务、推理基础以及VLLM(涵盖分页注意力和连续批处理)的介绍。

0 人收藏 0 人点赞
#paged-attention

Show HN: Tiny-vLLM – 使用C++和CUDA的高性能LLM推理引擎

Hacker News Top · 2026-05-29 缓存

Tiny-vLLM是一个高性能的LLM推理引擎,采用C++和CUDA实现,提供连续批处理和PagedAttention等特性,并作为教育资源。

1 人收藏 1 人点赞
#paged-attention

基于 PagedAttention 的大语言模型服务高效内存管理

Papers with Code Trending · 2023-09-12 缓存

本文介绍了 PagedAttention,这是一种受虚拟内存分页技术启发的算法,以及 vLLM,这是一种通过减少键值缓存中的内存碎片来显著提高大语言模型吞吐量的服务系统。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈