pagedattention

标签

Cards List
#pagedattention

@freeCodeCamp: AI 代理可以将单个用户请求转化为多次 LLM 调用,使得推理成为性能瓶颈。在本教程中…

X AI KOLs Timeline · 2026-08-19 缓存

一篇关于使用 vLLM 高效服务 AI 代理 LLM 推理的教程,涵盖了连续批处理和 PagedAttention 等概念,以解决性能瓶颈。

0 人收藏 0 人点赞
#pagedattention

@CycleDecoded: 别再用原生 HuggingFace硬扛本地大模型推理了,显存直接爆满,吞吐量慢得像乌龟爬! 伯克利实验室出品的 vLLM,用搞操作系统内存分页(PagedAttention)的那套黑科技,直接把 GPU 显存压榨到了极限,KV Cache…

X AI KOLs Timeline · 2026-08-07 缓存

伯克利 Sky Computing Lab 开源的 vLLM 是一个高性能 LLM 推理与服务库,通过 PagedAttention 和连续批处理大幅提升吞吐量、降低显存浪费,并兼容 OpenAI API 和多种硬件。

0 人收藏 0 人点赞
#pagedattention

@Alacritic_Super: 如果你想掌握LLM推理,从这三篇论文开始。它们介绍了许多驱动当今…的核心理念。

X AI KOLs Timeline · 2026-07-08 缓存

这个线程推荐了三篇掌握LLM推理的关键论文:PagedAttention、Sarathi-Serve和SGLang,它们介绍了高效的内存管理、分块预填充和结构化生成技术,这些技术被用于现代推理引擎如vLLM和TensorRT-LLM中。

0 人收藏 0 人点赞
#pagedattention

Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务

arXiv cs.CL · 2026-07-03 缓存

本文提出了Kara,一种滑动窗口KV缓存压缩方法,用于高效服务推理型大语言模型。该方法通过使用双向注意力和Token2Chunk模块,解决了现有压缩技术中的局限性。该方法被集成到基于vLLM构建的KvLLM推理框架中,在保持性能的同时提高了输出吞吐量。

0 人收藏 0 人点赞
#pagedattention

@mgoin_: 今天我从 vLLM 中删除了 PagedAttention

X AI KOLs Timeline · 2026-07-02 缓存

Michael Goin 宣布从 vLLM 中移除 PagedAttention,这是对开源 LLM 推理引擎的一项重大改变。

0 人收藏 0 人点赞
#pagedattention

@amitiitbhu:新文章:vLLM 是如何工作的?请在此阅读:https://outcomeschool.com/blog/how-does-vllm-work…

X AI KOLs Timeline · 2026-06-17 缓存

一篇详细的博客文章,解释了 vLLM 的工作原理,包括 PagedAttention、KV 缓存管理和连续批处理,以实现高效的 LLM 服务。

1 人收藏 1 人点赞
#pagedattention

内存

Reddit r/artificial · 2026-05-24

解释了为什么由于KV缓存随上下文长度和并发用户数扩展,LLM推理越来越受内存带宽限制,以及像vLLM和PagedAttention这样的系统如何提高内存利用率。

0 人收藏 0 人点赞
#pagedattention

vllm-project/vllm v0.20.0rc1

GitHub Releases Watchlist · 2026-04-22 缓存

vLLM 0.20.0rc1 发布,带来吞吐量、量化、投机解码及多硬件支持的重大改进,助力可扩展的大模型推理服务。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈