continuous-batching

标签

Cards List
#continuous-batching

@freeCodeCamp: AI 代理可以将单个用户请求转化为多次 LLM 调用,使得推理成为性能瓶颈。在本教程中…

X AI KOLs Timeline · 2026-08-19 缓存

一篇关于使用 vLLM 高效服务 AI 代理 LLM 推理的教程,涵盖了连续批处理和 PagedAttention 等概念,以解决性能瓶颈。

0 人收藏 0 人点赞
#continuous-batching

深入vLLM:高吞吐量LLM推理系统剖析(2025)

Hacker News Top · 2026-08-06 缓存

深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。

0 人收藏 0 人点赞
#continuous-batching

BlockServe: 块粒度连续批处理实现高吞吐扩散大语言模型服务

arXiv cs.LG · 2026-07-13 缓存

BlockServe 引入了块粒度连续批处理来解决扩散大语言模型中的收敛异质性,相比 Fast-dLLM 实现了 1.9–10.6 倍的吞吐量提升,同时保持生成质量。

0 人收藏 0 人点赞
#continuous-batching

@jino_rohit:在过去的6到8个月里,我一直尝试转向机器学习系统和AI基础设施领域。以下是我最喜欢的一些…

X AI KOLs Timeline · 2026-07-11 缓存

作者分享了他们在过去6-8个月里在ML系统和AI基础设施方面的工作,包括一个轻量级的Python LLM推理引擎(tachyon),在消费级硬件上通过连续批处理和前缀缓存实现了每秒600+ tokens,还有关于CUDA/CUTE DSL和集体通信的博客文章,以及对SGLang和vLLM的贡献。

0 人收藏 0 人点赞
#continuous-batching

@athleticKoder:一篇关于LLM推理原理的1600字笔记,涵盖:1. 注意力机制——token交互的唯一场所 2. KV缓存——为何...

X AI KOLs Timeline · 2026-07-02 缓存

一篇详细阐述LLM推理关键概念的推文:注意力机制、KV缓存、分块预填充以及批处理技术,包括vLLM和SGLang中使用的连续批处理。

0 人收藏 0 人点赞
#continuous-batching

@pallavishekhar_: LLM中的连续批处理 阅读:https://outcomeschool.com/blog/continuous-batching-in-llms…

X AI KOLs Timeline · 2026-06-30 缓存

一篇介绍连续批处理的博客文章,该技术通过动态地将新请求添加到已完成请求的批次中,持续保持GPU忙碌并减少空闲时间,从而提高LLM服务吞吐量。

0 人收藏 0 人点赞
#continuous-batching

@neural_avb: 非常棒的LLM服务、推理基础以及VLLM(分页注意力、连续批处理等)介绍。强烈推荐…

X AI KOLs Timeline · 2026-06-24 缓存

推荐了一篇关于LLM服务、推理基础以及VLLM(涵盖分页注意力和连续批处理)的介绍。

0 人收藏 0 人点赞
#continuous-batching

@SergioPaniego:连续批处理刚刚在TRL的GRPO中实现,在64次生成时,它比普通生成运行更快且使用更少的VRAM…

X AI KOLs Following · 2026-06-19 缓存

连续批处理已添加到TRL的GRPO中,提高了速度并减少了VRAM使用,无需vLLM。推文解释其工作原理及适用时机。

0 人收藏 0 人点赞
#continuous-batching

@steeve:又是5天后,zml/llmd完全在Metal上运行,以完整bf16精度服务8个并发请求 zml/llmd是我们的大语言模型服务…

X AI KOLs Following · 2026-06-13 缓存

zml/llmd现已完全在Apple的Metal API上运行,以完整bf16精度服务8个并发请求,并支持连续批处理等现代功能。

0 人收藏 0 人点赞
#continuous-batching

@grapeot: LLM 推理系统到底是怎么跑的?SGLang Omni 团队最近公开了一篇很少见的文章——把一个顶级推理系统团队的完整决策链路摊在明面上。我顺着原文梳理了一篇科普,从自回归decode、KV cache、continuous batchi…

X AI KOLs Timeline · 2026-05-30

本文基于SGLang Omni团队的内部决策文章,从自回归解码、KV缓存、连续批处理等基础概念出发,深入浅出地介绍了LLM推理系统的运作原理。

0 人收藏 0 人点赞
#continuous-batching

[开源] dlmserve —— 首个扩散语言模型服务引擎

Reddit r/LocalLLaMA · 2026-05-26

dlmserve 是首个面向扩散语言模型的开源服务引擎,提供兼容 OpenAI 的 API、持续批处理功能,在 12GB VRAM 内即可运行,吞吐量是 Hugging Face 的 2.5 倍。

0 人收藏 0 人点赞
#continuous-batching

@jundotkim: oMLX 0.3.9rc1 发布。亮点:- 低内存Mac保持稳定,不再被系统杀死 - DFlash 升级至…

X AI KOLs Timeline · 2026-05-19 缓存

oMLX 0.3.9rc1,一个为Apple Silicon Mac优化的LLM推理服务器,增加了低内存稳定性、分块预填充、多任务管理聊天等功能。

0 人收藏 0 人点赞
#continuous-batching

在连续批处理中实现异步性

Hugging Face Blog · 2026-05-14 缓存

本文解释了如何为LLM推理实现异步连续批处理,将CPU批处理准备与GPU计算重叠,以最大化利用率并减少空闲时间。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈