ai-serving

标签

Cards List
#ai-serving

@PyTorch: vLLM (@vllm_project) 是一款高吞吐量、内存高效的大语言模型推理与服务引擎。在 #PyTorchCon 北美…

X AI KOLs Timeline ↗ · 5天前 缓存

本文介绍了vLLM,一款用于大语言模型的高吞吐量推理引擎,并详细说明了其在PyTorchCon北美会议上的会议和活动。

0 人收藏 0 人点赞
#ai-serving

让 Volta 再次快起来

Reddit r/LocalLLaMA ↗ · 2026-09-25

这篇文章介绍了 1Cat-vLLM,这是一个针对 NVIDIA V100 GPU 优化的 vLLM 分支,并将其性能与 llama.cpp 进行比较,用于服务像 Qwen3.6-35b 这样的大型语言模型。

0 人收藏 0 人点赞
#ai-serving

@akshay_pachaar: RadixAttention,清晰解释。(SGLang如何使前缀缓存高效)前缀缓存听起来简单,直到……

X AI KOLs Timeline ↗ · 2026-09-12 缓存

本文解释了RadixAttention,这是SGLang中的一项技术,使用基数树来高效缓存和重用AI服务中跨分支请求的重叠KV缓存。

0 人收藏 0 人点赞
#ai-serving

@PyTorch:在2026年PyTorch北美大会上,@MistralAI研究工程师、vLLM维护者Nicolò Lucchesi将展示……

X AI KOLs Timeline ↗ · 2026-09-11 缓存

Nicolò Lucchesi将在2026年PyTorch北美大会上,介绍与AWS和RedHat合作的关于vLLM中面向混合模型的解耦服务演进的成果。

0 人收藏 0 人点赞
#ai-serving

使用我的新INT8 vLLM分支,在4x MI100配置(成本$6.5k)上实现Qwen3.8 27B C8的972 TG / 5,680 PP性能

Reddit r/LocalLLaMA ↗ · 2026-08-26

一个新的vLLM分支为较旧的AMD MI100 GPU上的Qwen3.8 27B引入全面的INT8优化,实现高达972 tokens/秒的吞吐量,并进行严格的精度验证。

0 人收藏 0 人点赞
#ai-serving

@vllm_project: 这个权重传输引擎是vLLM原生的。任何基于Ray的训练器都可以通过单个WeightSource迭代器来采用它。…

X AI KOLs Following ↗ · 2026-08-26 缓存

vLLM引入了一个原生的分片权重传输引擎,使用Ray Direct Transport (RDT)来在大规模在线强化学习环境中进行高效的权重同步,从而提升像Kimi K2这样的模型的性能。

0 人收藏 0 人点赞
#ai-serving

突破 DeepSeek-V4-Pro 服务极限(28分钟阅读时间)

TLDR AI ↗ · 2026-08-20 缓存

本文介绍了一种优化 DeepSeek-V4-Pro(一个1.6万亿参数的 MoE 模型)在 H20 GPU 上服务的方法,通过场景特定的配置和优化实现了显著的性能提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈