vllm-project/vllm v0.19.1

GitHub Releases Watchlist 工具

摘要

vLLM v0.19.1 发布 - 一个快速易用的开源 LLM 推理和服务库,拥有业界领先的吞吐量,支持 200+ 个模型架构以及包括 NVIDIA/AMD GPU 和 CPU 在内的多样化硬件。

这是基于 v0.19.0 的补丁版本,包含 Transformers v5.5.4 升级以及 Gemma4 的错误修复: - 升级至 transformers v5 (#30566) - [错误修复] 修复 Gemma 4 流式工具调用中的无效 JSON,通过剥离部分分隔符 (#38992) - [错误修复][前端] 修复 Gemma4 工具调用后流式 HTML 重复问题 (#38909) - [错误修复] 修复 Gemma4 流式工具调用中分割布尔值/数值的损坏 (#39114) - [工具] 向推理解析器调整 adjust_request,以及 Gemma4 修复 (#39027) - [Gemma4] 支持量化 MoE (#39045) - 添加 Gemma4 Eagle3 支持 (#39450) - [Gemma4][错误修复]:启用 Gemma4ForCasualLM 正确加载 lora 适配器 (#38844) - [错误修复] 修复 Gemma4 工具解析器将裸 null 转换为字符串 "null" 的问题 (#39679) - [模型] 通过动态 BOS 注入修复 Gemma 4 令牌重复问题以适配 PT 模型 (#39842) - 修复(kimi_k25):从 tokenizer 解析 media_placeholder_token_id (#39344)
查看原文
查看缓存全文

缓存时间: 2026/04/20 08:36

简单、快速、廉价的大语言模型服务

| 文档 | 博客 | 论文 | Twitter/X | 用户论坛 | 开发者 Slack |

相似文章

vllm-project/vllm v0.20.0

GitHub Releases Watchlist

vLLM v0.20.0 已发布,这是一个用于高吞吐量 LLM 推理和服务的开源库,特色功能包括 PagedAttention 以及对多种硬件架构的支持。

vllm-project/vllm v0.20.1

GitHub Releases Watchlist

vLLM v0.20.1 是一个小版本更新,针对这款流行的开源大语言模型推理和服务库,继续保持其高吞吐量和高效内存管理的核心优势。

vllm-project/vllm v0.21.0rc1

GitHub Releases Watchlist

vLLM v0.21.0rc1 是高性能大语言模型推理和服务库的预发布更新,主要功能包括针对吞吐量、量化以及硬件支持的优化。

vllm-project/vllm v0.20.0rc1

GitHub Releases Watchlist

vLLM 0.20.0rc1 发布,带来吞吐量、量化、投机解码及多硬件支持的重大改进,助力可扩展的大模型推理服务。