vllm-project/vllm v0.19.1
摘要
vLLM v0.19.1 发布 - 一个快速易用的开源 LLM 推理和服务库,拥有业界领先的吞吐量,支持 200+ 个模型架构以及包括 NVIDIA/AMD GPU 和 CPU 在内的多样化硬件。
这是基于 v0.19.0 的补丁版本,包含 Transformers v5.5.4 升级以及 Gemma4 的错误修复:
- 升级至 transformers v5 (#30566)
- [错误修复] 修复 Gemma 4 流式工具调用中的无效 JSON,通过剥离部分分隔符 (#38992)
- [错误修复][前端] 修复 Gemma4 工具调用后流式 HTML 重复问题 (#38909)
- [错误修复] 修复 Gemma4 流式工具调用中分割布尔值/数值的损坏 (#39114)
- [工具] 向推理解析器调整 adjust_request,以及 Gemma4 修复 (#39027)
- [Gemma4] 支持量化 MoE (#39045)
- 添加 Gemma4 Eagle3 支持 (#39450)
- [Gemma4][错误修复]:启用 Gemma4ForCasualLM 正确加载 lora 适配器 (#38844)
- [错误修复] 修复 Gemma4 工具解析器将裸 null 转换为字符串 "null" 的问题 (#39679)
- [模型] 通过动态 BOS 注入修复 Gemma 4 令牌重复问题以适配 PT 模型 (#39842)
- 修复(kimi_k25):从 tokenizer 解析 media_placeholder_token_id (#39344)
查看缓存全文
缓存时间: 2026/04/20 08:36
简单、快速、廉价的大语言模型服务
| 文档 | 博客 | 论文 | Twitter/X | 用户论坛 | 开发者 Slack |
相似文章
vllm-project/vllm v0.20.0
vLLM v0.20.0 已发布,这是一个用于高吞吐量 LLM 推理和服务的开源库,特色功能包括 PagedAttention 以及对多种硬件架构的支持。
vllm-project/vllm v0.20.1
vLLM v0.20.1 是一个小版本更新,针对这款流行的开源大语言模型推理和服务库,继续保持其高吞吐量和高效内存管理的核心优势。
vllm-project/vllm v0.21.0rc1
vLLM v0.21.0rc1 是高性能大语言模型推理和服务库的预发布更新,主要功能包括针对吞吐量、量化以及硬件支持的优化。
vllm-project/vllm v0.20.0rc1
vLLM 0.20.0rc1 发布,带来吞吐量、量化、投机解码及多硬件支持的重大改进,助力可扩展的大模型推理服务。
@vllm_project: vLLM v0.21.0 发布!367 次提交,来自 202 位贡献者(其中 49 位新贡献者)。亮点:KV 卸载 + HMA、带思考预算的推测解码(适用于推理模型)……
vLLM v0.21.0 已发布,新增 KV 卸载 + HMA、面向推理模型的带思考预算的推测解码、适用于 DSR1/Kimi K2.5 的 Blackwell 上的 TOKENSPEED_MLA、Mooncake 分布式 KV、DeepSeek V4 流水线并行,以及 C++20 + Transformers v5 基线。