vLLM 支持百度昆仑
摘要
vLLM Kunlun 是一个由社区维护的硬件插件,使 vLLM 能够在百度昆仑 XPU 上运行,支持 20+ 种 LLM、量化、LoRA 和推测解码。
<p><a href="https://lobste.rs/s/sbu76n/vllm_for_baidu_kunlun">评论</a></p>
查看缓存全文
缓存时间: 2026/07/31 08:45
📖 文档 | 🚀 快速开始 | 📦 安装 | 💬 Slack
相似文章
vllm-project/vllm v0.20.0rc1
vLLM 0.20.0rc1 发布,带来吞吐量、量化、投机解码及多硬件支持的重大改进,助力可扩展的大模型推理服务。
vLLM v0.28.0
vLLM v0.28.0 是用于快速高效 LLM 推理和服务的开源库的更新版本,具有 PagedAttention 等增强功能和广泛的硬件支持。
vllm-project/vllm v0.19.1
vLLM v0.19.1 发布 - 一个快速易用的开源 LLM 推理和服务库,拥有业界领先的吞吐量,支持 200+ 个模型架构以及包括 NVIDIA/AMD GPU 和 CPU 在内的多样化硬件。
大语言模型与本地AI硬件的推理引擎(2026版)
本文提供了一份全面的指南,针对2026年本地AI硬件上的大语言模型推理引擎,解释了如何根据硬件策略、工作负载和服务模型进行选择,并涵盖了诸如llama.cpp、MLX、ExLlamaV2/3、vLLM、SGLang、TensorRT-LLM和NVIDIA Dynamo等引擎。
vllm-project/vllm v0.21.0rc1
vLLM v0.21.0rc1 是高性能大语言模型推理和服务库的预发布更新,主要功能包括针对吞吐量、量化以及硬件支持的优化。