Intel LLM-Scaler vllm-0.14.0-b8.2 发布,正式支持 Arc Pro B70
摘要
Intel LLM-Scaler vllm-0.14.0-b8.2 新增对 Arc Pro B70 GPU 的官方支持,可在 Battlemage 硬件上基于 Docker 运行大模型推理。
查看缓存全文
缓存时间: 2026/04/22 15:13
Intel LLM-Scaler vllm-0.14.0-b8.2 发布,正式支持 Arc Pro B70
来源:https://www.phoronix.com/news/Intel-LLM-Scaler-vllm-0.14-b8.2
INTEL
作为 Intel LLM-Scaler(https://www.phoronix.com/search/llm-scaler)计划的一部分,该计划旨在在 Intel Arc 硬件上进行 AI 推理,今天发布的 vllm-0.14.0-b8.2 更新正式支持 Arc Pro B70 显卡。
Intel LLM-Scaler 提供 Docker 化部署方案,用于在 Intel Arc 硬件上运行大语言模型,特别聚焦于最新一代 Battlemage 显卡,并支持多 GPU 配置,作为去年启动的 Project Battlematrix(https://www.phoronix.com/search/Project+Battlematrix)计划的一部分。
在今天的 LLM-Scaler 栈 vLLM 更新中,平台镜像已升级至 intel/llm-scaler-platform:26.18.8.2。唯一列出的变化是正式支持 Intel Arc Pro B70 GPU,即 BMG-G31 显卡,该卡近期发布,配备 32GB 显存,售价低于 1000 美元。
Intel Arc Pro B70
Intel Arc Pro B70(https://www.phoronix.com/search/Arc+Pro+B70)在 Phoronix 的测试中表现良好,更多基准测试即将发布。
新版本已在 GitHub 上打标签(https://github.com/intel/llm-scaler/releases/tag/vllm-0.14.0-b8.2),也可通过 Docker Hub 获取。不过,自发布通知发出后,官方已撤下更新亮点和 Arc Pro B70 支持的说明,疑似发布流程出现问题。
相似文章
Intel Arc Pro B70 llama.cpp 基准测试结果公布
Intel Arc Pro B70 GPU 在 Qwen 模型上通过 SYCL 运行 llama.cpp 的基准测试结果显示每秒 63 个 token 的性能。
@TeksEdge: 已解决!Qwen3.6-27B-FP8 现已在 Intel Arc Pro B70 上运行!LocalMaxxing 展示了 4× Arc Pro B70 32GB 的有效运行,速度约 5…
Qwen3.6-27B-FP8 模型现已在 Intel Arc Pro B70 GPU 上运行,速度约 50 tok/s,并修复了 vLLM 的一个 bug,这标志着 Intel GPU 本地 AI 推理的一个重要里程碑。
展示星期六:Intel Arc B140 构建。
一个展示个人本地AI推理构建的案例,采用Intel Arc B140 GPU和定制硬件,在Ubuntu上运行带SYCL后端的llama.cpp。
Intel Arc Pro B70 包装盒与3D模型
Intel 展示了 Arc Pro B70 显卡的包装盒以及该显卡的3D模型,表明即将发布产品。
Ling-3.0 (BailingMoE3) 进入 llama.cpp 主线 - Intel Arc B580 上的快速基准测试
Ling-3.0 (BailingMoE3) 现已在 llama.cpp 中获得官方支持,基准测试显示在 Intel Arc B580 上可实现高效本地推理,包括在 12GB 显存中处理 128K 上下文。