展示星期六:Intel Arc B140 构建。
摘要
一个展示个人本地AI推理构建的案例,采用Intel Arc B140 GPU和定制硬件,在Ubuntu上运行带SYCL后端的llama.cpp。
我的本地推理构建,包括:ASUS WS C422 PRO/SE 10核 Xeon W-2255 64GB ECC RAM 64GB VRAM 定制机箱,带TurboLEDz显示10个Xeon核心的频率。运行带SYCL后端的llama.cpp。Khronos-stack和MESA栈均从git源码构建,运行在Ubuntu 26.04上。
相似文章
Intel Arc Pro B70 llama.cpp 基准测试结果公布
Intel Arc Pro B70 GPU 在 Qwen 模型上通过 SYCL 运行 llama.cpp 的基准测试结果显示每秒 63 个 token 的性能。
我用 Intel N100 + RTX 5060Ti 构建了一个奇怪的低功耗 llama.cpp 服务器
一位爱好者描述了使用 Intel N100 主板和翻新 RTX 5060 Ti 构建低功耗 llama.cpp 服务器的过程,并分享了性能数据、功耗和模型选择。
@TheAhmadOsman: 现在是2023年7月,Llama 2 70B刚刚发布,我想在本地运行它,所以我组装了这台机器:8张RTX 3090显卡,Ep…
2023年7月,用户组装了一台配备8张RTX 3090显卡和Epyc 7004 CPU的高端计算机,以在本地运行Llama 2 70B,并表达了对开源AI未来的信心。
Intel LLM-Scaler vllm-0.14.0-b8.2 发布,正式支持 Arc Pro B70
Intel LLM-Scaler vllm-0.14.0-b8.2 新增对 Arc Pro B70 GPU 的官方支持,可在 Battlemage 硬件上基于 Docker 运行大模型推理。
@TeksEdge: 已解决!Qwen3.6-27B-FP8 现已在 Intel Arc Pro B70 上运行!LocalMaxxing 展示了 4× Arc Pro B70 32GB 的有效运行,速度约 5…
Qwen3.6-27B-FP8 模型现已在 Intel Arc Pro B70 GPU 上运行,速度约 50 tok/s,并修复了 vLLM 的一个 bug,这标志着 Intel GPU 本地 AI 推理的一个重要里程碑。