标签
Ling-3.0 (BailingMoE3) 现已在 llama.cpp 中获得官方支持,基准测试显示在 Intel Arc B580 上可实现高效本地推理,包括在 12GB 显存中处理 128K 上下文。
一个展示个人本地AI推理构建的案例,采用Intel Arc B140 GPU和定制硬件,在Ubuntu上运行带SYCL后端的llama.cpp。
MSI Claw 8 EX AI+ 是一款性能强大的手持游戏PC,搭载Intel Arc GPU,具有出色的人体工学设计和高端设计,但高价格和缺乏OLED显示屏是其缺点。
一位用户成功在 Intel Arc B70s GPU 上运行了 nvfp4 量化,相比其最佳的 int4 配置,实现了近乎两倍的速度和更高的精度,挑战了硬件特定的格式假设。
一个llama.cpp的PR显著提升了Intel ARC GPU上的提示处理速度,基准测试显示在B580上从245t/s提升到462t/s。目前该改进仅适用于F16 KV量化,计划后续支持其他量化方式。
一个针对 llama.cpp 的拉取请求,将多列 MMVQ 从 CUDA 移植到 SYCL,在 Intel Arc GPU 上实现了约 45% 的推测解码加速。
Qwen3.6-27B-FP8 模型现已在 Intel Arc Pro B70 GPU 上运行,速度约 50 tok/s,并修复了 vLLM 的一个 bug,这标志着 Intel GPU 本地 AI 推理的一个重要里程碑。
社区实测显示,在 llama.cpp 下 Intel Arc Pro B70 的提示词处理平均慢约 71%,Token 生成平均慢约 54%;同一张卡 SYCL 后端有时比 Vulkan 更快。