标签
本文展示了关于Intel PC集群分布式LLM推理的研究,重点是使用OpenVINO实现流水线并行分片推理,并针对异构硬件进行性能优化。
Gemma 4 E2B 在采用OpenVINO与LiteRT NPU支持的英特尔AI PC上,实现了预填充速度提升1.3倍、每瓦性能提升2.8倍,从而能够高效运行后台LLM任务。