标签
在PyTorch Conference North America上,来自Fujitsu Research India的Maajid Khan将发表演讲,探讨使用vLLM和OpenVINO优化ARM CPU上的混合专家模型LLM推理。
一个4.21亿参数的Laya模型被演示在台式机CPU上使用OpenVINO INT8量化运行Flappy Bird,展示了在消费级硬件上的高效AI推理。
Intel 发布 OpenVINO 2026.4,扩展了 AI 模型支持,性能提升如多令牌预测,以及针对 CPU、GPU 和 NPU 的分析和推理新功能。
XeBoostLM 是一款原生 C++ 命令行工具,用于在 Intel NPU、iGPU 和 CPU 上运行本地大语言模型,提供优化性能且零 Python 开销。
本文展示了关于Intel PC集群分布式LLM推理的研究,重点是使用OpenVINO实现流水线并行分片推理,并针对异构硬件进行性能优化。
Gemma 4 E2B 在采用OpenVINO与LiteRT NPU支持的英特尔AI PC上,实现了预填充速度提升1.3倍、每瓦性能提升2.8倍,从而能够高效运行后台LLM任务。