Intel 发布 OpenVINO 2026.4
摘要
Intel 发布 OpenVINO 2026.4,扩展了 AI 模型支持,性能提升如多令牌预测,以及针对 CPU、GPU 和 NPU 的分析和推理新功能。
更新 https://github.com/ggml-org/llama.cpp/pull/29009 已合并 更多 Gen AI 覆盖和框架集成以最小化代码更改
支持的新模型:
在 CPU 上:Gemma-3n
在 CPU、GPU 上:Kokoro-82M、Qwen3-VL-4B(支持 eagle3)、Qwen3-ASR、Muse Glimmer 30B、Qwen 3.8 27B、Gemma4 12B;Hy-MT2-1.8B、DeepSeek OCR-2、Granite 4.0 H Micro
在 NPU 上:FLUX.2-Klein 4B、Kokoro 82M
更多 CPU 和 GPU 支持的模型作为早期版本提供:Qwen-image、Z-Image-Turbo、Granite 4.0 H Tiny、Fun-ASR-Nano、LFM2.5-8B-A1B、MiniCPM5-2B、RF-DETR、BGE Reranker-V2-M3、BGE M3
更广泛的 LLM 模型支持和更多模型压缩技术
OpenVINO™ GenAI 为 Gemma 4、Qwen 3.5 和 Qwen 3.6 添加了多令牌预测(MTP)投机解码,支持 CPU 和 GPU,实现更高吞吐量和更低延迟,而不牺牲准确性。
通过 OpenVINO™ GenAI 支持 EAGLE3 的树草稿(Top-K),开发者可以在 VLM 管道上实现比链草稿(Top-1)更高的吞吐量。
OpenVINO™ GenAI 中的 Xe3 集成显卡优化提升了在 Intel® Core™ Ultra Series 3 处理器上处理长上下文输入的 Gemma 4 模型的 AI 推理性能。
OpenVINO™ 将工具插桩和跟踪技术(ITT)分析支持扩展到 NPU,使开发者能够使用 Intel® VTune™ Profiler 通过一个一致的工具链分析 CPU、GPU 和 NPU 执行。
预览:OpenVINO™ GenAI 在 GPU 上引入了 Qwen 模型的 DFlash 加速,以及视觉令牌支持,以减少延迟并加速在 Intel® Core™ Ultra Series 3 处理器上的 GenAI 管道。
更多可移植性和性能,以在边缘、云或本地运行 AI
OpenVINO™ GenAI 引入了对 Node.js 中 ASRPipeline 的支持,使 JavaScript 开发者能够使用类似于 C++ 和 Python 的管道 API 运行自动语音识别(如 Whisper 和 Qwen3‑ASR),并支持流媒体和性能指标。
预览:NPU 上的有界动态形状支持现在扩展到视觉工作负载,如图像超分辨率。该能力已通过 ESPCN 模型验证。
预览:OpenVINO™ Model Server 现在包含空闲模型管理的预览支持,在模型未使用时卸载它们以减少内存使用。
OpenVINO™ Model Server 添加了对新代理模型的支持,如 Muse Glimmer 30B 和 Qwen3.8 27B。
https://docs.openvino.ai/2026/about-openvino/release-notes-openvino.html
https://docs.openvino.ai/2026/about-openvino/release-notes-openvino/system-requirements.html
相似文章
开放模型 - 2026年6月
2026年6月的开放模型月度更新,涵盖开源AI模型生态系统的发布和进展。
NVIDIA and Local AI Community Fuel Open Source Models and Intelligent Agents
NVIDIA highlights a wave of open source AI model and tool releases for local deployment, including Cosmos 3 Edge, MiniMax-H3, Laguna S 2.1, DeepSeek-V4-Flash, Inkling-Small, and Unsloth Desktop, celebrating the community driving local AI forward.
OpenAI 的 Jalapeño 芯片专为快速大规模推理而构建,基准测试显示
OpenAI 的 Jalapeño 芯片,与 Broadcom 共同开发,在 AI 推理基准测试中显示出显著的性能提升,超越了像 Nvidia 的 Blackwell 这样的尖端处理器。该芯片针对快速、高效的大规模推理进行了优化,部署将于 2026 年底开始。
开放模型如何推动AI研究
NVIDIA强调,开放前沿模型和AI基础设施正在推动AI研究,这体现在ICML 2026接收的论文中,涵盖机器人学、生命科学和合成数据等领域。
Meta 发布新的设备端优化开源模型
Meta 宣布推出一个针对设备端部署优化的全新开源模型,旨在将高效的 AI 推理带到边缘设备。