Intel 发布 OpenVINO 2026.4

Reddit r/LocalLLaMA 工具

摘要

Intel 发布 OpenVINO 2026.4,扩展了 AI 模型支持,性能提升如多令牌预测,以及针对 CPU、GPU 和 NPU 的分析和推理新功能。

更新 https://github.com/ggml-org/llama.cpp/pull/29009 已合并 更多 Gen AI 覆盖和框架集成以最小化代码更改 支持的新模型: 在 CPU 上:Gemma-3n 在 CPU、GPU 上:Kokoro-82M、Qwen3-VL-4B(支持 eagle3)、Qwen3-ASR、Muse Glimmer 30B、Qwen 3.8 27B、Gemma4 12B;Hy-MT2-1.8B、DeepSeek OCR-2、Granite 4.0 H Micro 在 NPU 上:FLUX.2-Klein 4B、Kokoro 82M 更多 CPU 和 GPU 支持的模型作为早期版本提供:Qwen-image、Z-Image-Turbo、Granite 4.0 H Tiny、Fun-ASR-Nano、LFM2.5-8B-A1B、MiniCPM5-2B、RF-DETR、BGE Reranker-V2-M3、BGE M3 更广泛的 LLM 模型支持和更多模型压缩技术 OpenVINO™ GenAI 为 Gemma 4、Qwen 3.5 和 Qwen 3.6 添加了多令牌预测(MTP)投机解码,支持 CPU 和 GPU,实现更高吞吐量和更低延迟,而不牺牲准确性。 通过 OpenVINO™ GenAI 支持 EAGLE3 的树草稿(Top-K),开发者可以在 VLM 管道上实现比链草稿(Top-1)更高的吞吐量。 OpenVINO™ GenAI 中的 Xe3 集成显卡优化提升了在 Intel® Core™ Ultra Series 3 处理器上处理长上下文输入的 Gemma 4 模型的 AI 推理性能。 OpenVINO™ 将工具插桩和跟踪技术(ITT)分析支持扩展到 NPU,使开发者能够使用 Intel® VTune™ Profiler 通过一个一致的工具链分析 CPU、GPU 和 NPU 执行。 预览:OpenVINO™ GenAI 在 GPU 上引入了 Qwen 模型的 DFlash 加速,以及视觉令牌支持,以减少延迟并加速在 Intel® Core™ Ultra Series 3 处理器上的 GenAI 管道。 更多可移植性和性能,以在边缘、云或本地运行 AI OpenVINO™ GenAI 引入了对 Node.js 中 ASRPipeline 的支持,使 JavaScript 开发者能够使用类似于 C++ 和 Python 的管道 API 运行自动语音识别(如 Whisper 和 Qwen3‑ASR),并支持流媒体和性能指标。 预览:NPU 上的有界动态形状支持现在扩展到视觉工作负载,如图像超分辨率。该能力已通过 ESPCN 模型验证。 预览:OpenVINO™ Model Server 现在包含空闲模型管理的预览支持,在模型未使用时卸载它们以减少内存使用。 OpenVINO™ Model Server 添加了对新代理模型的支持,如 Muse Glimmer 30B 和 Qwen3.8 27B。 https://docs.openvino.ai/2026/about-openvino/release-notes-openvino.html https://docs.openvino.ai/2026/about-openvino/release-notes-openvino/system-requirements.html
查看原文

相似文章

开放模型 - 2026年6月

Reddit r/LocalLLaMA

2026年6月的开放模型月度更新,涵盖开源AI模型生态系统的发布和进展。

开放模型如何推动AI研究

NVIDIA Blog

NVIDIA强调,开放前沿模型和AI基础设施正在推动AI研究,这体现在ICML 2026接收的论文中,涵盖机器人学、生命科学和合成数据等领域。