OpenVINO™ 2026.3:新模型、新流水线,更智能的推理

openlab_96bf3613 更新于 2天前

作者:武卓

OpenVINO™ 2026.3 延续了今年以来持续快速迭代的势头。在此前多个版本奠定的基础上——从 2026.0 中混合专家模型(MoE)功能正式可用,到 2026.1 中引入 LoRA 支持并实现性能提升,再到 2026.2 中的 GPU 优化与智能体能力增强——本次发布将重点放在更广泛的模型支持、新增生成式 AI 流水线、更智能的内存管理,以及模型服务能力改进等方面。

无论你希望在资源受限的硬件上运行大语言模型、利用投机解码加速推理,还是部署和服务 AI 工作负载,OpenVINO™ 2026.3 都带来了值得关注的新能力。下面让我们一起来看看。

覆盖 CPU、GPU 和 NPU 的新模型

本次发布进一步扩展了 OpenVINO™ 支持的模型范围,新增了一批覆盖语言、视觉和目标检测任务的模型。

CPU、GPU 和 NPU 新增支持的模型

SmolLM3–3B 是一款体积紧凑但能力出色的语言模型,非常适合资源受限的部署环境,尤其适用于对较低内存占用和较快响应速度有较高要求的场景。

LFM2–1.5B 和 LFM2.5–1.2B 基于 Liquid AI 独特的混合架构构建,该架构专为快速推理和低内存占用而设计。新模型进一步扩展了 LFM2 模型家族,为开发者提供更多参数规模选项,以满足资源受限环境下不同的部署需求

CPU 和 GPU 新增支持的模型

Harrier-OSS-v1–0.5B 是微软开发的一系列多语言文本嵌入模型。嵌入模型擅长理解文本背后的语义,并将其转换为便于比较、搜索和聚类的向量表示。因此,Harrier-OSS-v1 非常适合语义搜索、检索增强生成(RAG)、文档聚类以及分类流水线等应用场景。

搭配 EAGLE-3 的 Qwen3–8B 将阿里巴巴推出的高性能 80 亿参数语言模型与 EAGLE-3 投机解码组件相结合,可以直接实现更快的 Token 生成速度。关于这项能力,后文还将进一步介绍。

MiniCPM5–1B 是 OpenBMB 推出的最新紧凑型语言模型,也是 MiniCPM5 系列的首个模型。该模型专为端侧设备和资源受限的部署环境设计,在保持较小内存占用的同时,重点增强了指令遵循、推理、编程和工具调用能力,非常适合构建本地智能助手和边缘端应用。

FLUX.2-klein-4B 是 Black Forest Labs 推出的一款紧凑型图像生成与编辑模型。它在一个拥有 40 亿参数的统一架构中同时集成了文生图和图像编辑能力,可以在消费级硬件上实现低延迟推理,适用于实时和资源高效型部署,同时无需大幅牺牲图像质量。

YOLO26 在此前版本中已经支持 CPU,本次进一步扩展至 GPU 和 NPU,从而在完整的硬件平台上实现高性能、低功耗的目标检测。这对于机器人、工业自动化和实时视觉流水线等边缘部署场景尤其有价值。在这些场景中,NPU 加速能够带来更优秀的每瓦性能。

面向多模态、语音和嵌入任务的新 GenAI 流水线

OpenVINO™ GenAI 在本次发布中新增了三种流水线,使开发者只需几行代码,即可构建更多类型的生成式 AI 工作负载。

OmniPipeline 作为预览功能推出,首批支持 Qwen3-Omni,可用于构建端到端的多模态对话应用。它能够同时接收文本、图像和音频输入,生成文本回复,并可选择输出合成语音。这为开发者提供了一个统一接口,用于构建交互式多模态聊天应用,包括能够结合图像上下文进行多轮对话的应用。

EmbeddingPipeline 将多模态嵌入生成能力扩展至视觉语言任务,首个支持的模型为 Qwen3-VL-Embedding。开发者可以更加便捷地根据图像和文本输入共同生成嵌入向量,从而支持多模态语义搜索、跨模态检索等应用。过去,这些应用通常需要开发者自行编写更多定制代码,才能连接不同处理环节。

第三项新增能力是 ASRPipeline。它为自动语音识别模型提供了统一接口,使开发者可以更加轻松地将语音转写能力集成到应用中,而无需直接处理不同模型特有的输入和输出格式。

EAGLE 3 投机解码:覆盖更广,速度更快

OpenVINO™ GenAI 已在此前版本中引入 EAGLE 3 投机解码支持,而在 2026.3 中,这项能力得到了显著扩展。

EAGLE 3 流水线现在已经同时覆盖大语言模型(LLM)和视觉语言模型(VLM),并与现有的连续批处理基础设施集成,可支持更高吞吐量的模型服务场景。

EAGLE 3 的工作原理是将一个轻量级预测组件直接嵌入主模型,而不是依赖一个独立的草稿模型。通过这种方式,模型可以推测性地同时生成多个候选 Token,然后在一次前向传播过程中完成验证。最终,EAGLE 3 能够在不牺牲输出质量的情况下,显著提升 Token 生成速度。

此外,EAGLE 3 流水线还新增了 Top K 采样支持。开发者可以在获得投机解码吞吐量优势的同时,更灵活地控制生成内容的多样性。这些改进适用于 CPU、GPU 和 NPU,因此开发者可以在不同类型的硬件设备上充分利用这些能力。

在普通硬件上运行大型 MoE 模型

本次发布中最具实际意义的新增能力之一,是将 MoE 模型权重卸载到磁盘。

过去,Qwen3 30B-A3B 等大型混合专家模型需要占用大量内存,因此普通开发者设备和许多边缘部署平台难以运行这些模型。启用磁盘卸载后,这些 300 亿参数级别的 MoE 模型现在可以在内存容量低至 16 GB 的设备上运行,同时仍然保持可接受的每秒 Token 生成速度。

该功能会将当前未激活的专家权重卸载至磁盘,并在推理过程中根据需要动态加载。由于 MoE 架构在生成每个 Token 时只会激活全部参数中的一部分,因此任意时刻实际产生的内存压力,都远低于模型总参数规模所对应的内存需求。磁盘卸载技术进一步利用了这一特点,从而降低大型 MoE 模型对设备内存容量的要求。

OpenVINO模型服务器(OpenVINO Model Server)更新

OpenVINO Model Server(OVMS)在本次发布中也获得了一系列重要更新,主要包括 API 简化和大语言模型服务可靠性提升。

更简单的部署和统一的 REST API

简化后的部署流程和统一的 REST API 端点,降低了启动模型服务器实例时所需命令的复杂度。OVMS 现在可以开箱即用地支持标准的v1/chat/completions接口。

这意味着开发者可以更轻松地将 OVMS 集成到现有模型服务基础设施中,也可以将其与其他服务框架搭配使用或进行替换,而无需额外承担 API 格式转换的开发成本。

改进线性注意力模型支持

OVMS 进一步增强了对采用线性注意力架构的大语言模型的支持,其中包括 Qwen3.5/6,从而提升这些模型在服务部署场景中的准确性和可靠性。

扩展工具解析器支持

工具解析器现已扩展支持 MiniCPM5–1B 和 LFM2.5。

这为开发者构建依赖工具调用的智能体应用提供了更多模型选择,可用于支持多步骤推理以及与外部系统的集成。

总结

OpenVINO™ 2026.3 是一次覆盖完整软件栈的重要发布,带来了:

  • CPU、GPU 和 NPU 上新增的模型支持;

  • 全新的 GenAI 流水线;

  • 更智能的内存管理;

  • 覆盖范围更广的投机解码能力;

  • 功能更加强大的模型服务器。


无论你正在尝试突破 16 GB 内存容量能够运行的模型规模上限,还是通过 OVMS 构建生成式 AI 应用,本次发布都为你提供了更多工具,帮助你在英特尔硬件上更加高效地完成这些工作。

准备好开始体验了吗?立即下载 OpenVINO™ 2026.3,探索它能够带来的更多可能性。

更多资源

声明与免责声明

*其他名称和品牌可能是其各自所有者的资产。

性能会因使用方式、配置及其他因素而有所不同。更多信息请参阅 Performance Index 网站。

性能测试结果基于所示配置及对应日期进行的测试,可能无法反映所有已经公开发布的更新。

没有任何产品或组件能够做到绝对安全。

实际成本和结果可能有所不同。

0个评论