Qwen-MM-Plugins(GitHub 仓库)
摘要
QwenLM 发布了 Qwen-MM-Plugins,这是一组原生多模态插件,通过技能和可选的 MCP 服务器,为 Qwen 模型添加图像、视频、音频、搜索、3D/CAD 和视频编辑能力。它包含多个 Agent 框架的使用手册和引导式安装程序。
查看缓存全文
缓存时间: 2026/08/12 08:29
QwenLM/Qwen-MM-Plugins
来源:https://github.com/QwenLM/Qwen-MM-Plugins
Qwen-MM-Plugins
简体中文 · English
Qwen 模型的原生多模态插件。让任何 agent 框架具备原生多模态能力。
目录
🧩 能力
每个能力单独安装——一个 技能(skill)(让模型知道工具集存在)加上一个可选的 MCP 服务器(工具本身)。我们提供了 cookbook 展示 Qwen3.8-Max + 这些插件的实际运行效果——每个能力的 cookbook(链接见下表)包含完整的工具列表、安装步骤和实际用例。尽情享用!
| 能力 | 功能 | 安装名称 | Cookbook |
|---|---|---|---|
| core | 本地 I/O 插件:以动态分辨率读取图像和视频,并可视化任何文件(如文档、3D 模型等)——外加一些图像工具(裁剪、标注、提取帧) | qwen-mm-plugins-core | 链接 |
| api | 按模型系列分类的云端媒体理解 API:VL(视觉对话、OCR、 grounding)、Omni 音视频(带时间戳的字幕生成、ASR / 多说话人分离、时间定位、事件计数),以及 ASR 和分割(SAM3);目前支持 DashScope | qwen-mm-plugins-api | 链接 |
| search | 网络 + 反向图像搜索以核实事实:网络搜索、页面提取、反向图像搜索;目前支持 Serper | qwen-mm-plugins-search | 待定 |
| video-memory | 长视频记忆:一种层级图记忆,支持对超长视频进行问答 | qwen-mm-plugins-video-memory | 待定 |
| video-edit | 视频编辑 + 生成:编辑工作流 + 图像 / 视频 / 音频生成 | qwen-mm-plugins-video-edit | 待定 |
| blender | Blender 3D 建模:通过 Python 驱动正在运行的 Blender(瘦客户端,22 个工具)——建模 / 材质 / 光照 / 渲染 | qwen-mm-plugins-blender | 待定 |
| freecad | FreeCAD 参数化 CAD:驱动正在运行的 FreeCAD(瘦客户端,14 个工具)——建模、属性编辑、STEP/STL 导入/导出、FEM 分析 | qwen-mm-plugins-freecad | 待定 |
| edu-agent | 教学讲解视频:将数学/科学问题或图像转化为分步中文讲解视频 / 交互式页面(仅技能,无 MCP 服务器) | qwen-mm-plugins-edu-agent | 待定 |
🏗 架构
Qwen-MM-Plugins 架构
📦 安装
一个能力 = 一个 技能(skill)(让模型知道工具存在)+ 一个可选的 MCP 服务器(工具本身,由 uvx 按需启动——需要 uv (https://docs.astral.sh/uv/),无需手动 pip)。
推荐:引导式安装器
一个脚本处理它所支持的所有框架(Claude Code · Codex · Qoder · OpenClaw · Qwen Code · Gemini CLI)的 安装 · 配置 · 验证 · 卸载。它在底层驱动各框架自身的原生安装——不重新造轮子——并写入一个共享配置文件(~/.qwen-mm-plugins/config),GUI 和终端框架都能读取,因此只需配置一次:
curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash
或者一次只执行一个操作——bash install.sh install / configure / verify / uninstall(configure 和 verify 的具体操作详见配置和依赖)。
Windows x64: 使用 WSL2(推荐 Ubuntu),并将仓库克隆到 WSL 主目录内(例如 ~/code),而不是挂载的 Windows 驱动器(如 /mnt/c)。然后在其中运行相同命令。WSL2 是目前唯一受支持的 Windows 环境;原生 Windows 尚未验证。参见简明的 Windows 说明。
手动安装(按框架)
更喜欢用你自己的框架命令——或者你使用的是安装器不覆盖的 opencode / pi / QwenPaw?请自行注册技能 + MCP。
插件市场类框架(Claude Code · Qoder · Codex · OpenClaw · Qwen Code)——添加市场,然后安装一个能力(将 <capability> 替换为 core / api / search / video-memory / video-edit / blender / freecad)。默认安装 core——它是其他所有能力所依赖的本地 I/O 基础——再加上你需要的其他能力:
# Claude Code
claude plugin marketplace add https://github.com/QwenLM/Qwen-MM-Plugins.git
claude plugin install qwen-mm-plugins-<capability>@qwen-mm-plugins
# Qoder
qodercli plugins marketplace add https://github.com/QwenLM/Qwen-MM-Plugins.git
qodercli plugins install qwen-mm-plugins-<capability>@qwen-mm-plugins
# Codex
codex plugin marketplace add https://github.com/QwenLM/Qwen-MM-Plugins.git
codex plugin add qwen-mm-plugins-<capability>@qwen-mm-plugins
# OpenClaw
openclaw plugins install qwen-mm-plugins-<capability> --marketplace https://github.com/QwenLM/Qwen-MM-Plugins.git
# Qwen Code
qwen extensions install https://github.com/QwenLM/Qwen-MM-Plugins.git:qwen-mm-plugins-<capability> --consent
marketplace add 也接受本地仓库路径;重复运行是安全的。在 codex 上,marketplace add 不会刷新已添加的市场,因此在 plugin add 之前需要运行 codex plugin marketplace upgrade qwen-mm-plugins 以获取新发布的能力。
其他框架(Gemini CLI · opencode · pi · QwenPaw · …)在其自身配置中注册技能 + MCP——详细的按框架配置块见 docs/zh/installation.md。最省事的方式:直接让 agent 来做——“安装 qwen-mm-plugins-<capability>”。
🔧 依赖
uvx 会在首次启动时为所选配置安装 Python 依赖——无需手动 pip。你只需要自己安装系统工具:ffmpeg(视频 / 音频),以及 visualize 所需的可选 libreoffice / blender / texlive / chromium。运行 bash install.sh verify 进行自检——它会确认你的 API 密钥并报告缺失的系统工具(在底层读取每个能力的环境变量并运行 --check-system)。
完整的系统工具表、edu-agent(仅技能)安装方式,以及 blender/freecad 瘦客户端说明:参见 docs/zh/installation.md。
🔑 配置
基于 API 的工具需要密钥——而原生的图像 / 视频 / 文档读取不需要:
DASHSCOPE_API_KEY—vision_chat/ocr/grounding/transcribe_audio/ Omni 音视频理解 / 生成 / video-memory 构建SERPER_API_KEY—web_search/web_extractor/image_search
在 shell 中导出它们,或将其持久化到 ~/.qwen-mm-plugins/config(当某个变量尚未在环境中时会被读取——因此 GUI 启动的框架也能读取到)。引导式安装器的 Configure 步骤会为你写入该文件:
bash install.sh configure
关于非交互式/自动化设置以及完整的环境变量目录,参见 docs/zh/installation.md。
🚀 快速开始
安装能力后,在你的框架中引用一个文件并直接提问——模型会自动选择正确的工具。读取采用动态分辨率:每张图像、每个视频帧和每个文档页面都会自动缩放到 VL 模型的 patch 网格,因此 4K 截图的细小文字和微型缩略图都能以所需的细节呈现——无需手动调整大小。
# core — 读取图像 / 视频 / 文档 / 3D 模型(本地,动态分辨率)
@dashboard-4k.png 读取这个仪表盘中的每个数字。
@report.pdf 总结第 3 页。
# api — 云端 VL + Omni API:字幕 / OCR / grounding / 分割 / ASR,以及 Omni 音视频理解
@receipt.jpg 对这张发票做 OCR 并将行项目加总。
@street.jpg 在场景中的每辆车周围画一个框。 # grounding
@meeting.mp4 转写这段视频并标注说话人和时间戳。 # omni
@sports-clip.mp4 统计所有完成的传球并列出每次发生的时间。 # omni
@song.mp3 标注流派、情绪、乐器、调性和声线特征。 # omni
# search — 网络 + 反向图像搜索以确认屏幕上内容的真实性
@place.jpg 这张照片是在哪里拍的? # image_search + web_search
# video-memory — 长视频问答;第一次查询会自动构建记忆
@lecture-2h.mp4 主要观点有哪些,并附时间戳?
# video-edit — 图像 / 视频 / 音频生成 + 编辑工作流
生成一张 1024×1024 的图像:一只小熊猫在夜里写代码。
@/path/to/media 帮我把这段视频剪辑到大约 3 分钟。
# blender — 驱动正在运行的 Blender 进行建模 / 贴图 / 光照 / 渲染(瘦客户端,22 个工具)
建模一个低多边形木凳,添加一盏暖色主光,然后渲染它。
# freecad — 在正在运行的 FreeCAD 中进行参数化 CAD(瘦客户端,14 个工具;STEP/STL、FEM)
建模一个 30 mm 长的 M6 六角螺栓并导出为 STEP。
# edu-agent — 将数学/科学问题转化为分步中文讲解视频(仅技能)
@geometry-problem.png 以带旁白的视频讲解如何解决这道题。
每个能力的完整工具列表、安装步骤和实际用例,参见各能力的 🍳 cookbook。
🧪 开发
开发环境搭建、贡献指南和验证命令见 CONTRIBUTING.md。详细指南:本地开发 · 添加新能力 · 测试。
📄 许可证
Apache-2.0——参见 LICENSE。Blender 和 FreeCAD 能力内置了第三方 MIT 许可代码;署名信息参见 src/capabilities/blender/NOTICE.md 和 src/capabilities/freecad/NOTICE.md。
相似文章
Qwen3.7-Plus:多模态智能体 (36分钟阅读)
Qwen3.7-Plus 是一个多模态智能体模型,统一了视觉与语言,实现图形界面与命令行界面的无缝交互,现可通过阿里云模型服务平台使用。
Qwen-Image-2.0 技术报告
Qwen-Image-2.0 是一个全新的图像生成基础模型,基于 Qwen3-VL 和多模态扩散 Transformer,将高保真合成与精确编辑能力统一起来。它在富含文本的内容、多语言排版以及照片级真实感生成方面表现卓越。
Qwen/Qwen-AgentWorld-35B-A3B
Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。
Qwen3.5-Omni 技术报告
Qwen3.5-Omni 是一个千亿参数的多模态模型,具备先进的音视频理解与生成能力,引入了新颖的 Audio-Visual Vibe Coding,在215项基准测试中取得SOTA结果,同时与 Gemini-3.1 Pro 持平。
Qwen/Qwen3.6-27B
Qwen 在 Hugging Face 上发布了开源权重模型 Qwen3.6-27B,该模型具备更高的稳定性、强大的智能体编程能力以及思维链保留特性,有助于提升开发者的工作效率。