Qwen-MM-Plugins(GitHub 仓库)

TLDR AI 工具

摘要

QwenLM 发布了 Qwen-MM-Plugins,这是一组原生多模态插件,通过技能和可选的 MCP 服务器,为 Qwen 模型添加图像、视频、音频、搜索、3D/CAD 和视频编辑能力。它包含多个 Agent 框架的使用手册和引导式安装程序。

此仓库包含 Qwen 模型的原生多模态插件。它们使 Agent 工具架具备原生多模态能力。每项能力都包含一个技能和一个可选的 MCP 服务器。每个能力的教程都提供了完整的工具列表、设置步骤和实际案例。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:29

QwenLM/Qwen-MM-Plugins

来源:https://github.com/QwenLM/Qwen-MM-Plugins

Qwen-MM-Plugins

简体中文 · English

Qwen 模型的原生多模态插件。让任何 agent 框架具备原生多模态能力。

目录

🧩 能力

每个能力单独安装——一个 技能(skill)(让模型知道工具集存在)加上一个可选的 MCP 服务器(工具本身)。我们提供了 cookbook 展示 Qwen3.8-Max + 这些插件的实际运行效果——每个能力的 cookbook(链接见下表)包含完整的工具列表、安装步骤和实际用例。尽情享用!

能力功能安装名称Cookbook
core本地 I/O 插件:以动态分辨率读取图像和视频,并可视化任何文件(如文档、3D 模型等)——外加一些图像工具(裁剪、标注、提取帧)qwen-mm-plugins-core链接
api按模型系列分类的云端媒体理解 API:VL(视觉对话、OCR、 grounding)、Omni 音视频(带时间戳的字幕生成、ASR / 多说话人分离、时间定位、事件计数),以及 ASR 和分割(SAM3);目前支持 DashScopeqwen-mm-plugins-api链接
search网络 + 反向图像搜索以核实事实:网络搜索、页面提取、反向图像搜索;目前支持 Serperqwen-mm-plugins-search待定
video-memory长视频记忆:一种层级图记忆,支持对超长视频进行问答qwen-mm-plugins-video-memory待定
video-edit视频编辑 + 生成:编辑工作流 + 图像 / 视频 / 音频生成qwen-mm-plugins-video-edit待定
blenderBlender 3D 建模:通过 Python 驱动正在运行的 Blender(瘦客户端,22 个工具)——建模 / 材质 / 光照 / 渲染qwen-mm-plugins-blender待定
freecadFreeCAD 参数化 CAD:驱动正在运行的 FreeCAD(瘦客户端,14 个工具)——建模、属性编辑、STEP/STL 导入/导出、FEM 分析qwen-mm-plugins-freecad待定
edu-agent教学讲解视频:将数学/科学问题或图像转化为分步中文讲解视频 / 交互式页面(仅技能,无 MCP 服务器)qwen-mm-plugins-edu-agent待定

🏗 架构

Qwen-MM-Plugins 架构

📦 安装

一个能力 = 一个 技能(skill)(让模型知道工具存在)+ 一个可选的 MCP 服务器(工具本身,由 uvx 按需启动——需要 uv (https://docs.astral.sh/uv/),无需手动 pip)。

推荐:引导式安装器

一个脚本处理它所支持的所有框架(Claude Code · Codex · Qoder · OpenClaw · Qwen Code · Gemini CLI)的 安装 · 配置 · 验证 · 卸载。它在底层驱动各框架自身的原生安装——不重新造轮子——并写入一个共享配置文件(~/.qwen-mm-plugins/config),GUI 和终端框架都能读取,因此只需配置一次:

curl -fsSL https://raw.githubusercontent.com/QwenLM/Qwen-MM-Plugins/main/install.sh | bash

或者一次只执行一个操作——bash install.sh install / configure / verify / uninstallconfigureverify 的具体操作详见配置依赖)。

Windows x64: 使用 WSL2(推荐 Ubuntu),并将仓库克隆到 WSL 主目录内(例如 ~/code),而不是挂载的 Windows 驱动器(如 /mnt/c)。然后在其中运行相同命令。WSL2 是目前唯一受支持的 Windows 环境;原生 Windows 尚未验证。参见简明的 Windows 说明

手动安装(按框架)

更喜欢用你自己的框架命令——或者你使用的是安装器不覆盖的 opencode / pi / QwenPaw?请自行注册技能 + MCP。

插件市场类框架(Claude Code · Qoder · Codex · OpenClaw · Qwen Code)——添加市场,然后安装一个能力(将 <capability> 替换为 core / api / search / video-memory / video-edit / blender / freecad)。默认安装 core——它是其他所有能力所依赖的本地 I/O 基础——再加上你需要的其他能力:

# Claude Code
claude plugin marketplace add https://github.com/QwenLM/Qwen-MM-Plugins.git
claude plugin install qwen-mm-plugins-<capability>@qwen-mm-plugins

# Qoder
qodercli plugins marketplace add https://github.com/QwenLM/Qwen-MM-Plugins.git
qodercli plugins install qwen-mm-plugins-<capability>@qwen-mm-plugins

# Codex
codex plugin marketplace add https://github.com/QwenLM/Qwen-MM-Plugins.git
codex plugin add qwen-mm-plugins-<capability>@qwen-mm-plugins

# OpenClaw
openclaw plugins install qwen-mm-plugins-<capability> --marketplace https://github.com/QwenLM/Qwen-MM-Plugins.git

# Qwen Code
qwen extensions install https://github.com/QwenLM/Qwen-MM-Plugins.git:qwen-mm-plugins-<capability> --consent

marketplace add 也接受本地仓库路径;重复运行是安全的。在 codex 上,marketplace add 不会刷新已添加的市场,因此在 plugin add 之前需要运行 codex plugin marketplace upgrade qwen-mm-plugins 以获取新发布的能力。

其他框架(Gemini CLI · opencode · pi · QwenPaw · …)在其自身配置中注册技能 + MCP——详细的按框架配置块见 docs/zh/installation.md。最省事的方式:直接让 agent 来做——“安装 qwen-mm-plugins-<capability>”。

🔧 依赖

uvx 会在首次启动时为所选配置安装 Python 依赖——无需手动 pip。你只需要自己安装系统工具ffmpeg(视频 / 音频),以及 visualize 所需的可选 libreoffice / blender / texlive / chromium。运行 bash install.sh verify 进行自检——它会确认你的 API 密钥并报告缺失的系统工具(在底层读取每个能力的环境变量并运行 --check-system)。

完整的系统工具表、edu-agent(仅技能)安装方式,以及 blender/freecad 瘦客户端说明:参见 docs/zh/installation.md

🔑 配置

基于 API 的工具需要密钥——而原生的图像 / 视频 / 文档读取不需要:

  • DASHSCOPE_API_KEYvision_chat / ocr / grounding / transcribe_audio / Omni 音视频理解 / 生成 / video-memory 构建
  • SERPER_API_KEYweb_search / web_extractor / image_search

在 shell 中导出它们,或将其持久化到 ~/.qwen-mm-plugins/config(当某个变量尚未在环境中时会被读取——因此 GUI 启动的框架也能读取到)。引导式安装器的 Configure 步骤会为你写入该文件:

bash install.sh configure

关于非交互式/自动化设置以及完整的环境变量目录,参见 docs/zh/installation.md

🚀 快速开始

安装能力后,在你的框架中引用一个文件并直接提问——模型会自动选择正确的工具。读取采用动态分辨率:每张图像、每个视频帧和每个文档页面都会自动缩放到 VL 模型的 patch 网格,因此 4K 截图的细小文字和微型缩略图都能以所需的细节呈现——无需手动调整大小。

# core — 读取图像 / 视频 / 文档 / 3D 模型(本地,动态分辨率)
@dashboard-4k.png 读取这个仪表盘中的每个数字。
@report.pdf 总结第 3 页。

# api — 云端 VL + Omni API:字幕 / OCR / grounding / 分割 / ASR,以及 Omni 音视频理解
@receipt.jpg 对这张发票做 OCR 并将行项目加总。
@street.jpg 在场景中的每辆车周围画一个框。 # grounding
@meeting.mp4 转写这段视频并标注说话人和时间戳。 # omni
@sports-clip.mp4 统计所有完成的传球并列出每次发生的时间。 # omni
@song.mp3 标注流派、情绪、乐器、调性和声线特征。 # omni

# search — 网络 + 反向图像搜索以确认屏幕上内容的真实性
@place.jpg 这张照片是在哪里拍的? # image_search + web_search

# video-memory — 长视频问答;第一次查询会自动构建记忆
@lecture-2h.mp4 主要观点有哪些,并附时间戳?

# video-edit — 图像 / 视频 / 音频生成 + 编辑工作流
生成一张 1024×1024 的图像:一只小熊猫在夜里写代码。
@/path/to/media 帮我把这段视频剪辑到大约 3 分钟。

# blender — 驱动正在运行的 Blender 进行建模 / 贴图 / 光照 / 渲染(瘦客户端,22 个工具)
建模一个低多边形木凳,添加一盏暖色主光,然后渲染它。

# freecad — 在正在运行的 FreeCAD 中进行参数化 CAD(瘦客户端,14 个工具;STEP/STL、FEM)
建模一个 30 mm 长的 M6 六角螺栓并导出为 STEP。

# edu-agent — 将数学/科学问题转化为分步中文讲解视频(仅技能)
@geometry-problem.png 以带旁白的视频讲解如何解决这道题。

每个能力的完整工具列表、安装步骤和实际用例,参见各能力的 🍳 cookbook

🧪 开发

开发环境搭建、贡献指南和验证命令见 CONTRIBUTING.md。详细指南:本地开发 · 添加新能力 · 测试

📄 许可证

Apache-2.0——参见 LICENSE。Blender 和 FreeCAD 能力内置了第三方 MIT 许可代码;署名信息参见 src/capabilities/blender/NOTICE.mdsrc/capabilities/freecad/NOTICE.md

相似文章

Qwen-Image-2.0 技术报告

Hugging Face Daily Papers

Qwen-Image-2.0 是一个全新的图像生成基础模型,基于 Qwen3-VL 和多模态扩散 Transformer,将高保真合成与精确编辑能力统一起来。它在富含文本的内容、多语言排版以及照片级真实感生成方面表现卓越。

Qwen/Qwen-AgentWorld-35B-A3B

Hugging Face Models Trending

Qwen 发布 Qwen-AgentWorld-35B-A3B,这是一个原生语言世界模型,能够通过长链思维推理模拟七个领域的智能体环境。该模型采用三阶段流水线训练,支持 MCP、搜索、终端、SWE、Android、Web 和操作系统交互。

Qwen3.5-Omni 技术报告

Hugging Face Daily Papers

Qwen3.5-Omni 是一个千亿参数的多模态模型,具备先进的音视频理解与生成能力,引入了新颖的 Audio-Visual Vibe Coding,在215项基准测试中取得SOTA结果,同时与 Gemini-3.1 Pro 持平。

Qwen/Qwen3.6-27B

Hugging Face Models Trending

Qwen 在 Hugging Face 上发布了开源权重模型 Qwen3.6-27B,该模型具备更高的稳定性、强大的智能体编程能力以及思维链保留特性,有助于提升开发者的工作效率。