microsoft/Mage-VL · Hugging Face - 一个高效的编解码器原生流式多模态基础模型
摘要
微软推出了Mage-VL,这是一个编解码器原生的流式多模态基础模型,用于图像和视频理解。通过采用受视频编解码器启发的稀疏模式,该模型实现了高达3.5倍的推理加速,同时将视觉令牌减少了超过75%。
查看缓存全文
缓存时间: 2026/07/28 20:38
microsoft/Mage-VL · Hugging Face
来源:https://huggingface.co/microsoft/Mage-VL
Mage-VL
一个高效的编解码器原生流式多模态基础模型
项目页面(https://microsoft.github.io/Mage)
arXiv(https://github.com/microsoft/Mage/blob/main/assets/mage_vl_tech_report.pdf)
GitHub(https://github.com/microsoft/Mage)
Mage-VL(https://huggingface.co/microsoft/Mage-VL)
Mage-ViT(https://huggingface.co/microsoft/Mage-ViT)
许可协议:Apache 2.0(https://www.apache.org/licenses/LICENSE-2.0)
Mage-VL 是一个编解码器原生、主动流式多模态基础模型,专为图像和视频理解而设计,其视觉编码器以紧凑的 4B 规模 从头开始 完全训练。它针对现代 VLM 的 莫拉韦克悖论 —— 在复杂离线推理方面表现出色,但在简单的实时流式感知方面却速度慢且计算量大。不同于将视频解码为均匀采样的帧并通过冻结的网页预训练 ViT 推送密集的块 token 网格,Mage-VL 遵循现代视频编解码器的结构:它将流分离为锚帧 (I 帧) 和预测帧 (P 帧),保留所有锚块,仅保留编解码器花费比特的预测帧块 —— 即承载真实运动和新细节的区域。这种编解码器对齐的稀疏性将视觉 token 削减了 超过 75%,同时保留了时空上下文,相较于均匀帧采样实现了高达 3.5 倍的墙上时钟推理加速。该系统由两个组件组成:
- Mage-ViT —— 一个从头训练的 Codec-ViT 视觉编码器,通过编解码器衍生的时空重要性来分配 token,采用共享的
16×16块网格和 3D 旋转位置编码。它是编解码器无关的:同一接口可以接受传统编解码器(H.264/AVC、HEVC/H.265)通过运动向量 + 残差能量输入,或神经编解码器(DCVC-RT)通过其学习的率图输入 —— 无需架构或重新训练更改。 - Qwen3-4B 因果解码器 —— 一个 Qwen3-4B-Instruct-2507 语言主干(唯一预训练组件),通过轻量级两层 MLP 投影器消费 Mage-ViT 的可变长度 token 流,并提供统一接口用于图像、短/长/超长视频以及流式处理。
在此对之上,一个系统 1 与系统 2 双过程设计在单一模型内部增加了主动流式功能:一个轻量级认知门控(系统 1)观察每个滚动编解码器窗口,对常规内容保持静默,仅在需要响应的事件完成时调用完整的 VLM(系统 2)—— 无需多智能体管线。
✨ 亮点
- 编解码器原生 & 从头训练。 整个视觉栈从头训练 —— 无需十亿规模的图像-文本 ViT 初始化。受生物启发的预测补丁机制(
16×16的 I/P 帧)将视觉 token 消耗降低了超过 75%(约 1/8 或更少,相较于密集帧采样),使得模型在相同预算下可以训练长 8 倍的视频。 - 编解码器原生加速。 编解码器 token 化设定了优越的准确率-效率边界 —— 在匹配的准确率下,相较于均匀帧采样实现了高达 3.5 倍的墙上时钟推理加速,并且在大多数视频基准测试中是所有对比模型中最快的(单节点 8×B200)。
- 原生分辨率缩放。 可变分辨率预训练让 Mage-ViT 随着 token 预算单调提升(在 676 个 token 时达到 >96.1% Food-101 / >86.3% ImageNet),而固定分辨率编码器则会饱和或退化。
- 匹配 LLM 的视频增益。 在保持 4B Qwen3 主干冻结、仅替换 ViT 的情况下,Mage-VL 在每一个报告的视频和时间定位基准上均优于 Qwen3-VL-4B —— 在定位密集任务上提升最大(+22.5 QVHighlight、+17.1 ActivityNet、+11.0 VSI-Bench、+24.5 VideoEval-Pro)。
- 同尺寸中的强者。 在静态图像上与 Qwen3-VL-4B 持平,在视频理解和空间智能方面明显领先(+11.0 VSI-Bench、+53.1 CrossPoint、+5.2 EmbSpatial、+22.5 QVHighlight)。
- 主动流式,单一模型。 冻结主干的认知门控实现低延迟、事件门控评论;它在 SoccerNet 流式任务上达到最佳的 TimVal / F1 / ROC-AUC / PR-AUC,并泛化到真实的 2026 年世界杯转播。
📥 模型
单一检查点 microsoft/Mage-VL 是一个统一模型,同时提供图像与视频理解以及主动流式门控 —— 相同的权重既可以回答离线图像/视频问题,也可以驱动事件门控评论。它覆盖 Mage-VL 所有能力:图像理解、帧采样视频、传统 H.264/HEVC 编解码器视频、神经 DCVC-RT 编解码器视频以及事件门控流式。
该仓库捆绑了编解码器处理器、神经编解码器包以及主动门控权重 —— 无需单独的“理解”、“NVC”或“流式”检查点。
我们还额外发布 microsoft/Mage-ViT —— 来自两阶段、从头训练的 ViT 预训练的独立视觉编码器。这仅是 ViT 预训练检查点:它尚未经过与语言模型联合的 VLM 训练。可将其用作数据高效的、编解码器原生的视觉编码器,或作为您自己多模态训练的即插即用 ViT。
| 模型 | 任务 | 主干 | Hugging Face |
|---|---|---|---|
Mage-VL | 图像与视频理解 + 主动流式门控 | Mage-ViT + Qwen3-4B-Instruct-2507 | 🤗 microsoft/Mage-VL (https://huggingface.co/microsoft/Mage-VL) |
Mage-ViT | 编解码器原生视觉编码器 —— 仅 ViT 预训练,无 VLM 联合训练 | Codec-ViT (从头训练) | 🤗 microsoft/Mage-ViT (https://huggingface.co/microsoft/Mage-ViT) |
🏗️ 架构
Mage-VL 主动流式框架
主动流式框架 —— Mage-ViT 增量地将连续流编码为编解码器原生的视觉特征,事件门控和因果解码器共享这些特征。门控对每个滚动窗口打分,对常规内容保持静默;当门控打开时,解码器输出事件条件响应。
Mage-ViT —— 一个从头训练的 Codec-ViT 视觉编码器。在 16×16 块网格上,它保留所有锚帧(I 帧)块,只保留运动显著的预测帧(P 帧)块,将视觉 token 削减超过 75%,同时通过共享的 3D RoPE 保留时空位置。
Mage-VL —— 一个统一模型,其中投影后的视觉 token 和文本 token 共享一个因果 Qwen3 解码器。静态图像成为单个空间块;视频则成为按时间顺序排列的编解码器窗口。在流式模式下,一个轻量级认知门控在每个滚动窗口上预测 p_speak = g(h_t)(通过事件保留特征提取器维护的循环流式记忆),并在 p_speak ≥ τ 时触发生成;响应由冻结的基础模型根据最近的编解码器片段的局部滑动窗口解码,文本查询可随时注入。
训练 —— 一个渐进式五阶段监督课程(无偏好/RL 后训练),产生一个统一模型:
- 通过描述的多模态对齐 —— 约 3.5 亿张密集图像描述 + 420 万条短视频描述。
- 指令微调 + 短时域定位 —— 约 5400 万条图像指令样本 + 340 万条 30–180 秒视频描述。
- 时域范围扩展 —— 中/长视频(LLaVA-Video、TimeLens、VideoChat-Flash、Molmo2),保持图像 SFT。
- 编解码器原生长上下文适应 —— 35 万条长视频作为滚动编解码器窗口(最多 384/768 帧)。
- 主动流式对齐 —— 认知门控在约 330 万条流式样本上微调,视觉编码器和 LLM 保持冻结(仅训练门控)。
五个阶段共同产生一个单一统一模型 Mage-VL,它处理图像理解、离线视频推理和主动流式 —— 不发布单独变体。
管线中的两个部分采用了 AI4AI(AI for AI)范式:(1) 密集重述通过一个智能体闭环运行,其中 GPT-5 评分器对描述打分,Copilot 编码智能体共同设计 prompt 和 工具代码(例如渲染时间戳覆盖),并在人工验证门控下进行 —— 提升所有下游 OCR/文档/图表/感知基准,并启发了 SkillOpt-Lite;(2) 阶段 3 使用基于 AI 的诊断来决定训练哪些视频类别、分辨率和帧数。
📊 性能
图像理解与空间智能 —— 点击展开
各模型性能对比。Mage-VL-4B 和 Qwen3-VL-4B 使用相同的 4B Qwen3 LLM 主干;Phi-4-Multimodal-Instruct(Phi-4-MM, 5.6B)和 Phi-4-Reasoning-Vision(Phi-4-R-V, 15B)作为参考列出。– = 未运行。加粗 = 行内最佳。
| 基准 | Mage-VL-4B | Qwen3-VL-4B | Phi-4-MM-5.6B | Phi-4-R-V-15B |
|---|---|---|---|---|
| 文档理解 | ||||
| DocVQA-val | 95.14 | 94.69 | 92.79 | 76.20 |
| InfoVQA-val | 80.33 | 79.50 | 71.84 | 55.41 |
| AI2D w/ Mask | 83.16 | 81.54 | 81.83 | 82.87 |
| ChartQA | 84.88 | 83.96 | 83.76 | 83.40 |
| OCRBench | 81.80 | 81.60 | 81.70 | 73.90 |
| MultiDocVQA-val | 87.46 | 87.21 | 46.84 | 58.35 |
| ChartQAPro | 32.57 | 26.79 | 0.13 | 25.38 |
| TextVQA-val | 77.28 | 80.55 | 39.93 | 76.06 |
| CC-OCR Doc | 32.25 | 39.69 | 4.99 | 17.65 |
| 通用 VQA | ||||
| MMBench-EN-dev | 84.02 | 83.25 | 65.81 | 84.19 |
| MMBench-CN-dev | 82.04 | 80.58 | 75.17 | 79.47 |
| MMStar | 67.32 | 62.04 | 61.24 | 59.63 |
| MME-Perception | 1709.54 | 1703.50 | 1409.66 | 1590.21 |
| SeedBench (All) | 76.78 | 75.65 | 68.28 | 73.70 |
| CV-Bench | 87.79 | 85.37 | 57.09 | 81.31 |
| MME-RealWorld | 66.52 | 63.20 | 32.45 | 57.80 |
| 空间智能 | ||||
| CV-Bench-2D | 82.13 | 81.00 | 56.12 | 80.11 |
| CV-Bench-3D | 94.75 | 92.30 | 56.92 | 82.50 |
| BLINK | 65.11 | 65.10 | 35.24 | 57.80 |
| EmbSpatial | 82.67 | 77.50 | 41.51 | 72.67 |
| CrossPoint | 80.00 | 26.90 | 12.20 | 47.73 |
| CRPE-Relation | 76.12 | 77.70 | 34.60 | 74.46 |
| SAT | 67.33 | 69.30 | 55.33 | 66.67 |
视频理解与时域定位 —— 点击展开
加粗 = 行内最佳。
| 基准 | Mage-VL-4B | Qwen3-VL-4B | Phi-4-MM-5.6B | Phi-4-R-V-15B |
|---|---|---|---|---|
| 视频 QA | ||||
| MV-Bench | 65.1 | 66.7 | 44.9 | 49.2 |
| NextQA | 83.1 | 79.8 | 54.1 | 69.0 |
| VideoMME | 64.0 | 59.7 | 44.7 | 55.3 |
| LongVideoBench | 61.3 | 57.7 | 41.1 | 51.2 |
| LVBench | 41.8 | 39.2 | 25.3 | 34.4 |
| MLVU-dev | 68.7 | 61.5 | 44.1 | 51.8 |
| VideoEval-Pro | 45.2 | 20.7 | 14.3 | 16.8 |
| 时域定位 | ||||
| Timelens-Charades | 50.7 | 43.1 | 4.09 | 20.6 |
| Timelens-ActivityNet | 45.4 | 28.4 | 2.03 | 23.0 |
| Timelens-QVHighlight | 57.4 | 34.9 | 2.47 | 11.6 |
| 空间推理 | ||||
| VSI-Bench | 64.3 | 53.3 | 24.0 | 25.5 |
| 跟踪 (J&F) | ||||
| Ref-DAVIS17 | 25.83 | 7.48 | 3.14 | 2.15 |
| MeViS-ValidU | 22.55 | 3.16 | 10.28 | 1.53 |
| ReasonVOS | 17.76 | 9.66 | 9.50 | 9.77 |
| Ref-YT-VOS | 25.57 | 5.28 | 8.64 | 3.85 |
主动流式(SoccerNet)与在线视频(OVO-Bench)—— 点击展开
SoccerNet —— 响应时间(StreamMind 协议,编解码器原生输入,零容忍画布匹配)。加粗 = 列内最佳。
| 方法 | TriggerAcc | TimVal | F1 | ROC-AUC | PR-AUC |
|---|---|---|---|---|---|
| StreamMind | 52.18 | 47.36 | – | – | – |
| JoyAI-VL-Interaction-9B | 97.98 | 19.25 | 3.55 | 56.26 | 1.68 |
| Mage-VL-4B | 79.21 | 55.54 | 16.35 | 83.14 | 9.30 |
JoyAI 的高 TriggerAcc 来自于在 SoccerNet 严重类别不平衡下几乎到处预测静默,因此在精度敏感的指标上表现不佳;StreamMind 是在 SoccerNet 的分布内训练的,而 Mage-VL 则不是。
OVO-Bench —— 在线视频理解(SimpleStream 近期窗口协议,4 帧 @ 1 fps;无特定流式微调)。Mage-VL 在流式架构中创下了新的整体分数记录。RT-Avg / BT-Avg 分别是实时视觉感知/向后追溯子任务平均值;Overall 是它们的均值。加粗 = 每列最佳模型(Human 是参考上限)。
| 模型 | #Frames | RT-Avg | BT-Avg | Overall |
|---|---|---|---|---|
| Human | – | 93.2 | 92.3 | 92.77 |
| 离线视频 LLM | ||||
| Qwen2.5-VL-7B | 1 fps | 59.9 | 44.7 | 52.28 |
| LLaVA-Video-7B | 64 | 63.5 | 40.4 | 51.95 |
| Qwen3-VL-4B | 64 | 72.8 | 53.1 | 63.00 |
| 在线/流式视频 LLM | ||||
| VideoLLM-online-8B | 2 fps | 20.8 | 17.7 | 19.26 |
| Flash-VStream-7B | 1 fps | 28.4 | 27.4 | 27.90 |
| Dispider-7B | 1 fps | 54.6 | 36.1 | 45.35 |
| TimeChat-Online-7B | 1 fps | 61.9 | 41.7 | 51.80 |
| StreamForest-7B | 1 fps | 61.2 | 52.0 | 56.60 |
| Streamo-7B | 1 fps | 66.0 | 46.1 | 56.05 |
| HERMES-7B† | 1 fps | 69.0 | 49.4 | 59.20 |
| JoyAI-VL-Interaction-9B | 1 fps | 68.4 | 48.6 | 58.50 |
| Mage-VL-4B | 1 fps | 79.84 | 48.15 | 64.00 |
†HERMES = Qwen2.5-VL-7B + HERMES(4K tokens)。基线结果和表格结构遵循 SimpleStream。
🔬 关键发现
除了模型本身,该报告提炼了七项实验发现,用于高效多模态训练:
- 数据高效的 tokenizer。 Mage-ViT 仅训练于 5.6 亿张无标签图像 + 1 亿帧视频,却匹配了在数十亿图像-文本对上预训练的 SigLIP2。
- 可变分辨率预训练单调缩放。 质量随着视觉 token 预算持续提高,而非像固定分辨率编码器那样饱和或退化。
- 编解码器原生 token 化设定了更好的准确率-效率边界 —— 相较于均匀帧采样实现了高达 3.5 倍的墙上时钟推理加速。
- 显式 VideoQA SFT 是冗余的。 密集视频描述 + 标准图像 SFT 足以实现强大的零样本 VideoQA。
- 运动-空间协同。 动态视频训练显著提升了静态 2D/3D 空间推理能力。
- AI4AI 数据管线。 智能体闭环反馈 + prompt/代码协同设计系统性地提升了描述质量和下游分数(启发了 SkillOpt-Lite)。
- 用于多模态 RL 的零视觉 SFT。 用纯文本推理 SFT 替代视觉 SFT,可以解锁更强的多模态 RL —— 一条计算高效的路径。
🚀 快速开始
单个检查点 microsoft/Mage-VL 覆盖以下所有能力。
| 能力 | 脚本 | 如何运行 |
|---|---|---|
| 图像理解 | inference.py | --mode offline --image |
| 帧采样视频 | inference.py | --mode offline --video --video-backend frames |
| 传统 H.264/HEVC 编解码器视频 | inference.py | --mode offline --video --video-backend codec --codec-engine traditional |
| 神经 DCVC-RT 编解码器视频 | inference.py | --mode offline --video --video-backend codec --codec-engine neural |
| 在线图像/视频 (SGLang) | inference.py | --mode online ... --base-url |
| 事件门控流式评论 | inference_streaming.py | 位于 GitHub 仓库 (https://github.com/microsoft/Mage/tree/main/mage_vl) |
安装
用于离线 Transformers 推理:
pip install "transformers>=5.7" accelerate pillow torch torchvision \
opencv-python codec-video-prep
基于编解码器的视频推理还需要 ffmpeg 和 ffprobe 在 PATH 中。
示例
本仓库附带两个示例输入:
离线推理
下载 inference.py (https://huggingface.co/microsoft/Mage-VL/blob/main/inference.py)。离线模式通过 AutoModelForCausalLM.from_pretrained 加载检查点,并支持图像、帧采样和两种编解码器引擎:
# 图像
python inference.py --mode offline --image examples/dog.jpg \
--question "详细描述这张图片。"
> 图片描绘了一只坐在花纹地毯上的狗。这只狗似乎是中型品种,毛发厚实蓬松。它的毛主要是白色,带有黑色和棕色的斑块。狗的耳朵竖立着,表情平静而专注。 [...]
# 视频 — 均匀帧采样
python inference.py --mode offline --video examples/soccer-broadcast.mp4 \
--video-backend frames --num-frames 32 \
--question "描述这个视频。"
> 视频开头是一个穿着黑色polo衫的男子,留着短短的头...
相似文章
Mage (GitHub 仓库)
微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。
microsoft/Mage-Flow
Microsoft发布Mage-Flow,一个紧凑的4B参数基础模型,用于高效的原生分辨率文生图和基于指令的图像编辑,实现了与更大模型相媲美的质量。
Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑
Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。
AdaCodec:面向视频多模态大模型的预测性视觉编码
AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。
VideoChat3: 完全开源的高效且通用的视频理解MLLM
VideoChat3是一个完全开源、高效且通用的以视频为中心的多模态大语言模型,引入了膨胀3D视觉Transformer (I3D-ViT)和自适应帧分辨率用于流式视频感知,以及可扩展的视频数据合成管道,仅用4B参数就实现了卓越性能。