Mage-VL:一种高效的编解码原生流式多模态基础模型
摘要
Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。
查看缓存全文
缓存时间: 2026/07/29 03:50
论文页面 - Mage-VL:高效的编解码原生流式多模态基础模型
来源:https://huggingface.co/papers/2607.24904 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
标准视觉语言模型(VLM)陷入莫拉维克悖论:它们在复杂的离线视觉推理中表现出色,但在简单的流式感知任务上却难以胜任,且处理效率低下。我们提出 Mage-VL,一个高效的编解码原生流式基础模型,用于实时多模态理解与交互。其核心是我们的定制分词器 Mage-ViT,它摒弃了均匀帧采样,改为通过运动向量和残差能量对稀疏锚点帧(I 帧)和预测帧(P 帧)中的动态、高熵区域进行选择性编码。在 16×16 块粒度上操作,视觉令牌消耗减少超过 75%,同时保留了时空上下文。Mage-ViT 在约 5.6 亿未标注图像和 1 亿未标注视频帧上从头训练,其性能可与基于数十亿图文对训练的主流编码器媲美甚至超越。我们建立了 AI4AI 数据流水线,涵盖多模态字幕生成的提示-代码联合优化,以及基于 AI 驱动的性能诊断来指导训练配方。此外,通过受生物启发的双系统架构——轻量级的 System1 事件门控网络和因果式 System2 解码器——Mage-VL 实现了主动流式感知。大量评估表明,Mage-VL-4B 在静态任务上与 Qwen3-VL-4B 持平,同时在视频理解和 2D/3D 空间推理上取得显著提升,推理速度提升高达 3.5 倍,并全面超越 15B 的 Phi-4-reasoning-vision 基线。除了模型成果,我们还贡献了七项关键实证发现,涵盖预训练数据效率、可变分辨率缩放、编解码系统加速、Video QA SFT 冗余、运动-空间协同、AI4AI 数据流水线以及多模态 RL 的 Zero-Vision SFT。
查看 arXiv 页面 (https://arxiv.org/abs/2607.24904) 查看 PDF (https://arxiv.org/pdf/2607.24904) 项目页面 (https://microsoft.github.io/Mage) GitHub776 (https://github.com/microsoft/Mage) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.24904)
在你的智能体中获取此论文:
hf papers read 2607.24904
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型1
microsoft/Mage-VL Image-Text-to-Text • 5B • 更新于约1小时前 • 702 • 62 (https://huggingface.co/microsoft/Mage-VL)
引用此论文的数据集0
无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.24904 即可从此页面链接。
引用此论文的 Space1
包含此论文的收藏集0
无收藏集包含此论文
添加此论文到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
microsoft/Mage-VL · Hugging Face - 一个高效的编解码器原生流式多模态基础模型
微软推出了Mage-VL,这是一个编解码器原生的流式多模态基础模型,用于图像和视频理解。通过采用受视频编解码器启发的稀疏模式,该模型实现了高达3.5倍的推理加速,同时将视觉令牌减少了超过75%。
Mage (GitHub 仓库)
微软发布了Mage,这是一系列轻量级拥有40亿参数的多模态模型,用于视觉理解和生成。包括用于图像/视频理解的Mage-VL和用于文生图及图像编辑的Mage-Flow,专为在常规硬件上进行研究和部署而设计。
AdaCodec:面向视频多模态大模型的预测性视觉编码
AdaCodec 通过仅在场景预测失败时传输完整视觉标记,否则使用紧凑的帧间变化描述,从而减少多模态大模型中的视频编码冗余。在匹配的标记预算下,它优于逐帧 RGB 基线,并且在使用显著更少标记的情况下取得更好或相当的结果,将首令牌延迟从 9.26 秒降至 1.62 秒。
@jiqizhixin: 如果你的AI能像流媒体编解码器一样“看”视频——只把令牌花在最关键的时刻?介绍……
LLaVA-OneVision-2 引入了编解码流令牌化技术以实现高效的视频理解,在时间与空间基准测试上显著超越 Qwen3-VL-8B。模型、数据和代码均已开源。
Mage-Flow:一个高效的原始分辨率基础模型,用于图像生成和编辑
Mage-Flow 是一个紧凑的 4B 参数生成栈,用于高效的文本到图像生成和基于指令的图像编辑,具有共同设计的轻量级分词器(Mage-VAE)和经过整流流匹配训练的原生分辨率多模态扩散变换器。它在单个 A100 GPU 上实现 0.59 秒的高分辨率生成,同时达到具有竞争力的性能。