MOSS-VL 技术报告
摘要
MOSS-VL 是一个专为实时交互设计的开放视觉语言模型家族,使用门控交叉注意力机制在生成过程中处理视觉信息,并在开源模型的流式基准测试中取得顶尖性能。
查看缓存全文
缓存时间: 2026/08/18 11:51
论文页面 - MOSS-VL 技术报告
来源:https://huggingface.co/papers/2608.15045 发布于 8 月 15 日
#3 每日论文 (https://huggingface.co/papers/date/2026-08-18) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
MOSS-VL 是一个开源视觉-语言模型家族,通过在生成过程中使用门控交叉注意力机制关注视觉信息实现实时交互,并利用合成的交互语料库和分阶段课程学习,在减少首token延迟的同时达到强大的流式性能。
我们提出 MOSS-VL,这是一个开源视觉-语言模型 (https://huggingface.co/papers?q=vision-language%20model) 家族,它将实时交互 (https://huggingface.co/papers?q=real-time%20interaction)——在说话时感知——视为一项核心能力。它在整个技术栈上协同设计:语言解码器仅通过门控交叉注意力 (https://huggingface.co/papers?q=gated%20cross-attention) 来关注视觉信息,因此模型在生成时可以自然地看到传入的帧;合成的交互语料库 (https://huggingface.co/papers?q=interaction%20corpus) 监督模型何时发言、何时保持沉默以及何时修订;而分阶段课程 (https://huggingface.co/papers?q=staged%20curriculum) 将所有实时特定训练集中在基于强大离线基础模型的最后一个轻量级阶段。在离线模式下,MOSS-VL-Instruct 在可比规模上具有竞争力,并在时序推理视频集上领先。在四个流式基准测试 (https://huggingface.co/papers?q=streaming%20benchmarks) 中,MOSS-VL-Realtime 在开源流式模型中取得了三项最佳平均成绩(第四项为第二),横扫了三个直接测试主动行为的子集——在 OmniMMI 主动警报测试中,得分为 66.0,而最佳基线为 37.5。该模型拥有 11.3B 参数,但视觉token不进入解码序列,因此随着视觉上下文的增长,MOSS-VL 相较于同等骨干的 Qwen3-VL-8B,其首token时间 (https://huggingface.co/papers?q=time-to-first-token) 优势从 2.8 倍扩大到 5.1 倍。我们发布了所有五个检查点、训练课程以及实时推理代码,地址为 https://github.com/OpenMOSS/MOSS-VL\。
查看 arXiv 页面 (https://arxiv.org/abs/2608.15045) 查看 PDF (https://arxiv.org/pdf/2608.15045) 项目页面 (https://openmoss.ai/MOSS-VL/) GitHub430 (https://github.com/OpenMOSS/MOSS-VL) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.15045)
获取本文档的代理程序:
hf papers read 2608\.15045
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 7
OpenMOSS-Team/MOSS-VL-Realtime Video-Text-to-Text• 11B• 更新于大约 4 小时前 • 1.81k • 104 (https://huggingface.co/OpenMOSS-Team/MOSS-VL-Realtime)
OpenMOSS-Team/MOSS-VL-Instruct-0708 Video-Text-to-Text• 11B• 更新于大约 4 小时前 • 844 • 29 (https://huggingface.co/OpenMOSS-Team/MOSS-VL-Instruct-0708)
OpenMOSS-Team/MOSS-VL-Base-0708 Video-Text-to-Text• 11B• 更新于大约 4 小时前 • 45 • 18 (https://huggingface.co/OpenMOSS-Team/MOSS-VL-Base-0708)
OpenMOSS-Team/MOSS-VL-Instruct-0708-FP8 Video-Text-to-Text• 11B• 更新于大约 4 小时前 • 63 • 17 (https://huggingface.co/OpenMOSS-Team/MOSS-VL-Instruct-0708-FP8)
浏览 7 个引用本文的模型 (https://huggingface.co/models?other=arxiv:2608.15045)## 引用本文的数据集 0
没有数据集链接本文档
在数据集的 README.md 中引用 arxiv.org/abs/2608.15045 以从此页面链接。
引用本文的 Spaces 5
包含本文的收藏 0
没有包含本文档的收藏
将本文档添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
OpenMOSS-Team/MOSS-VL-Realtime
MOSS-VL-Realtime 是一个实时流式视觉语言模型,能够处理连续视频帧,支持可中断交互、主动静默和动态修正,具备时间戳感知编码和256K上下文窗口。
@AdinaYakup: @Open_MOSS 发布 MOSS-VL 视觉模型:https://huggingface.co/collections/OpenMOSS-Team/moss-vl… 演示:https://hug…
Open_MOSS 开源 110 亿参数 Apache 2.0 视觉-语言模型 MOSS-VL,采用交叉注意力与 XRoPE,在 VSI-bench 上比 Qwen3-VL-8B 高 8.3 分。
MAOAM:基于视觉-语言模型的统一物体与材质选择
本文提出MAOAM,一个统一的视觉-语言模型框架,能够通过文本或点击交互实现精确的物体和材质选择,用于交互式图像编辑。它引入了一个可扩展的数据生成流程,并展示了在推理时结合文本和点击的涌现提升。
Mage-VL:一种高效的编解码原生流式多模态基础模型
Mage-VL 是一种高效的编解码原生流式多模态基础模型,通过自定义分词器将视觉标记消耗减少超过75%,在静态和视频任务上与现有模型持平或更优的同时,实现高达3.5倍的推理加速。
CaVe-VLM-CoT:一个可解释的视觉-语言模型框架
CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。