@SenseTime_AI: SenseNova-Vision-7B-MoT,完全开源:一个模型,所有主要视觉任务…

X AI KOLs Timeline 模型

摘要

商汤科技发布了SenseNova-Vision-7B-MoT,一个完全开源的多模态统一模型,能够通过自然语言指令处理多种视觉任务,支持检测、OCR、深度估计、分割等。

**SenseNova-Vision-7B-MoT,完全开源:一个模型,处理所有主要视觉任务如下:** **检测/OCR/GUI** **深度与法线** **分割** **多视角** 它还能通过自然语言定义新的视觉任务变体——跨越传统任务边界重新组合视觉能力。 开源内容包括:模型权重 + SenseNova-Vision语料库(5000万示例子集,以及复现其余公开源数据的完整工具包),供研究开发使用。 HF: https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT… GitHub: https://github.com/OpenSenseNova/SenseNova-Vision… 试用Demo: https://huggingface.co/spaces/sensenova/SenseNova-Vision… 技术报告: https://arxiv.org/abs/2607.06560 Discord: http://discord.gg/BuTXPHmQub
查看原文
查看缓存全文

缓存时间: 2026/07/14 06:18

SenseNova-Vision-7B-MoT,完全开源:一个模型,覆盖以下所有主要视觉任务: 检测/OCR/GUI 深度与法线 分割 多视图

它还能通过自然语言定义新的视觉任务变体——跨越传统任务边界重新组合视觉能力。

开源内容:模型权重 + SenseNova-Vision 语料库(含5000万示例子集,以及用于复现其余公开来源数据的完整工具包),供研究与开发使用。

HF: https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT… GitHub: https://github.com/OpenSenseNova/SenseNova-Vision… 体验演示: https://huggingface.co/spaces/sensenova/SenseNova-Vision… 技术报告: https://arxiv.org/abs/2607.06560 Discord: http://discord.gg/BuTXPHmQub


sensenova/SenseNova-Vision-7B-MoT · Hugging Face

来源: https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#vision-as-unified-multimodal-generation视觉作为统一多模态生成

English|简体中文 (https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT/blob/main/README_CN.md)

GitHub Stars (https://github.com/OpenSenseNova/SenseNova-Vision)arXiv (https://arxiv.org/abs/2607.06560)ModelScope 模型 (https://modelscope.cn/models/SenseNova/SenseNova-Vision-7B-MoT)许可证 (https://creativecommons.org/licenses/by-nc/4.0/)

SenseNova-Vision 在统一模型中处理多种视觉任务

SenseNova-Vision 系统概览

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#%F0%9F%8C%9F-overview🌟 概述

SenseNova-Vision 是一个面向计算机视觉的统一多模态模型。它将异构的视觉感知任务重新表述为文本生成图像生成混合文本-图像生成,而无需为每个单独任务依赖特定任务的头部、解码器或损失函数。该模型在一个共享的指令遵循接口中支持结构化视觉理解、密集几何预测、分割和多视图视觉几何。

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#%F0%9F%9A%80-model-description🚀 模型描述

SenseNova-Vision 将计算机视觉重新构想为统一多模态生成。传统的计算机视觉系统通常为检测、分割、深度、表面法线或3D几何附加特定任务的预测头。而 SenseNova-Vision 通过统一多模态模型的原生输入-输出空间来表达这些异构任务。

自然语言指令和可选的视觉提示指定了目标任务、区域、视图、输出模式和解码约定。然后,模型根据任务生成不同的目标格式:

目标类型代表任务输出形式结构化文本检测、指代定位、OCR、GUI 接地、关键点、相机参数带有归一化坐标或结构化字段的文本记录密集图像深度、表面法线、点图、二值掩码、彩色编码掩码类图像的目标图混合文本-图像多实例分割、接地对话分割、组合感知文本标签加上生成的掩码或视觉图 这种公式使得单一模型能够覆盖结构化视觉理解、密集几何预测、分割和多视图视觉几何,同时保持输出可解码以用于标准基准测试。

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#%F0%9F%8C%90-key-features🌐 关键特性

  • 统一的视觉任务公式: 异构的计算机视觉任务被投射到统一多模态模型的原生文本、图像和混合生成空间中。
  • 无需特定任务头部: 该模型不依赖单独的检测、分割、深度、法线或几何头部。
  • 可解码的输出: 生成的文本和图像可以转换回基准兼容的边界框、点、OCR 字符串、掩码、深度图、法线图、点图和相机记录。
  • 广泛的任务覆盖: 同一模型处理结构化视觉理解、分割、密集几何和多视图视觉几何。
  • 指令定义的任务变体: 自然语言指令能够实现超越固定基准模式的灵活任务定义。

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#%F0%9F%9B%A0%EF%B8%8F-how-to-use🛠️ 如何使用

请使用 SenseNova-Vision GitHub 仓库中的官方推理代码:

git clone https://github.com/OpenSenseNova/SenseNova-Vision.git cd SenseNova-Vision

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#environment-setup环境设置

在仓库根目录下创建环境:

bash setup.sh sensenova-vision conda activate sensenova-vision

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#download-the-model下载模型

你可以使用 huggingface_hub 从 Hugging Face 下载模型权重:

`` from huggingface_hub import snapshot_download

model_path = snapshot_download(“sensenova/SenseNova-Vision-7B-MoT”) print(model_path) ``

打印的 model_path 指向本地检查点目录,可用作推理的模型路径。

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#run-the-curated-example运行精选示例

我们提供了一个精选示例,用于快速验证环境和模型设置:

bash scripts/run_sensenova_vision.sh example

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#run-one-inference-request运行一次推理请求

你也可以使用官方封装运行单个推理请求。例如,以下命令对目标类别 "person" 执行二值分割:

bash scripts/run_sensenova_vision.sh inference \ binary_seg \ "person" \ examples/images/2.jpg

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#launch-the-web-demo启动网页演示

你可以使用仓库中提供的官方封装启动 Gradio 网页演示。封装会在启动 Gradio 前打印本地 URL。在浏览器中打开打印的 URL 即可与模型交互。

更多详情、支持的任务以及额外示例,请参阅官方 GitHub 仓库:

https://github.com/OpenSenseNova/SenseNova-Vision

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#%F0%9F%8F%97%EF%B8%8F-key-contributions🏗️ 关键贡献

  • 🔗 我们引入了一种统一的多模态生成公式,将异构的计算机视觉任务投射到 UMM 的原生输入-输出空间中。
  • 🧩 我们构建了 SenseNova-Vision 语料库,这是一个大规模的计算机视觉指令-响应的语料库,包含可解码的文本、图像以及混合文本-图像目标。
  • ✨ 我们训练了 SenseNova-Vision,并在结构化视觉理解、密集几何预测、分割和多视图视觉几何方面展示了强劲的结果,同时支持超越固定基准模式的语言定义任务变体。

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#%F0%9F%8F%86-benchmark-results🏆 基准测试结果

SenseNova-Vision 在结构化视觉理解、密集几何预测、分割和多视图视觉几何方面进行了评估。所有任务均使用自然语言指令进行公式化:文本输出被解析为基准特定的结构,如边界框、点、识别文本、关键点和相机参数,而图像输出则被解码为掩码、深度图、法线图或3D点图。

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#structured-visual-understanding结构化视觉理解

结构化视觉理解评估输出可以表示为结构化文本预测的任务,包括框和点定位、指代检测、OCR 定位、GUI 接地和关键点定位。

方法目标检测OCRGUI关键点COCO-Com.HR/RefCOCOg V/TLVISDense200VisDroneHierTextICDAR15ScreenSpot-V2COCO-Kpt.bboxbboxbboxbboxbboxpointbboxbboxbboxbboxpointGrounding DINO-Swin-T56.625.2 / 45.9 / 46.838.833.138.5––––Bagel50.274.6 / 76.4 /77.846.842.423.036.97.115.881.1–Qwen3-VL-8B-Instruct46.670.4 / 72.3 / 72.643.213.528.735.722.425.990.5–Qwen3.5-9B49.371.7 / 72.1 / 72.643.227.526.841.719.611.492.2–LocateAnything54.778.7 /76.7/ 77.650.758.739.960.429.126.485.5–Rex-Omni52.979.9/ 73.6 / 74.346.958.335.858.928.028.188.432.6SenseNova-Vision56.6****80.2/79.6/80.554.866.843.362.931.249.585.934.6### https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#dense-geometric-prediction密集几何预测

密集几何预测评估像素对齐的几何输出,包括单目深度估计和表面法线估计。

方法深度法线NYUv2KITTIETH3DScanNetDIODEScanNetiBims-1NYUv2AbsRel↓ / δ1↑Mean↓ / 11.25°↑DSINE–––––16.2 / 61.017.1 / 67.416.4 / 59.6DepthAnything4.3 /98.17.6 / 94.712.7 / 88.24.3 / 98.126.0 / 75.9——DepthAnything V24.5 / 97.97.4 / 94.613.1 / 86.54.2 / 97.826.5 / 73.4——MoGe-23.5/ 98.05.5/**97.73.4**/**98.83.4**/**98.323.0**/**82.312.8**/**68.414.7**/**70.414.7**/62.3Marigold5.5 / 96.49.9 / 91.66.5 / 95.96.4 / 95.230.8 /77.321.3 / 45.618.5 / 64.720.9 / 50.5DICEPTION6.1 / 96.06.9 / 94.95.0 / 97.57.2 / 94.428.9 / 72.218.8 / 53.6–18.3 / 52.9FE2E4.1/97.76.6/**96.03.8**/98.74.4 / 97.522.8 /81.213.8/67.215.1/70.616.2/59.6Lotus-24.1/ 97.66.7 / 94.54.6 /98.14.2/97.622.1/ 75.214.2 / 66.815.4/70.416.9 / 59.0SenseNova-Vision4.0/**98.15.9**/95.94.3/ 97.43.9/**98.0***20.6**/ 76.412.8/68.915.4/ 69.114.4/62.7### https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#segmentation分割

分割评估在语义、指代、推理、接地和交互式引导下的掩码预测。

方法通用分割指代分割推理分割GCG分割交互式分割Pan. / Sem.RefCOCO / + / gVal / TestVal / TestPoint / BoxLISA-7B–74.9 / 65.1 / 67.952.9 / 47.362.0 / 61.7–PSALM55.9/66.683.6 / 72.9 / 73.8––64.3/ 67.3Text4Seg–79.2 / 72.8 / 74.059.1 / 57.1––LENS–84.2/79.4/81.262.1/ 57.2––ConverSeg–79.4 / 74.3 / 74.961.9 / 57.0––X-SAM54.7/66.585.1/78.0/83.856.6 /57.869.4/69.0****65.4/70.0SenseNova-Vision48.8 / 64.081.3 / 76.0 / 80.363.2/60.765.7/66.260.9 /73.9### https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#multi-view-visual-geometry多视图视觉几何

多视图视觉几何评估从多个输入图像进行的几何预测,包括多视图点图重建和相机姿态估计。

方法多视图重建相机姿态Acc.↓ / Comp.↓ / F1↑RRA@30↑ / RTA@30↑ / AUC@30↑7ScenesETH3DRe10KCO3Dv2DUSt3R0.026 / 0.034 / 87.10.359 / 0.531 / 66.699.8 / 84.9 / 67.697.7 / 93.4 / 78.3DepthAnything30.020/0.026/90.50.228 / 0.212 / 76.6100.0/96.4/89.6****99.3/98.0/91.8VGGT0.023 / 0.032 / 88.40.177/0.155/80.9****100.0/ 93.5 / 79.398.3 / 96.6 / 89.2MoRe0.038 / 0.039 / 77.10.348 / 0.318 / 62.7100.0/ 94.0 / 79.198.4 / 96.3 / 83.0MapAnything0.027/ 0.029 / 87.80.400 / 0.524 / 67.0100.0/ 93.5 /80.795.5 / 91.6 / 70.9G2VLM0.084 / 0.056 / 59.20.784 / 0.553 / 36.799.8 / 77.5 / 51.896.3 / 92.0 / 55.2SenseNova-Vision0.028 /0.026/87.9****0.301/0.175/72.299.8 /94.2/ 77.397.4/95.4/80.1### https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#comparison-with-generalist-vision-models与通用视觉模型的比较

我们进一步将 SenseNova-Vision 与近期跨越多种视觉能力的通用视觉模型进行比较。

方法检测语义分割指代分割深度mAPmIoUcIoUδ1COCOCityscapesRefCOCO / + / gNYUv2Youtu-VL47.170.480.7 /76.2/ 76.590.4SenseNova-Vision53.771.281.3/ 76.0 /80.3****98.1方法语义分割指代分割推理分割深度法线mIoUcIoUgIoUδ1Mean Error↓CityscapesRefCOCOgReasonSegKITTINYUv2DIODEETH3DNYUv2ScanNetDIODEVision Banana69.973.879.391.594.891.793.517.815.113.8SenseNova-Vision71.2****80.363.295.998.176.497.414.4****12.815.3### https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#general-multimodal-capability通用多模态能力

SenseNova-Vision 在适应视觉感知任务的同时,基本保持了通用多模态能力。

方法理解生成MMMUMMVPMathVistaGenEvalWISEBagel0.5569.373.10.820.52SenseNova-Vision0.4279.067.70.850.45## https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#%F0%9F%96%BC%EF%B8%8F-qualitative-examples🖼️ 定性示例

SenseNova-Vision 跨视觉任务的定性结果

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#%F0%9F%93%9A-training-data📚 训练数据

SenseNova-Vision 在 SenseNova-Vision-Corpus-50M 上训练,这是一个大规模的计算机视觉指令-响应语料库。该语料库将异构的标注转换为共享模式,包含视觉输入、自然语言指令和可解码目标(表示为文本、图像或混合文本-图像响应)。

该语料库涵盖四个任务族:

任务族代表任务目标表示结构化视觉理解检测、指代定位、指向、关键点、OCR、布局、GUI 接地带有归一化坐标和轻量级结构标记的文本记录密集几何预测单目深度估计和表面法线预测确定性编码的图像目标分割指代分割、推理分割、交互式分割、通用分割和接地对话分割二值掩码、彩色编码掩码或混合文本-图像响应多视图视觉几何点图重建和相机姿态估计类图像的点图和结构化相机记录

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#%E2%9A%A0%EF%B8%8F-limitations⚠️ 局限性

  • 并非每个任务的专业模型: 尽管 SenseNova-Vision 涵盖许多任务,但在某些专业基准上,任务特定模型仍可能表现更优。
  • 输出解析依赖于任务: 文本输出需要任务特定的解析器,图像输出需要与训练协议一致的解码规则。
  • 指标准确性不保证: 密集深度、法线、点图和相机姿态预测应在下游使用前仔细验证。
  • 提示敏感性: 作为指令遵循模型,性能可能因提示措辞、输出模式和视觉提示风格而异。
  • 数据集和基准偏差: 模型行为反映了训练语料库的分布和标注约定。

https://huggingface.co/sensenova/SenseNova-Vision-7B-MoT#%F0%9F%9B%A1%EF%B8%8F-ethical-considerations🛡️ 伦理考虑

SenseNova-Vision 可能生成不正确的定位、分割、深度、法线或相机预测。用户应避免在安全关键型环境中部署该模型,除非有独立验证。当用于涉及人群、人脸、文档、医疗场景、监控图像或私人环境的数据集时,用户有责任遵守适用的隐私、同意和数据治理要求。

相似文章

sensenova/SenseNova-U1-8B-MoT

Hugging Face Models Trending

SenseNova U1 是基于 NEO-Unify 框架构建的新一代原生多模态模型系列,在单一架构内统一了理解与生成能力,无需单独的视觉编码器或 VAE。

视觉作为统一多模态生成

Hugging Face Daily Papers

本文介绍 SenseNova-Vision,一个统一的多模态模型,将计算机视觉任务表述为生成问题,在多种视觉任务上实现了与专用系统相当的性能。它引入了一个大规模指令-响应语料库,并公开发布模型和数据集。