SenseNova-U1:基于 NEO-unify 架构统一多模态理解与生成

Hugging Face Daily Papers 论文

摘要

本文介绍了 SenseNova-U1,这是一种统一的多模态架构,整合了理解与生成任务。我们发布了两个变体(8B 和 30B),在感知能力和图像合成方面均表现出竞争力的性能。

近期的大型视觉-语言模型(VLMs)仍受到一个长期存在的根本性二元对立制约:理解与生成被视为截然不同的问题,导致架构碎片化、流水线级联以及表示空间不对齐。我们认为,这种分割不仅仅是工程上的产物,更是一种阻碍原生多模态智能涌现的结构局限性。因此,我们推出了 SenseNova-U1,这是一种基于 NEO-unify 构建的原生统一多模态范式,其中理解与生成演变为单一底层过程的协同视角。我们发布了两个原生统一变体:SenseNova-U1-8B-MoT 和 SenseNova-U1-A3B-MoT,分别基于密集(8B)和混合专家(30B-A3B)的理解基线构建。从第一性原理设计出发,它们在文本理解、视觉-语言感知、知识推理、智能体决策以及空间智能等方面,均能与顶尖的仅具备理解能力的 VLM 相媲美。同时,它们提供了强大的语义一致性和视觉保真度,在传统或知识密集型的任意到图像(X2I)合成、复杂的文本丰富信息图生成以及交错式视觉-语言生成(无论是否包含思维链模式)方面表现卓越。除了性能之外,我们还详细展示了模型设计、数据预处理、预训练/后训练以及推理策略,以支持社区研究。最后但同样重要的是,初步证据表明,我们的模型超越了感知与生成,在视觉-语言-动作(VLA)和世界模型(WM)场景中也表现出强劲的性能。这指向了一个更广阔的技术路线:模型不再是在模态之间进行转换,而是以原生方式跨模态地思考与行动。多模态人工智能不再关乎连接孤立的系统,而是构建一个统一的系统,并信任必要的能力将从其内部自然涌现。
查看原文
查看缓存全文

缓存时间: 2026/05/13 04:10

论文页面 - SenseNova-U1:基于 NEO-unify 架构统一多模态理解与生成

来源:https://huggingface.co/papers/2605.12500 发布于 5月12日

#2 今日精选论文 (https://huggingface.co/papers/date/2026-05-13) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

统一视觉-语言模型将理解与生成视为整合的过程,而非分离的任务,在包括图像合成和行动推理在内的多种多模态能力上表现出强劲性能。

近期的大型视觉-语言模型 (https://huggingface.co/papers?q=vision-language%20models) (VLMs) 仍然受到一个持久二分法的根本性限制:理解与生成被视为截然不同的问题,导致架构碎片化、流水线级联以及表示空间错位。我们认为,这种分歧不仅仅是工程上的产物,更是一种阻碍原生多模态智能 (https://huggingface.co/papers?q=multimodal%20intelligence) 涌现的结构局限性。因此,我们推出了 SenseNova-U1,这是一种基于 NEO-unify (https://huggingface.co/papers?q=NEO-unify) 构建的原生统一多模态范式,其中理解与生成作为单一底层过程的协同视图共同演进。我们发布了两种原生统一变体 SenseNova-U1-8B-MoT 和 SenseNova-U1-A3B-MoT,分别建立在密集(8B)和混合专家 (https://huggingface.co/papers?q=mixture-of-experts) (30B-A3B) 理解基线之上。它们从第一性原理出发进行设计,在文本理解、视觉-语言感知 (https://huggingface.co/papers?q=vision-language%20perception)、知识推理 (https://huggingface.co/papers?q=knowledge%20reasoning)、智能体决策 (https://huggingface.co/papers?q=agentic%20decision-making) 和空间智能 (https://huggingface.co/papers?q=spatial%20intelligence) 方面,与顶尖的理解专用 VLM 并驾齐驱。同时,它们展现出强大的语义一致性和视觉保真度,在传统或知识密集型的任意到图像 (X2I) 合成、复杂富文本信息图生成 (https://huggingface.co/papers?q=text-rich%20infographic%20generation) 以及有无思维链的交错视觉-语言生成方面表现卓越。除了性能之外,我们还展示了详细的模型设计、数据预处理、预/后训练以及推理策略,以支持社区研究。最后但同样重要的是,初步证据表明,我们的模型超越了感知与生成的范畴,在视觉-语言-行动 (https://huggingface.co/papers?q=vision-language-action) (VLA) 和世界模型 (https://huggingface.co/papers?q=world%20model) (WM) 场景中表现强劲。这指向了一条更广泛的路线图:模型不再在模态间进行翻译,而是以原生方式跨模态地思考与行动。多模态人工智能不再是关于连接独立的系统,而是关于构建一个统一的系统,并相信必要的能力会从内部涌现。

查看 arXiv 页面 (https://arxiv.org/abs/2605.12500)查看 PDF (https://arxiv.org/pdf/2605.12500)GitHub1.58k (https://github.com/OpenSenseNova/SenseNova-U1)添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.12500)

在你的智能体中获取此论文:

hf papers read 2605\.12500

没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有链接到此论文的模型

在模型 README.md 中引用 arxiv.org/abs/2605.12500 即可从此页面链接。

引用此论文的数据集0

没有链接到此论文的数据集

在数据集 README.md 中引用 arxiv.org/abs/2605.12500 即可从此页面链接。

引用此论文的应用 (Spaces)0

没有链接到此论文的应用 (Space)

在应用 (Space) README.md 中引用 arxiv.org/abs/2605.12500 即可从此页面链接。

包含此论文的收藏集1

相似文章

SenseNova-U1.5: 迈向原生统一视觉智能

Hugging Face Daily Papers

SenseNova-U1.5是一个8B原生统一多模态模型,它通过补丁重建、精选数据和专家优化,在无需编码器或VAE的情况下执行视觉理解、推理和生成,实现高保真度和指令遵循。

sensenova/SenseNova-U1-8B-MoT

Hugging Face Models Trending

SenseNova U1 是基于 NEO-Unify 框架构建的新一代原生多模态模型系列,在单一架构内统一了理解与生成能力,无需单独的视觉编码器或 VAE。

视觉作为统一多模态生成

Hugging Face Daily Papers

本文介绍 SenseNova-Vision,一个统一的多模态模型,将计算机视觉任务表述为生成问题,在多种视觉任务上实现了与专用系统相当的性能。它引入了一个大规模指令-响应语料库,并公开发布模型和数据集。

sensenova/SenseNova-U1.5-8B-MoT

Hugging Face Models Trending

SenseNova-U1.5-8B-MoT 是一款用于增强视觉创作的原生统一多模态模型,在图像生成质量、文本渲染和精确控制方面有所改进。