SenseNova-U1.5: 迈向原生统一视觉智能
摘要
SenseNova-U1.5是一个8B原生统一多模态模型,它通过补丁重建、精选数据和专家优化,在无需编码器或VAE的情况下执行视觉理解、推理和生成,实现高保真度和指令遵循。
查看缓存全文
缓存时间: 2026/09/11 06:17
论文页面 - SenseNova-U1.5:迈向原生统一视觉智能
来源:https://huggingface.co/papers/2609.11929 发布于 9月10日
#2 每日精选论文 (https://huggingface.co/papers/date/2026-09-11) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
SenseNova-U1.5 是一个 8B 参数的原生统一多模态模型,无需编码器或 VAE 即可执行视觉理解、推理和生成,通过块重建、精选数据、专家优化和策略内蒸馏实现了高保真度和指令遵循。
我们推出了 SenseNova-U1.5,一个 8B-MoT (https://huggingface.co/papers?q=8B-MoT) 原生统一多模态模型 (https://huggingface.co/papers?q=native%20unified%20multimodal%20model),它在无编码器 (https://huggingface.co/papers?q=encoder-free) 和 无VAE (https://huggingface.co/papers?q=VAE-free) 的架构内理解、推理并生成视觉内容。我们通过空间一致的块重建 (https://huggingface.co/papers?q=spatially%20coherent%20patch%20reconstruction) 强化了其视觉接口,并通过精心策划的生成与编辑数据、改进的任务表述、结构化提示增强以及高达4K的原生分辨率来扩展其训练。在后训练阶段,我们为视觉美学 (https://huggingface.co/papers?q=visual%20aesthetics)、双语文本渲染 (https://huggingface.co/papers?q=bilingual%20text%20rendering)、信息图生成 (https://huggingface.co/papers?q=infographic%20generation) 和图像编辑优化了专门的专家模型,并通过多专家策略内蒸馏 (https://huggingface.co/papers?q=multi-expert%20on-policy%20distillation) 巩固了它们的能力。在广泛的评估中,SenseNova-U1.5 在图像保真度、文本渲染、复杂构图、多参考编辑和交替生成 (https://huggingface.co/papers?q=interleaved%20generation) 方面取得了显著进步,同时提升了指令遵循能力,并保持了主体身份、几何结构和未修改区域的完整性。尽管其生成数据中对结构化格式的接触有限,但 SenseNova-U1.5 能够有效泛化到长篇、复杂和结构化的视觉指令,这进一步证明了多模态理解可以迁移到视觉规划与创作中。这些发现共同表明,原生统一建模是实现能够感知、推理和创造的系统的一个有前景的途径,其架构是完全端到端的。我们将开源训练代码,包括监督微调、强化学习 (https://huggingface.co/papers?q=reinforcement%20learning) 和策略内蒸馏。
查看 arXiv 页面 (https://arxiv.org/abs/2609.11929)查看 PDF (https://arxiv.org/pdf/2609.11929)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.11929)
在你的代理中获取此论文:
hf papers read 2609\.11929
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2609.11929 以从此页面链接它。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.11929 以从此页面链接它。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2609.11929 以从此页面链接它。
包含此论文的收藏集1
相似文章
SenseNova-U1:基于 NEO-unify 架构统一多模态理解与生成
本文介绍了 SenseNova-U1,这是一种统一的多模态架构,整合了理解与生成任务。我们发布了两个变体(8B 和 30B),在感知能力和图像合成方面均表现出竞争力的性能。
sensenova/SenseNova-U1-8B-MoT
SenseNova U1 是基于 NEO-Unify 框架构建的新一代原生多模态模型系列,在单一架构内统一了理解与生成能力,无需单独的视觉编码器或 VAE。
sensenova/SenseNova-U1.5-8B-MoT
SenseNova-U1.5-8B-MoT 是一款用于增强视觉创作的原生统一多模态模型,在图像生成质量、文本渲染和精确控制方面有所改进。
视觉作为统一多模态生成
本文介绍 SenseNova-Vision,一个统一的多模态模型,将计算机视觉任务表述为生成问题,在多种视觉任务上实现了与专用系统相当的性能。它引入了一个大规模指令-响应语料库,并公开发布模型和数据集。
SenseNova U1.5-Lite 全面发布:专家训练、OPD蒸馏、推理统一模型
SenseNova U1.5-Lite 已发布,具备专家训练和OPD蒸馏功能,创建统一模型用于推理,改进了指令跟随和图像生成能力。