sensenova/SenseNova-U1.5-8B-MoT
摘要
SenseNova-U1.5-8B-MoT 是一款用于增强视觉创作的原生统一多模态模型,在图像生成质量、文本渲染和精确控制方面有所改进。
查看缓存全文
缓存时间: 2026/08/25 10:15
sensenova/SenseNova-U1.5-8B-MoT · Hugging Face
来源:https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT 英文|简体中文 (https://huggingface.co/sensenova/README_CN.md)
GitHub (https://github.com/OpenSenseNova/SenseNova-U1)SenseNova-U1.5 在 Hugging Face (https://huggingface.co/collections/sensenova/sensenova-u15)NEO-unify (https://huggingface.co/blog/sensenova/neo-unify)ModelScope-模型 (https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT)SenseNova-U 演示 (https://unify.light-ai.top/)许可证 (https://github.com/OpenSenseNova/SenseNova-U1/blob/refs/heads/feat/u1.5/LICENSE)
SenseNova-U1.5 原生统一多模态架构
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#overview概览
SenseNova-U1.5-8B-MoT 是我们最新的原生统一多模态模型检查点,旨在实现更准确、一致、可靠且视觉上引人入胜的图像创作。该模型基于NEO-unify (https://huggingface.co/blog/sensenova/neo-unify)构建,强化了图像块化层、数据质量与分布、任务形式化、提示词增强以及后训练流程。
本次官方发布重点关注六项用户可感知的改进:
- 更高质量的图像生成: 改进了构图与色彩和谐,拥有更真实的材质渲染、自然光照、更强的视觉保真度以及更精细的局部细节。
- 更好的文本渲染与信息图生成: 中英文文本可读性更高,在海报、信息图、品牌资产等文字密集的设计中拥有更清晰的信息层级。
- 更高效的原生4K生成: 全局结构更连贯,色彩更和谐,高分辨率输出更稳定,且生成效率得到提升。
- 更可靠的原生图像编辑: 在局部、文本、多参考、插入和替换编辑中,更强地保留了主体身份和未编辑内容。
- 更强的复杂指令遵循: 在单个请求中,对物体数量、空间关系、布局、样式和多个约束的执行更一致。
- 更精确的视觉控制: 通过边界框、视觉标记以及单图或多图参考,实现更准确的区域级和物体级控制。
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#showcases展示示例
SenseNova-U1.5 生成与编辑展示示例
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#key-benchmarks关键基准
SenseNova-U1.5 基准测试概览
查看详细基准结果SenseNova-U1.5 详细基准测试结果
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#quick-start快速开始
参考推理实现可在SenseNova-U1 GitHub 仓库 (https://github.com/OpenSenseNova/SenseNova-U1/tree/refs/heads/feat/u1.5) 中找到。
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#installation安装
git clone https://github.com/OpenSenseNova/SenseNova-U1.git cd SenseNova-U1 uv sync source .venv/bin/activate
上游环境使用 Python 3.11、PyTorch 2.8 和 CUDA 12.8。有关其他 CUDA 版本和可选的 FlashAttention 配置,请参见安装指南 (https://github.com/OpenSenseNova/SenseNova-U1/blob/refs/heads/feat/u1.5/docs/installation.md)。
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#text-to-image文本到图像
python examples/t2i/inference.py \ --model_path sensenova/SenseNova-U1.5-8B-MoT \ --prompt "A cinematic mountain lake at sunrise, realistic photography." \ --width 2048 --height 2048 \ --device_map auto \ --output output.png
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#image-editing图像编辑
python examples/editing/inference.py \ --model_path sensenova/SenseNova-U1.5-8B-MoT \ --image input.png \ --prompt "Change the jacket to cobalt blue. Preserve the face, pose, background, lighting, and framing." \ --output edited.png
更多选项、支持的分辨率和批处理请参见推理示例 (https://github.com/OpenSenseNova/SenseNova-U1/blob/refs/heads/feat/u1.5/examples/README.md)。
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#best-practices最佳实践
直接的自然语言提示适用于约束较少、任务明确的情况。对于复杂的生成或编辑,当需要额外规划时,请使用提示增强,并明确指定应保持不变的内容。
请参见 SenseNova-U1.5 使用手册 (https://github.com/OpenSenseNova/SenseNova-U1/blob/refs/heads/feat/u1.5/docs/u1.5_best_practices.md) 了解设置说明以及可选的图像 PE、标题转提示和编辑 PE 方法。
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#%F0%9F%8C%90-use-with-sensenova-studio🌐 与 SenseNova-Studio 一同使用
体验 SenseNova-U1.5 最快的方式是通过 SenseNova-Studio (https://unify.light-ai.top/)——一个 🆓 免费的在线演示平台,您可以直接在浏览器中尝试该模型,无需安装或 GPU。
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#ongoing-improvements持续改进
本次官方发布在预览版基础上进行了改进,但仍存在以下挑战:
- 过度强调的细节或颜色: 某些提示可能产生过多的高频细节或过饱和的颜色,这通常可以通过降低
cfg\_scale来缓解。 - 密集文本错误: 密集、冗长、小型或中英混合的文本可能包含错误。
- 受约束的布局: 在高度约束的布局中,精确的数量、对齐或层级可能不完美。
- 不稳定的人体细节: 小尺寸的面部、手、肢体和精细的物体结构可能仍不稳定。
- 复杂编辑漂移: 广泛的、多轮或多参考的编辑可能会发生漂移,尤其是在需要同时保留多个区域时。
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#models模型
模型阶段Hugging Face 权重SenseNova-U1.5-8B-MoT强化学习🤗 模型 (https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT)SenseNova-U1.5-8B-MoT-SFT监督微调🤗 模型 (https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT-SFT)
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#%F0%9F%8C%90-join-the-community🌐 加入社区!
加入我们不断壮大的社区,分享反馈、获取支持,并随时了解 SenseNova-U1 的最新发展——我们很乐意听取您的意见!
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#citation引用
如果这个项目对您的研究有帮助,请考虑为仓库点星并引用:
`` @misc{sensenova2026neounify, title = {NEO-unify: Building Native Multimodal Unified Models End to End}, author = {SenseNova}, journal = {Hugging Face blog}, url = {https://huggingface.co/blog/sensenova/neo-unify}, year = {2026} }
@article{sensenova2026sensenovau1, title = {SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture}, author = {Diao, Haiwen and Wu, Penghao and Deng, Hanming and Wang, Jiahao and Bai, Shihao and Wu, Silei and Fan, Weichen and Ye, Wenjie and Tong, Wenwen and Fan, Xiangyu and others}, journal = {arXiv preprint arXiv:2605.12500}, year = {2026} } ``
https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT#license许可证
本模型依据Apache 2.0 许可证 (https://github.com/OpenSenseNova/SenseNova-U1/blob/refs/heads/feat/u1.5/LICENSE) 发布。
相似文章
sensenova/SenseNova-U1-8B-MoT
SenseNova U1 是基于 NEO-Unify 框架构建的新一代原生多模态模型系列,在单一架构内统一了理解与生成能力,无需单独的视觉编码器或 VAE。
SenseNova-U1-8b-MoT-Infographic-V2(昨日发布)—— 一款开源SOTA级信息图设计与图像编辑利器
SenseNova-U1-8b-MoT-Infographic-V2 是商汤科技(SenseTime)发布的一款开源的SOTA模型,用于信息图设计和图像编辑任务。
SenseNova-U1:基于 NEO-unify 架构统一多模态理解与生成
本文介绍了 SenseNova-U1,这是一种统一的多模态架构,整合了理解与生成任务。我们发布了两个变体(8B 和 30B),在感知能力和图像合成方面均表现出竞争力的性能。
@SenseTime_AI: SenseNova-Vision-7B-MoT,完全开源:一个模型,所有主要视觉任务…
商汤科技发布了SenseNova-Vision-7B-MoT,一个完全开源的多模态统一模型,能够通过自然语言指令处理多种视觉任务,支持检测、OCR、深度估计、分割等。
SenseNova U1 推出面向信息图的微调模型
SenseNova U1 发布了其 U1-8B-MoT 基础模型的信息图专用微调版本,在信息图准确性、图表理解和文本渲染方面实现了显著的基准提升。