SenseNova U1.5-Lite 全面发布:专家训练、OPD蒸馏、推理统一模型

Reddit r/LocalLLaMA 模型

摘要

SenseNova U1.5-Lite 已发布,具备专家训练和OPD蒸馏功能,创建统一模型用于推理,改进了指令跟随和图像生成能力。

基准测试:Benchmark U1 Preview Full Qwen-Image-Bench 47.14 55.20 (PE) 60.18 (PE) ImgEdit 3.9 4.37 4.59 GEdit-Bench-EN 7.47 8.14 8.26 他们并非仅仅扩大规模,而是为文本渲染和信息图表、美学质量以及图像编辑训练了任务专门化的专家模型。然后OPD将这些专家整合回U1.5-Lite。在推理时,您得到一个模型。没有路由器,没有专家切换,没有手动选择。他们使用的口号是:训练专门化,交付统一化。后训练现在包括面向任务的强化学习,具有三个用户可见的目标:指令遵循、视觉质量和偏好对齐,以及编辑保真度和未触及区域的保留。改进之处:复杂指令跟随。单个请求中的多个约束(主体、计数、空间关系、文本、布局、样式、保留要求)处理得更一致。文本渲染和密集布局。海报和信息图表中的中文和英文。原生4K生成,具有稳定的全局结构。原生编辑,更好地保留主体身份、几何形状和未编辑区域。多参考编辑和精确局部编辑。视觉理解增强生成。从理解任务中学到的表示(对象关系、空间结构、布局、信息层次)转移到生成和编辑。JSON结构化监督用作可控性的训练机制,而非强制性的用户面向格式。自然语言仍然是默认接口。链接:GitHub:https://github.com/OpenSenseNova/SenseNova-U1 HuggingFace:https://huggingface.co/sensenova/SenseNova-U1.5-8B-MoT
查看原文

相似文章

SenseNova U1.5 Lite 预览版发布

Reddit r/LocalLLaMA

SenseNova 发布了 U1.5 Lite 模型的预览版,基准测试显示其在图像生成和编辑方面有所提升,支持原生 4K 输出,中文和英文文本渲染得到改进,但已知的弱点仍然存在。

sensenova/SenseNova-U1.5-8B-MoT

Hugging Face Models Trending

SenseNova-U1.5-8B-MoT 是一款用于增强视觉创作的原生统一多模态模型,在图像生成质量、文本渲染和精确控制方面有所改进。