标签
SenseNova-U1.5是一个8B原生统一多模态模型,它通过补丁重建、精选数据和专家优化,在无需编码器或VAE的情况下执行视觉理解、推理和生成,实现高保真度和指令遵循。
快手研究者提出UniGD,一个用于工业检索的统一生成-判别框架,将检索与相关性评分整合到单一模型中,并采用CAGE与CAM等技术来提升效果并降低延迟。在线A/B测试显示,广告收入提升5.78%,推理延迟降低33.1%。
Hunyuan3D-Buffalo 1.0 是一个用于3D生成、理解与编辑的统一多模态模型,基于87M规模的3D多模态语料库进行训练。它结合了Hunyuan3D-VLM和Hunyuan3D-DiT,在文本到3D生成和3D编辑基准上取得了最先进的性能。
本文介绍了SwanTale,一个支持零样本和指令任务的统一多说话人语音与音频生成模型,以及用于数据标注的SwanData-Caption和用于高质量多音频模态生成的SwanVAE。
S1-Omni是一个用于科学任务(包括理解、预测和生成)的统一多模态推理模型。它基于包含200个科学任务的语料库进行训练,在大多数基准测试上优于GPT-5.5和Gemini-3.1-Pro。
UniVR提出了VR-GRPO,一种用于统一视觉推理的强化学习范式,能够从纯视觉演示中学习复杂推理和物理动力学,在VR-X基准测试上实现了高达25%的性能提升。
BRAID是一个框架,它将交错文本-图像-文本推理形式化为统一的马尔可夫决策过程,通过强化学习实现文本和视觉生成的联合优化,并由VLM裁判提供密集的轮次级反馈。
本文介绍 SenseNova-Vision,一个统一的多模态模型,将计算机视觉任务表述为生成问题,在多种视觉任务上实现了与专用系统相当的性能。它引入了一个大规模指令-响应语料库,并公开发布模型和数据集。
这篇论文介绍了Audex,这是NVIDIA推出的统一音频-文本大语言模型,在多种音频和语音任务上实现了最先进的性能,同时保持了强大的文本推理能力,且没有出现退化。
Boogu-Image-0.1 是一个全新的统一图像生成与编辑模型家族,拥有10B参数,采用 Apache 2.0 许可证。它支持快速 Turbo 推理(仅需4步),在10倍更少的数据上训练,并支持中文和英文。
ILLUME-X 是一个统一的自由形式交错图文生成多模态模型,具有改进的数据效率、稳定的训练以及名为 ILScore 的全面评估指标。它在风格迁移、图像分解和故事讲述等任务上优于之前的模型。
Boogu 发布了一系列开源统一图像生成与编辑模型,包括 Base、Turbo 和 Edit 变体。
UniDDT提出了一种解耦扩散变换器框架,通过利用Noisy ViT编码器和LLM进行语义编码,统一了多模态理解与生成,在两个任务上均取得了强劲性能。
本文介绍了Audio-Interaction,一种统一的流式音频模型,通过端到端框架将离线任务执行与实时音频指令跟随相结合。它提出了用于感知-决策-响应循环的SoundFlow,并在多个基准测试中评估了其具有竞争力的性能。
介绍了 Representation Forcing(RF),一种技术,使得统一多模态模型能够在没有外部VAE潜在空间的情况下端到端地执行感知和生成,在图像生成方面达到最先进的基于VAE的模型水平,同时提升理解能力。
Lumos-Nexus 是一个训练高效的视频生成框架,采用两阶段设计:训练时使用轻量级生成器,推理时使用高容量预训练生成器,通过统一渐进频率桥接实现增强的视觉保真度。
提出了一种统一神经缩放定律,能够精确建模深度神经网络在多个维度(包括参数量、数据集大小、训练步数和计算量)上的缩放行为,并在多种架构和任务上得到验证。
UniT是一种统一的几何感知前馈模型,采用分组自回归Transformer,集成了多种范式(在线/离线、多模态、长时域),同时通过自适应尺度损失和队列式KV缓存保持度量尺度精度。它在涵盖七个任务的十个基准上取得了最先进性能。
Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。
Lance 是一个统一多模态模型,采用双流混合专家架构和协作式多任务训练,在图像和视频的理解、生成及编辑方面均表现出色,超越了现有的开源统一模型。