unified-model

标签

Cards List
#unified-model

SenseNova-U1.5: 迈向原生统一视觉智能

Hugging Face Daily Papers ↗ · 2026-09-10 缓存

SenseNova-U1.5是一个8B原生统一多模态模型,它通过补丁重建、精选数据和专家优化,在无需编码器或VAE的情况下执行视觉理解、推理和生成,实现高保真度和指令遵循。

0 人收藏 0 人点赞
#unified-model

UniGD:一种用于工业检索的统一生成-判别框架

arXiv cs.AI ↗ · 2026-08-05 缓存

快手研究者提出UniGD,一个用于工业检索的统一生成-判别框架,将检索与相关性评分整合到单一模型中,并采用CAGE与CAM等技术来提升效果并降低延迟。在线A/B测试显示,广告收入提升5.78%,推理延迟降低33.1%。

0 人收藏 0 人点赞
#unified-model

Hunyuan3D-Buffalo 1.0:面向可扩展3D生成、理解与编辑的统一多模态模型

Hugging Face Daily Papers ↗ · 2026-08-03 缓存

Hunyuan3D-Buffalo 1.0 是一个用于3D生成、理解与编辑的统一多模态模型,基于87M规模的3D多模态语料库进行训练。它结合了Hunyuan3D-VLM和Hunyuan3D-DiT,在文本到3D生成和3D编辑基准上取得了最先进的性能。

0 人收藏 0 人点赞
#unified-model

SwanTale:面向指令和零样本任务的统一多说话人语音与音频生成

Hugging Face Daily Papers ↗ · 2026-08-03 缓存

本文介绍了SwanTale,一个支持零样本和指令任务的统一多说话人语音与音频生成模型,以及用于数据标注的SwanData-Caption和用于高质量多音频模态生成的SwanVAE。

0 人收藏 0 人点赞
#unified-model

S1-Omni:用于科学理解、预测和生成的统一多模态推理模型

arXiv cs.AI ↗ · 2026-07-20 缓存

S1-Omni是一个用于科学任务(包括理解、预测和生成)的统一多模态推理模型。它基于包含200个科学任务的语料库进行训练,在大多数基准测试上优于GPT-5.5和Gemini-3.1-Pro。

0 人收藏 0 人点赞
#unified-model

UniVR:在视觉空间中思考以实现统一视觉推理

Hugging Face Daily Papers ↗ · 2026-07-14 缓存

UniVR提出了VR-GRPO,一种用于统一视觉推理的强化学习范式,能够从纯视觉演示中学习复杂推理和物理动力学,在VR-X基准测试上实现了高达25%的性能提升。

0 人收藏 0 人点赞
#unified-model

将交错多模态推理桥接为统一决策过程

arXiv cs.AI ↗ · 2026-07-07 缓存

BRAID是一个框架,它将交错文本-图像-文本推理形式化为统一的马尔可夫决策过程,通过强化学习实现文本和视觉生成的联合优化,并由VLM裁判提供密集的轮次级反馈。

0 人收藏 0 人点赞
#unified-model

视觉作为统一多模态生成

Hugging Face Daily Papers ↗ · 2026-07-07 缓存

本文介绍 SenseNova-Vision,一个统一的多模态模型,将计算机视觉任务表述为生成问题,在多种视觉任务上实现了与专用系统相当的性能。它引入了一个大规模指令-响应语料库,并公开发布模型和数据集。

0 人收藏 0 人点赞
#unified-model

统一音频智能,且不牺牲文本智能

Hugging Face Daily Papers ↗ · 2026-07-06 缓存

这篇论文介绍了Audex,这是NVIDIA推出的统一音频-文本大语言模型,在多种音频和语音任务上实现了最先进的性能,同时保持了强大的文本推理能力,且没有出现退化。

0 人收藏 0 人点赞
#unified-model

@AdinaYakup: Boogu-Image-0.1 全新统一图像生成与编辑模型家族 - 10B Base/Edit/Turbo - Apache 2.0 - 快速 Turbo 推理…

X AI KOLs Following ↗ · 2026-07-03 缓存

Boogu-Image-0.1 是一个全新的统一图像生成与编辑模型家族,拥有10B参数,采用 Apache 2.0 许可证。它支持快速 Turbo 推理(仅需4步),在10倍更少的数据上训练,并支持中文和英文。

0 人收藏 0 人点赞
#unified-model

照亮统一多模态模型,实现自由形式交错图文生成

Hugging Face Daily Papers ↗ · 2026-06-29 缓存

ILLUME-X 是一个统一的自由形式交错图文生成多模态模型,具有改进的数据效率、稳定的训练以及名为 ILScore 的全面评估指标。它在风格迁移、图像分解和故事讲述等任务上优于之前的模型。

0 人收藏 0 人点赞
#unified-model

Boogu Base、Turbo、Edit —— 开源统一图像生成与编辑模型系列

Reddit r/LocalLLaMA ↗ · 2026-06-23

Boogu 发布了一系列开源统一图像生成与编辑模型,包括 Base、Turbo 和 Edit 变体。

0 人收藏 0 人点赞
#unified-model

UniDDT: 通过解耦扩散变换器统一多模态理解与生成

Hugging Face Daily Papers ↗ · 2026-06-15 缓存

UniDDT提出了一种解耦扩散变换器框架,通过利用Noisy ViT编码器和LLM进行语义编码,统一了多模态理解与生成,在两个任务上均取得了强劲性能。

0 人收藏 0 人点赞
#unified-model

音频交互模型

Hugging Face Daily Papers ↗ · 2026-06-03 缓存

本文介绍了Audio-Interaction,一种统一的流式音频模型,通过端到端框架将离线任务执行与实时音频指令跟随相结合。它提出了用于感知-决策-响应循环的SoundFlow,并在多个基准测试中评估了其具有竞争力的性能。

0 人收藏 0 人点赞
#unified-model

无瓶颈统一多模态模型的 Representation Forcing

Hugging Face Daily Papers ↗ · 2026-05-29 缓存

介绍了 Representation Forcing(RF),一种技术,使得统一多模态模型能够在没有外部VAE潜在空间的情况下端到端地执行感知和生成,在图像生成方面达到最先进的基于VAE的模型水平,同时提升理解能力。

0 人收藏 0 人点赞
#unified-model

Lumos-Nexus:利用同质潜在空间实现高效频率桥接的视频统一模型

Hugging Face Daily Papers ↗ · 2026-05-29 缓存

Lumos-Nexus 是一个训练高效的视频生成框架,采用两阶段设计:训练时使用轻量级生成器,推理时使用高容量预训练生成器,通过统一渐进频率桥接实现增强的视觉保真度。

0 人收藏 0 人点赞
#unified-model

统一神经缩放定律

Hugging Face Daily Papers ↗ · 2026-05-25 缓存

提出了一种统一神经缩放定律,能够精确建模深度神经网络在多个维度(包括参数量、数据集大小、训练步数和计算量)上的缩放行为,并在多种架构和任务上得到验证。

0 人收藏 0 人点赞
#unified-model

UniT:基于分组自回归Transformer的统一几何学习

Hugging Face Daily Papers ↗ · 2026-05-20 缓存

UniT是一种统一的几何感知前馈模型,采用分组自回归Transformer,集成了多种范式(在线/离线、多模态、长时域),同时通过自适应尺度损失和队列式KV缓存保持度量尺度精度。它在涵盖七个任务的十个基准上取得了最先进性能。

0 人收藏 0 人点赞
#unified-model

Uni-Edit:智能编辑是统一模型调优的通用任务

Hugging Face Daily Papers ↗ · 2026-05-20 缓存

Uni-Edit提出使用智能图像编辑作为单一通用任务,以同时提升统一多模态模型的理解、生成和编辑能力,并配备自动化数据合成流程生成复杂的编辑指令。

0 人收藏 0 人点赞
#unified-model

Lance:通过多任务协同实现统一多模态建模

Hugging Face Daily Papers ↗ · 2026-05-18 缓存

Lance 是一个统一多模态模型,采用双流混合专家架构和协作式多任务训练,在图像和视频的理解、生成及编辑方面均表现出色,超越了现有的开源统一模型。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈