Tuna-2: 像素嵌入超越视觉编码器,实现多模态理解与生成
摘要
Tuna-2 是一个统一的多模态模型,通过直接从像素嵌入处理视觉理解与生成任务,无需预训练视觉编码器,达到了最先进的性能水平。
查看缓存全文
缓存时间: 2026/05/08 09:00
论文页面 - Tuna-2:像素嵌入在多模态理解与生成中超越视觉编码器
来源:https://huggingface.co/papers/2604.24763 发布日期:4月27日
#3 今日论文 (https://huggingface.co/papers/date/2026-04-28) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Tuna-2 是一个统一的多模态模型,它直接基于像素嵌入进行视觉理解和生成,无需预训练的视觉编码器,在多模态基准测试中达到了最先进的性能。
统一多模态模型 (https://huggingface.co/papers?q=multimodal%20models) 通常依赖预训练的视觉编码器 (https://huggingface.co/papers?q=vision%20encoders),并为理解和生成任务使用独立的视觉表征 (https://huggingface.co/papers?q=visual%20representations),这导致两个任务之间出现错位,并阻碍了从原始像素进行完全端到端优化 (https://huggingface.co/papers?q=end-to-end%20optimization)。我们提出了 Tuna-2,一个原生统一的多模态模型,它直接基于像素嵌入 (https://huggingface.co/papers?q=pixel%20embeddings) 进行视觉理解和生成。Tuna-2 通过采用简单的 patch 嵌入层 (https://huggingface.co/papers?q=patch%20embedding%20layers) 对视觉输入进行编码,极大地简化了模型架构,完全摒弃了 VAE (https://huggingface.co/papers?q=VAE) 或表征编码器 (https://huggingface.co/papers?q=representation%20encoder) 等模块化视觉编码器设计。实验表明,Tuna-2 在多模态基准测试中达到了最先进的性能,证明了统一的像素空间建模 (https://huggingface.co/papers?q=pixel-space%20modelling) 完全可以与隐空间方法 (https://huggingface.co/papers?q=latent-space%20approaches) 竞争,实现高质量的图像生成。此外,虽然基于编码器的变体在早期预训练时收敛更快,但 Tuna-2 的无编码器设计在大规模下实现了更强的多模态理解能力,特别是在需要细粒度视觉感知 (https://huggingface.co/papers?q=visual%20perception) 的任务上。这些结果表明,预训练的视觉编码器 (https://huggingface.co/papers?q=vision%20encoders) 对于多模态建模并非必需,端到端的像素空间学习为生成和感知任务提供了通向更强视觉表征 (https://huggingface.co/papers?q=visual%20representations) 的可扩展路径。
查看 arXiv 页面 (https://arxiv.org/abs/2604.24763)查看 PDF (https://arxiv.org/pdf/2604.24763)项目页面 (https://tuna-ai.org/tuna-2/)GitHub594 (https://github.com/facebookresearch/tuna-2)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.24763)
在你的 agent 中获取这篇论文:
hf papers read 2604.24763
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型0
暂无模型引用该论文
在模型 README.md 中引用 arxiv.org/abs/2604.24763 即可从该页面链接。
引用该论文的数据集0
暂无数据集引用该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.24763 即可从该页面链接。
引用该论文的 Spaces0
暂无 Space 引用该论文
在 Space README.md 中引用 arxiv.org/abs/2604.24763 即可从该页面链接。
包含该论文的收藏7
浏览包含该论文的 7 个收藏 (https://huggingface.co/collections?paper=2604.24763)
相似文章
UniDDT: 通过解耦扩散变换器统一多模态理解与生成
UniDDT提出了一种解耦扩散变换器框架,通过利用Noisy ViT编码器和LLM进行语义编码,统一了多模态理解与生成,在两个任务上均取得了强劲性能。
通过理解监督引导统一多模态模型中的视觉生成
本文介绍了 UNO,这是一种以理解为导向的后训练框架,利用理解任务作为监督信号,以增强统一多模态模型中的图像生成和编辑能力。
统一多模态模型的语义生成微调
介绍了语义生成微调(SGT),一种利用图像分割作为生成代理来对齐统一多模态模型中的视觉理解和生成任务的范式,从而提升理解能力和生成保真度。
视觉作为统一多模态生成
本文介绍 SenseNova-Vision,一个统一的多模态模型,将计算机视觉任务表述为生成问题,在多种视觉任务上实现了与专用系统相当的性能。它引入了一个大规模指令-响应语料库,并公开发布模型和数据集。
统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键
UniAR提出了一个统一的自回归框架,使用单个离散视觉分词器桥接视觉理解与生成,在图像生成和编辑方面取得了最佳成果。