FLAT:将图像和文本重采样为1D柔性长度对齐的跨模态标记,用于检索与生成

Hugging Face Daily Papers 论文

摘要

FLAT是一个表示预训练框架,联合优化共享多模态编码器与下游文本到图像和图像到文本解码器,使用柔性长度对齐的1D序列,实现具有最先进结果的跨模态检索与生成。

传统的多模态表示学习和生成分为两个阶段:首先训练一个对比或自监督视觉编码器,然后是一个独立的下游生成模型。这种设置将生成性能限制在冻结的嵌入之后。为了弥合这一差距,我们重新审视联合多模态表示学习和生成,以产生可线性插值的嵌入,这些嵌入可直接被生成解码器使用。我们提出FLAT(Flexible-Length Aligned Transmodal representations),一个表示预训练框架,联合优化共享多模态编码器与下游文本到图像(T2I)和图像到文本(I2T)解码器。通过结合对比对齐和双向跨模态生成目标,FLAT确保其表示既可作为判别性语义描述符,也可作为生成条件。在架构上,FLAT将视觉和文本输入映射到统一的连续1D序列空间,对前缀-K标记应用嵌套丢弃以实现动态输出长度。单一预训练阶段使FLAT能够在可变前缀K下执行跨模态检索和生成,T2I GenEval得分为71.1。任务特定微调使模型性能与最先进基线对齐:T2I生成的GenEval为83.1;MS-COCO图像描述的BLEU-4为40.5,CIDEr为138.6;以及在MS-COCO上的Recall@5分数为86.8(I2T)/ 75.8(T2I),在Flickr30K上为98.3(I2T)/ 93.6(T2I)。最后,定性评估表明FLAT表示原生支持线性插值、潜空间算术和零样本组合检索。
查看原文
查看缓存全文

缓存时间: 2026/09/16 18:49

论文页面 - FLAT:将图像和文本重采样为一维可变长度对齐跨模态标记,用于检索与生成

来源:https://huggingface.co/papers/2609.16591 作者:

,

,

,

,

,

,

,

,

,

摘要

传统的多模态表征学习与生成是两个阶段的过程:先训练一个对比式或自监督的视觉编码器,随后训练一个独立的下游生成模型。这种设置将生成性能瓶颈限制在冻结的嵌入表征上。为弥合这一差距,我们重新审视联合多模态表征学习与生成,以产生可被生成解码器直接使用的、支持线性插值的嵌入向量。我们提出 FLAT(Flexible-Length Aligned Transmodal representations,可变长度对齐跨模态表征),这是一种表征预训练框架,联合优化一个共享的多模态编码器以及下游的文生图(T2I)和图生文(I2T)解码器。通过结合对比对齐与双向跨模态生成目标,FLAT 确保其表征既能作为判别性的语义描述符,也能作为生成条件。在架构上,FLAT 将视觉和文本输入映射到统一的连续一维序列空间,并对前缀-K 个标记应用嵌套丢弃法,以实现动态输出长度。单一预训练阶段使得 FLAT 能够在可变前缀 K 下执行跨模态检索和生成,文生图 GenEval 得分达到 71.1。任务特定微调使模型性能与最先进基准对齐:文生图生成 GenEval 得分 83.1;在 MS-COCO 图像描述任务上 BLEU-4 得分 40.5,CIDEr 得分 138.6;在 MS-COCO 上 Recall@5 得分为 86.8(I2T)/75.8(T2T),在 Flickr30K 上为 98.3(I2T)/93.6(T2I)。最后,定性评估表明,FLAT 表征天然支持线性插值、潜在空间算术和零样本组合检索。

查看 arXiv 页面 (https://arxiv.org/abs/2609.16591) 查看 PDF (https://arxiv.org/pdf/2609.16591) 项目主页 (https://guangyusun.com/flat-website/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.16591)

引用此论文的模型 0

没有模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.16591 以从此页面链接它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.16591 以从此页面链接它。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.16591 以从此页面链接它。

包含此论文的集合 0

没有集合包含此论文

将此论文添加到集合 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

从二维网格到一维标记:改革多模态图像融合的共享表示

Hugging Face Daily Papers

本文提出了一种多模态图像融合方法,该方法使用来自预训练图像标记器的一维标记接口,通过选择性标记编辑(STE)来增强全局外观一致性,同时保留局部细节。在四个基准上的实验表明,该方法在全局一致性和局部保真度方面均达到了最先进性能。

(1D) 有序词元实现高效测试时搜索

Hugging Face Daily Papers

# 论文页面 - (1D) 有序词元实现高效测试时搜索 来源:[https://huggingface.co/papers/2604.15453](https://huggingface.co/papers/2604.15453) ## 摘要 具有“粗到细”词元结构的自回归模型在测试时扩展上表现更佳,并在与图文验证器结合后,实现无需训练的文本到图像生成。 [词元化](https://huggingface.co/papers?q=Tokenization) 是自回归(AR)生成模型的关键组件,将原始

AVTok: 面向整体音视频生成的一维统一标记化

Hugging Face Daily Papers

AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。