FLAT:将图像和文本重采样为1D柔性长度对齐的跨模态标记,用于检索与生成
摘要
FLAT是一个表示预训练框架,联合优化共享多模态编码器与下游文本到图像和图像到文本解码器,使用柔性长度对齐的1D序列,实现具有最先进结果的跨模态检索与生成。
查看缓存全文
缓存时间: 2026/09/16 18:49
论文页面 - FLAT:将图像和文本重采样为一维可变长度对齐跨模态标记,用于检索与生成
来源:https://huggingface.co/papers/2609.16591 作者:
,
,
,
,
,
,
,
,
,
摘要
传统的多模态表征学习与生成是两个阶段的过程:先训练一个对比式或自监督的视觉编码器,随后训练一个独立的下游生成模型。这种设置将生成性能瓶颈限制在冻结的嵌入表征上。为弥合这一差距,我们重新审视联合多模态表征学习与生成,以产生可被生成解码器直接使用的、支持线性插值的嵌入向量。我们提出 FLAT(Flexible-Length Aligned Transmodal representations,可变长度对齐跨模态表征),这是一种表征预训练框架,联合优化一个共享的多模态编码器以及下游的文生图(T2I)和图生文(I2T)解码器。通过结合对比对齐与双向跨模态生成目标,FLAT 确保其表征既能作为判别性的语义描述符,也能作为生成条件。在架构上,FLAT 将视觉和文本输入映射到统一的连续一维序列空间,并对前缀-K 个标记应用嵌套丢弃法,以实现动态输出长度。单一预训练阶段使得 FLAT 能够在可变前缀 K 下执行跨模态检索和生成,文生图 GenEval 得分达到 71.1。任务特定微调使模型性能与最先进基准对齐:文生图生成 GenEval 得分 83.1;在 MS-COCO 图像描述任务上 BLEU-4 得分 40.5,CIDEr 得分 138.6;在 MS-COCO 上 Recall@5 得分为 86.8(I2T)/75.8(T2T),在 Flickr30K 上为 98.3(I2T)/93.6(T2I)。最后,定性评估表明,FLAT 表征天然支持线性插值、潜在空间算术和零样本组合检索。
查看 arXiv 页面 (https://arxiv.org/abs/2609.16591) 查看 PDF (https://arxiv.org/pdf/2609.16591) 项目主页 (https://guangyusun.com/flat-website/) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.16591)
引用此论文的模型 0
没有模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.16591 以从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.16591 以从此页面链接它。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.16591 以从此页面链接它。
包含此论文的集合 0
没有集合包含此论文
将此论文添加到集合 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
Meta FLAT用于多模态理解与生成(7分钟阅读)
FLAT引入了一种共享的连续令牌序列,用于图像和文本,从而为生成和检索等多模态任务提供灵活长度的表示,并在基准测试中表现出色。
从二维网格到一维标记:改革多模态图像融合的共享表示
本文提出了一种多模态图像融合方法,该方法使用来自预训练图像标记器的一维标记接口,通过选择性标记编辑(STE)来增强全局外观一致性,同时保留局部细节。在四个基准上的实验表明,该方法在全局一致性和局部保真度方面均达到了最先进性能。
(1D) 有序词元实现高效测试时搜索
# 论文页面 - (1D) 有序词元实现高效测试时搜索 来源:[https://huggingface.co/papers/2604.15453](https://huggingface.co/papers/2604.15453) ## 摘要 具有“粗到细”词元结构的自回归模型在测试时扩展上表现更佳,并在与图文验证器结合后,实现无需训练的文本到图像生成。 [词元化](https://huggingface.co/papers?q=Tokenization) 是自回归(AR)生成模型的关键组件,将原始
AVTok: 面向整体音视频生成的一维统一标记化
AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。
通过判别式文本表征将一步图像生成从类别标签扩展到文本
研究者通过集成高判别力的大语言模型文本编码器,将 MeanFlow 一步图像生成从固定类别标签扩展到灵活文本输入,实现高效的文本条件合成并显著提升性能。