Meta FLAT用于多模态理解与生成(7分钟阅读)

TLDR AI 论文

摘要

FLAT引入了一种共享的连续令牌序列,用于图像和文本,从而为生成和检索等多模态任务提供灵活长度的表示,并在基准测试中表现出色。

Meta AI推出了FLAT,这是一种将图像和文本转换为相同的灵活长度连续令牌序列的方法,用于检索和生成。嵌套丢弃从粗到细组织信息,使模型可以通过改变使用的令牌数量来权衡计算与视觉细节。
查看原文
查看缓存全文

缓存时间: 2026/09/17 14:32

# FLAT — 灵活长度对齐跨模态令牌 来源:https://guangyusun.com/flat-website/ FLAT 使用一条共享的灵活长度序列表示图像与文本。**一种表征,多种能力。** FLAT 将图像和文本映射为同一系列连续令牌。任意前缀均可作为检索嵌入,或用于引导双向生成。 ## 摘要 现代多模态系统通常为理解和生成维护独立的表征。而 **FLAT** 则将图像或文本重采样为相同的单维连续令牌序列,联合训练实现跨模态对齐、图像合成与描述生成。 嵌套丢弃机制以从粗到细的方式组织信息。推理时,选取长度为 *K* 的前缀可直接权衡计算成本与细节程度:首个令牌已捕获全局语义,而更长的前缀则能恢复结构与细粒度属性。 **83.1** GenEval **138.6** COCO CIDEr **86.8 / 75.8** COCO I2T / T2I R@5 **98.3 / 93.6** Flickr I2T / T2I R@5 **81.8** ImageNet 线性探针 架构 ## 共享的有序令牌空间 单一视觉语言模型编码器可为任一模态生成最多 256 个 64 维的连续注册令牌。 FLAT 架构包含共享编码器、注册令牌及三项训练目标。 共享编码器将图像和标题重采样为对齐的注册令牌。对比对齐与双向生成共同塑造潜在空间;嵌套丢弃训练每个前缀均保持有效性。 交互式静态演示 ## 一个前缀,两种解码视图 移动滑块以调整激活的 FLAT 令牌数量,然后比较同一有序表征如何支持生成、描述、插值与算术运算。 激活前缀长度 K = 1 · 64 维度 正在加载预计算输出... 正在加载预计算输出... 生成 ## 从任意前缀进行由粗到细的解码 增加 *K* 可在不切换表征或模型的情况下增加构图细节。 文本到图像合成在 K 等于 1、4、16、64 和 256 时的效果。 **文本到图像合成。** 短前缀确立主要概念;长前缀解决计数、空间关系与属性问题。任务适配模型达到 **83.1 GenEval**。### 图像描述 相同的视觉序列可作为自回归语言解码器的条件。描述质量随 K 从 1 平滑提升至 256,在 COCO 上达到 40.5 BLEU-4 和 138.6 CIDEr。 不同灵活前缀长度下的图像描述示例。 附加的注册令牌细化描述,同时保留由最早令牌捕获的主要视觉语义。 ### 复杂文本到图像示例 FLAT 生成的复杂文本到图像示例。 定性生成涵盖详细场景、风格化构图、肖像及超出诊断性 GenEval 提示的非常规概念。 检索 ## 单个令牌已具竞争力 检索性能在表征宽度 256 倍范围内几乎保持不变。 COCO 检索召回率在激活维度上与自适应宽度基线的比较。 COCO R@5 与激活维度的关系。每个 FLAT 令牌贡献 64 维度。数据集 / KI→T R@1I→T R@5T→I R@1T→I R@5COCO / 163.0086.4447.7675.59COCO / 256**63.54****86.82****47.98****75.83**Flickr / 190.5098.1076.9493.52Flickr / 4**91.20****98.30****77.40**93.58 在所有报告的召回指标中,从 **K=1** 到 **K=256** 的变化使 COCO 性能波动小于一个点。 图像到文本检索示例。 **图像到文本检索。** 绿色文本标记匹配的标题及其检索排名。文本到图像检索示例。 **文本到图像检索。** 即使目标未排在首位,检索到的邻近项在语义上仍保持接近。 表征分析 ## 具有语义结构的对齐几何 FLAT 的连续令牌同时具备跨模态性、判别力与可解码性。 匹配图像和文本表征的 PCA 分布。 **弥合模态鸿沟。** 单个 FLAT 令牌将 CLIP 的图像-文本质心距离减半;完整序列则将其减少至约四分之一。单个 FLAT 令牌的无监督聚类。 **无监督结构。** 对冻结的 64 维 K=1 令牌进行 *k*-means 聚类,可恢复视觉上连贯的 ImageNet 类别。### 线性探针 在冻结的 FLAT 特征上训练线性分类器,使用一个 64 维令牌在 ImageNet-1K 上达到 **73.3%** top-1 准确率,16 个令牌达到 **81.2%**,64 个令牌达到 **81.8%**。K维度Top-116473.3425677.0161,02481.2644,096**81.8**25616,384**81.8** ### 连续潜在操作 由于图像和文本共享可解码空间,简单的向量运算即可产生可解释的语义过渡。 图像与文本概念间的连续跨模态插值。 **插值。** 图像和文本解码器沿相同的潜在轨迹追踪相应的中间概念。灯塔与满月令牌算术组合。 **语义算术。** 逐令牌组合将满月的语义添加到灯塔场景中;更大的前缀保留越来越精细的结构。 超越配对图像-英文训练 ## 零样本迁移 共享的 VLM 编码器展现了训练混合中未被显式监督的能力。 ### 多语言与符号输入 由 FLAT 解码的多语言和表情符号提示。 语义等同的英文、中文和西班牙文提示生成一致的图像。表情符号概念也可通过共享潜在空间进行路由。 ### 多帧视频语义 四帧采样可联合编码为一个注册序列。解码结果融合分布在片段中的概念,而非选择单一关键帧。 从视频片段多帧产生的零样本描述。 **视频到文本。** 描述解码器总结采样帧中的物体、场景与动作。从联合多帧视频表征解码的图像。 **视频到图像。** 生成的图像结合了多帧中的持续物体与场景上下文。 ### 组合图像检索 在 CIRR 上的零样本组合图像检索。 参考图像与文本编辑嵌入直接在潜在空间中组合。在 K=1 时,FLAT 达到 44.0 Hit@1 和 75.2 Hit@5。### 泛化至未见长度 在训练过与未见过的前缀长度上进行生成。 尽管训练样本使用四次幂的前缀长度,但有序表征在未见过的 *K* 值上仍能平滑解码。 ## BibTeX `` @misc{sun2026flat, title = {FLAT: Resampling Image and Text into 1D Flexible-Length Aligned Transmodal Tokens for Retrieval and Generation}, author = {Sun, Guangyu and Mishra, Shlok Kumar and Bao, Wentao and Yang, Robert Zhenheng and Wang, Xiao and Wang, Xiyuan and Ma, Yujunrong and Yuan, Chen and Fan, Max Xiangjun and Xiao, Jun and Cheng, Jianpeng}, year = {2026}, eprint = {2609.16591}, archivePrefix = {arXiv}, primaryClass = {cs.CV}, url = {https://arxiv.org/abs/2609.16591} } ``

相似文章