IDEAL:深度对齐实现离散表示自编码器

Hugging Face Daily Papers 论文

摘要

IDEAL提出了一种用于离散表示自编码的深度对齐框架,联合对齐量化令牌与浅层和深层VFM特征,以实现卓越的重建和生成性能。

基于预训练视觉基础模型(VFM),表示自编码器(RAE)最近作为一种构建图像生成的语义丰富潜在空间的有前景方法出现。然而,它们的重建质量通常仍不理想,主要因为深层VFM表示未能保留足够的细粒度视觉细节。这种限制在离散化后变得更加严重,因为缺失的低层信息难以恢复。事实上,我们观察到浅层VFM特征保留了更丰富的局部外观和结构细节,这补充了现有RAE中使用的深层特征所携带的高层语义。受这种互补性的启发,我们提出了Ideal,一种用于离散表示自编码的深度对齐框架。通过联合对齐量化令牌与浅层和深层VFM特征,Ideal使生成的离散视觉令牌同时保留视觉保真度和丰富语义。大量实验表明,Ideal实现了优越的重建性能,在ImageNet上达到0.61 rFID,比之前的最佳方法提升了0.28。当用于自回归图像生成时,Ideal进一步实现了1.89的gFID,为自回归图像生成建立了新的最先进水平。
查看原文
查看缓存全文

缓存时间: 2026/06/12 06:50

论文页面 — IDEAL: 深度对齐使得离散表示自编码器更优

来源:https://huggingface.co/papers/2606.11096

摘要

基于深度学习框架的表示自编码器通过结合浅层与深层视觉特征表示,能够提升图像重建质量,实现更丰富的语义信息与更高的视觉保真度。

近年来,构建于预训练视觉基础模型 (https://huggingface.co/papers?q=vision%20foundation%20models)(VFMs)之上的表示自编码器 (https://huggingface.co/papers?q=representation%20autoencoders)(RAEs)已成为一种有前景的图像生成语义丰富潜在空间构建方法。然而,其重建质量往往不够理想,主要原因在于深度VFM表示未能保留足够精细的视觉细节。这一问题在离散化后更为严重,缺失的低层信息难以恢复。事实上,我们观察到浅层VFM特征保留了更为丰富的局部外观与结构细节,这与现有RAEs所用深层特征所携带的高级语义形成互补。受这一互补特性的启发,我们提出了Ideal——一种面向离散表示自编码 (https://huggingface.co/papers?q=discrete%20representation%20autoencoding) 的深度对齐框架。通过联合对齐量化令牌 (https://huggingface.co/papers?q=quantized%20tokens) 与浅层及深层VFM特征,Ideal使得生成的离散视觉令牌能够同时保留视觉保真度 (https://huggingface.co/papers?q=visual%20fidelity) 和丰富的语义信息。大量实验表明,Ideal实现了优越的重建性能,在ImageNet上达到0.61 rFID (https://huggingface.co/papers?q=rFID),较之前最优方法提升了0.28。当用于自回归图像生成 (https://huggingface.co/papers?q=autoregressive%20image%20generation) 时,Ideal进一步取得了1.89的gFID (https://huggingface.co/papers?q=gFID),为自回归图像生成 (https://huggingface.co/papers?q=autoregressive%20image%20generation) 树立了新的最优水平。

查看 arXiv 页面 (https://arxiv.org/abs/2606.11096) 查看 PDF (https://arxiv.org/pdf/2606.11096) GitHub (https://github.com/Row11n/IDEAL) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11096)

在您的智能体中获取本文:

hf papers read 2606.11096

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型0

暂无模型关联本文

请在模型 README.md 中引用 arxiv.org/abs/2606.11096 以在本页面建立链接。

引用本文的数据集0

暂无数据集关联本文

请在数据集 README.md 中引用 arxiv.org/abs/2606.11096 以在本页面建立链接。

引用本文的空间0

暂无空间关联本文

请在空间 README.md 中引用 arxiv.org/abs/2606.11096 以在本页面建立链接。

包含本文的收藏集0

暂无收藏集包含本文

请将本文添加至收藏集 (https://huggingface.co/new-collection) 以在本页面建立链接。

相似文章

先连续后离散:解决维度坍塌问题的VQ-VAE

arXiv cs.LG

本文探讨了VQ-VAE中常见的维度坍塌问题,指出模型表示通常局限于低维子空间。研究提出了一种“自编码器预热(AE Warm-Up)”策略,即首先将模型作为未量化的自编码器进行训练,从而提升重建质量并增加潜在空间的有效维度。

ViQ:任意分辨率下的文本对齐视觉量化表示

Hugging Face Daily Papers

ViQ提出了一种视觉量化框架,在离散表示中平衡了语义丰富性和细节保留,通过文本对齐预训练和邻近表示学习,支持原生分辨率输入,实现高效的多模态训练。

更深并不总是更好:通过置信层解码缓解对齐损失

Hugging Face Daily Papers

本文介绍了一种无需训练的编码策略——Confident Decoding,它利用熵引导搜索动态选择LLM中最可靠的中间层,从而缓解对齐损失,并在GPQA-Diamond、Omni-MATH等基准测试中提升了推理性能,且开销可忽略不计。