IDEAL:深度对齐实现离散表示自编码器
摘要
IDEAL提出了一种用于离散表示自编码的深度对齐框架,联合对齐量化令牌与浅层和深层VFM特征,以实现卓越的重建和生成性能。
查看缓存全文
缓存时间: 2026/06/12 06:50
论文页面 — IDEAL: 深度对齐使得离散表示自编码器更优
来源:https://huggingface.co/papers/2606.11096
摘要
基于深度学习框架的表示自编码器通过结合浅层与深层视觉特征表示,能够提升图像重建质量,实现更丰富的语义信息与更高的视觉保真度。
近年来,构建于预训练视觉基础模型 (https://huggingface.co/papers?q=vision%20foundation%20models)(VFMs)之上的表示自编码器 (https://huggingface.co/papers?q=representation%20autoencoders)(RAEs)已成为一种有前景的图像生成语义丰富潜在空间构建方法。然而,其重建质量往往不够理想,主要原因在于深度VFM表示未能保留足够精细的视觉细节。这一问题在离散化后更为严重,缺失的低层信息难以恢复。事实上,我们观察到浅层VFM特征保留了更为丰富的局部外观与结构细节,这与现有RAEs所用深层特征所携带的高级语义形成互补。受这一互补特性的启发,我们提出了Ideal——一种面向离散表示自编码 (https://huggingface.co/papers?q=discrete%20representation%20autoencoding) 的深度对齐框架。通过联合对齐量化令牌 (https://huggingface.co/papers?q=quantized%20tokens) 与浅层及深层VFM特征,Ideal使得生成的离散视觉令牌能够同时保留视觉保真度 (https://huggingface.co/papers?q=visual%20fidelity) 和丰富的语义信息。大量实验表明,Ideal实现了优越的重建性能,在ImageNet上达到0.61 rFID (https://huggingface.co/papers?q=rFID),较之前最优方法提升了0.28。当用于自回归图像生成 (https://huggingface.co/papers?q=autoregressive%20image%20generation) 时,Ideal进一步取得了1.89的gFID (https://huggingface.co/papers?q=gFID),为自回归图像生成 (https://huggingface.co/papers?q=autoregressive%20image%20generation) 树立了新的最优水平。
查看 arXiv 页面 (https://arxiv.org/abs/2606.11096) 查看 PDF (https://arxiv.org/pdf/2606.11096) GitHub (https://github.com/Row11n/IDEAL) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.11096)
在您的智能体中获取本文:
hf papers read 2606.11096
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型0
暂无模型关联本文
请在模型 README.md 中引用 arxiv.org/abs/2606.11096 以在本页面建立链接。
引用本文的数据集0
暂无数据集关联本文
请在数据集 README.md 中引用 arxiv.org/abs/2606.11096 以在本页面建立链接。
引用本文的空间0
暂无空间关联本文
请在空间 README.md 中引用 arxiv.org/abs/2606.11096 以在本页面建立链接。
包含本文的收藏集0
暂无收藏集包含本文
请将本文添加至收藏集 (https://huggingface.co/new-collection) 以在本页面建立链接。
相似文章
DecQ: 用于表示自编码器中增强重建与生成的细节凝缩查询
DecQ引入了轻量级的细节凝缩查询,以改进表示自编码器中的重建与生成,同时不破坏预训练的语义空间。
先连续后离散:解决维度坍塌问题的VQ-VAE
本文探讨了VQ-VAE中常见的维度坍塌问题,指出模型表示通常局限于低维子空间。研究提出了一种“自编码器预热(AE Warm-Up)”策略,即首先将模型作为未量化的自编码器进行训练,从而提升重建质量并增加潜在空间的有效维度。
ViQ:任意分辨率下的文本对齐视觉量化表示
ViQ提出了一种视觉量化框架,在离散表示中平衡了语义丰富性和细节保留,通过文本对齐预训练和邻近表示学习,支持原生分辨率输入,实现高效的多模态训练。
RankE:面向离散文本到图像生成的端到端后训练与解码器协同进化
RankE 提出了一种用于离散文本到图像生成的端到端后训练框架,通过联合优化生成器和解码器来解决潜在协变量偏移问题,同时提升对齐度与保真度。
更深并不总是更好:通过置信层解码缓解对齐损失
本文介绍了一种无需训练的编码策略——Confident Decoding,它利用熵引导搜索动态选择LLM中最可靠的中间层,从而缓解对齐损失,并在GPQA-Diamond、Omni-MATH等基准测试中提升了推理性能,且开销可忽略不计。