标签
PixSDS 识别了潜空间分数蒸馏采样中由 VAE 引起的像素漂移,并提出了一种梯度修复方法,该方法解码潜空间 SDS 的前瞻步骤以指导像素空间优化,从而减少文本到 3D 生成中的伪影。
本文研究了一项自监督任务,即使用带有量化VAE分词器的自回归Transformer生成单细胞基因表达向量。文中报告了单细胞基础模型的缩放定律和计算最优前沿,并讨论了针对扰动预测进行微调的潜力。
Kijai 分享了一个为 MiniMax-H3 快速训练的二维微型 VAE,旨在改进 ComfyUI 中的潜空间预览。还附上了由 madebyollin 训练的更好的替代方案。
Meshy T2 引入了一个基于流匹配的快速原生网格生成框架,结合顶点集网格 VAE,实现了最先进的几何保真度,端到端图像到网格生成中位时间仅 6 秒,比自回归基线快一个数量级以上。
OmniVAE是一种联合训练的音频-视频VAE,使用分段级对比学习和特征蒸馏来对齐潜在空间,从而提升文本到音频-视频生成中的联合生成质量和同步性。
提出了一种基于VAE的多任务语义通信框架,用于卫星辅助自动驾驶,在保持交通标志重建和分类性能的同时,实现了显著的带宽压缩。
介绍跨空间蒸馏,这是一种通过轻量级潜在接口Bridge,将知识从现代高容量扩散模型迁移到具有不同潜在空间的紧凑学生模型的方法,无需修改学生主干即可实现质量提升。
本文介绍了TopVAE,一种拓扑优化的变分自编码器,通过让解码器内化结构和化学约束来减少分子潜在扩散中的“暗区”,从而显著提高分子生成质量。
本文介绍了O-Voxel,一种用于3D生成建模的新型稀疏体素表示方法,能够高效处理复杂拓扑和外观,并训练了包含4B参数的大规模流匹配模型,实现了最先进的生成质量。