标签
HarmoCore 引入了一种功能性潜扩散方法,用于从稀疏传感器数据中重建振荡波场,在二维和三维场景中以最小感知实现了效率和精度的显著提升。
SimCast-S2S是一种用于概率性亚季节性降水预报的生成式潜扩散框架,它利用气候模拟的迁移学习,在性能上超越了深度学习基线模型,并与业务预报系统具备竞争力。
KATok是一种自适应视频分词器,通过选择性丢弃信息量不足的令牌来实现数据依赖压缩,提升基于扩散的视频生成中的空间一致性。
FarSky 是一种生成式预报框架,利用任务感知潜空间耦合和潜扩散模型,生成确定性和概率性的小时内太阳辐照度预报,预报技巧最多提升 11 个百分点,并具有更好的爬坡事件检测能力。
本文提出一种双向潜在扩散模型,可让动力系统在时间上向前或向后步进,并利用往返一致性作为自监督的测试时误差信号,在无需真实值或集成的情况下预测展开误差。
本文介绍了KVAE,这是一个专为文本条件生成模型设计的音频、图像和视频分词器系列。论文声称,与现有开源分词器相比,KVAE在重建质量和生成质量上具有竞争力或更优。代码和训练细节已公开发布。
FMOPF 使用潜在流匹配与约束感知交互先验,为交流最优潮流生成多样化、可行且接近最优的解,能扩展到数百个节点同时保持可行性。
本文介绍了 AlayaRenderer-Flash,这是一种实时生成式世界渲染器,通过使用少步自回归流式模型和轻量级蒸馏编解码器,将渲染速度从 0.56 FPS 提升到 31.54 FPS,实现了与物理引擎的交互式游玩。
DiffGI引入了一种可微分几何图像表示,用于高保真薄壳3D生成,实现了端到端优化和卓越的重建质量。
本文介绍了MIRA,首个针对高度动态物理环境的大规模多玩家世界模型,该模型在10000小时的《火箭联盟》游戏数据上训练。这个50亿参数的潜在扩散模型能够实时生成稳定的四人游戏过程,其分布质量在数小时内保持稳定。
Patch-PODiff-ViT 引入了一种结构化潜在扩散框架,利用分块本征正交分解 (POD) 实现超分辨率和不确定性量化,通过固定的线性正交基和预测方差的解析传播实现高效扩散。
介绍了BrainG3N,一种用于3D脑部MRI潜在扩散的双用途分词器,它使用冻结的掩码自编码器(MAE)编码器生成临床信息丰富的嵌入表示,并使用CNN解码器进行重建,在23个任务的基准测试中达到了最先进性能,并实现了可控生成和纵向预测。
本文介绍了TopVAE,一种拓扑优化的变分自编码器,通过让解码器内化结构和化学约束来减少分子潜在扩散中的“暗区”,从而显著提高分子生成质量。
本文系统地比较了基于重建和基于语义的潜在空间在机器人行动条件潜在扩散世界模型中的应用。研究发现,像V-JEPA 2.1这样的语义编码器在策略相关指标上通常优于重建编码器,从而主张将语义潜在空间作为机器人世界模型的更强基础。
NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。
NVIDIA Spatial Intelligence Lab 提出 PiD,将 latent 扩散模型的解码环节重新设计为条件像素扩散过程,统一解码与上采样,实现低延迟高分辨率解码。
本文提出AirfoilGen,一种用于翼型形状生成的潜扩散模型,通过圆形扫掠表示确保几何有效性,并能够控制气动性能(升力/阻力系数)。实验表明,使用超过20万个翼型的新数据集,性能条件化准确率达到98.41%。
本文识别了流形假设下扩散模型中的坍缩与精炼机制,提出了分数诱导潜在扩散(SiLD),该方法可证明地避免了维度灾难。实验表明,SiLD在生成质量上匹配或超越基于VAE的潜在扩散模型。
本技术报告研究了面向非自回归文本生成的草稿条件潜在精炼,表明良好的潜在几何并不能保证良好的解码,并强调解码器可恢复性作为关键评估指标。