latent-diffusion

标签

Cards List
#latent-diffusion

HarmoCore:用于振荡波场稀疏重建的功能性潜扩散

arXiv cs.LG · 5天前 缓存

HarmoCore 引入了一种功能性潜扩散方法,用于从稀疏传感器数据中重建振荡波场,在二维和三维场景中以最小感知实现了效率和精度的显著提升。

0 人收藏 0 人点赞
#latent-diffusion

SimCast-S2S:一种通过气候模拟迁移学习实现高效亚季节性降水预报的生成模型

arXiv cs.LG · 2026-08-28 缓存

SimCast-S2S是一种用于概率性亚季节性降水预报的生成式潜扩散框架,它利用气候模拟的迁移学习,在性能上超越了深度学习基线模型,并与业务预报系统具备竞争力。

0 人收藏 0 人点赞
#latent-diffusion

KATok:用于紧凑视频表示的自适应分词器(保留或丢弃?)

Hugging Face Daily Papers · 2026-08-25 缓存

KATok是一种自适应视频分词器,通过选择性丢弃信息量不足的令牌来实现数据依赖压缩,提升基于扩散的视频生成中的空间一致性。

0 人收藏 0 人点赞
#latent-diffusion

FarSky:面向生成式小时内太阳预报的任务感知潜空间耦合

arXiv cs.LG · 2026-08-13 缓存

FarSky 是一种生成式预报框架,利用任务感知潜空间耦合和潜扩散模型,生成确定性和概率性的小时内太阳辐照度预报,预报技巧最多提升 11 个百分点,并具有更好的爬坡事件检测能力。

0 人收藏 0 人点赞
#latent-diffusion

往返一致性:双向扩散模型可预测自身的展开误差 [R]

Reddit r/MachineLearning · 2026-08-06

本文提出一种双向潜在扩散模型,可让动力系统在时间上向前或向后步进,并利用往返一致性作为自监督的测试时误差信号,在无需真实值或集成的情况下预测展开误差。

0 人收藏 0 人点赞
#latent-diffusion

KVAE:用于多模态生成模型的系列分词器

Hugging Face Daily Papers · 2026-08-06 缓存

本文介绍了KVAE,这是一个专为文本条件生成模型设计的音频、图像和视频分词器系列。论文声称,与现有开源分词器相比,KVAE在重建质量和生成质量上具有竞争力或更优。代码和训练细节已公开发布。

0 人收藏 0 人点赞
#latent-diffusion

FMOPF: 面向交流最优潮流的潜在流匹配与约束感知交互先验

arXiv cs.LG · 2026-07-28 缓存

FMOPF 使用潜在流匹配与约束感知交互先验,为交流最优潮流生成多样化、可行且接近最优的解,能扩展到数百个节点同时保持可行性。

0 人收藏 0 人点赞
#latent-diffusion

以游戏速度运行的生成式世界渲染器

Hugging Face Daily Papers · 2026-07-21 缓存

本文介绍了 AlayaRenderer-Flash,这是一种实时生成式世界渲染器,通过使用少步自回归流式模型和轻量级蒸馏编解码器,将渲染速度从 0.56 FPS 提升到 31.54 FPS,实现了与物理引擎的交互式游玩。

0 人收藏 0 人点赞
#latent-diffusion

DiffGI: 用于高保真薄壳3D生成的可微分几何图像

Hugging Face Daily Papers · 2026-07-15 缓存

DiffGI引入了一种可微分几何图像表示,用于高保真薄壳3D生成,实现了端到端优化和卓越的重建质量。

0 人收藏 0 人点赞
#latent-diffusion

多玩家交互式世界模型与表示自编码器

Hugging Face Daily Papers · 2026-07-06 缓存

本文介绍了MIRA,首个针对高度动态物理环境的大规模多玩家世界模型,该模型在10000小时的《火箭联盟》游戏数据上训练。这个50亿参数的潜在扩散模型能够实时生成稳定的四人游戏过程,其分布质量在数小时内保持稳定。

0 人收藏 0 人点赞
#latent-diffusion

Patch-PODiff-ViT: 基于分块POD的结构化潜在扩散模型,用于超分辨率和不确定性量化

arXiv cs.LG · 2026-07-01 缓存

Patch-PODiff-ViT 引入了一种结构化潜在扩散框架,利用分块本征正交分解 (POD) 实现超分辨率和不确定性量化,通过固定的线性正交基和预测方差的解析传播实现高效扩散。

0 人收藏 0 人点赞
#latent-diffusion

BrainG3N: 一种用于可控3D脑部MRI生成的双用途分词器

arXiv cs.AI · 2026-06-20 缓存

介绍了BrainG3N,一种用于3D脑部MRI潜在扩散的双用途分词器,它使用冻结的掩码自编码器(MAE)编码器生成临床信息丰富的嵌入表示,并使用CNN解码器进行重建,在23个任务的基准测试中达到了最先进性能,并实现了可控生成和纵向预测。

0 人收藏 0 人点赞
#latent-diffusion

分子潜在扩散中的暗区平滑化

arXiv cs.LG · 2026-06-15 缓存

本文介绍了TopVAE,一种拓扑优化的变分自编码器,通过让解码器内化结构和化学约束来减少分子潜在扩散中的“暗区”,从而显著提高分子生成质量。

0 人收藏 0 人点赞
#latent-diffusion

@artemZholus:谢谢!在第二篇论文(https://arxiv.org/abs/2605.06388)中,我们采用了您(和RAE)的方案,效果不错。

X AI KOLs Following · 2026-05-26 缓存

本文系统地比较了基于重建和基于语义的潜在空间在机器人行动条件潜在扩散世界模型中的应用。研究发现,像V-JEPA 2.1这样的语义编码器在策略相关指标上通常优于重建编码器,从而主张将语义潜在空间作为机器人世界模型的更强基础。

0 人收藏 0 人点赞
#latent-diffusion

@xuanchi13: 潜在vs像素的争论没有抓住要点。GPT Image 2 展示了用户注意到的:像素级保真度。潜在模型...

X AI KOLs Timeline · 2026-05-26 缓存

NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。

0 人收藏 0 人点赞
#latent-diffusion

@FeitengLi: NVIDIA Spatial Intelligence Lab 提出 PiD,重新设计了 latent 扩散模型里的解码环节。 目前主流文生图都在 latent 空间生成,再用 VAE decoder 映射回像素。这个 decoder 的…

X AI KOLs Timeline · 2026-05-25 缓存

NVIDIA Spatial Intelligence Lab 提出 PiD,将 latent 扩散模型的解码环节重新设计为条件像素扩散过程,统一解码与上采样,实现低延迟高分辨率解码。

0 人收藏 0 人点赞
#latent-diffusion

AirfoilGen:一种构造有效且性能感知的翼型潜扩散模型

arXiv cs.LG · 2026-05-21 缓存

本文提出AirfoilGen,一种用于翼型形状生成的潜扩散模型,通过圆形扫掠表示确保几何有效性,并能够控制气动性能(升力/阻力系数)。实验表明,使用超过20万个翼型的新数据集,性能条件化准确率达到98.41%。

0 人收藏 0 人点赞
#latent-diffusion

流形假设下可证明的扩散模型学习:坍缩与精炼

arXiv cs.LG · 2026-05-21 缓存

本文识别了流形假设下扩散模型中的坍缩与精炼机制,提出了分数诱导潜在扩散(SiLD),该方法可证明地避免了维度灾难。实验表明,SiLD在生成质量上匹配或超越基于VAE的潜在扩散模型。

0 人收藏 0 人点赞
#latent-diffusion

Stable Audio 3

Hacker News Top · 2026-05-20 缓存

Stable Audio 3 推出了一系列快速潜扩散模型,用于变长音频生成与编辑,并开源了中小型模型权重。

0 人收藏 0 人点赞
#latent-diffusion

当潜在几何不够时:面向非自回归文本生成的草稿条件潜在精炼

arXiv cs.CL · 2026-05-18 缓存

本技术报告研究了面向非自回归文本生成的草稿条件潜在精炼,表明良好的潜在几何并不能保证良好的解码,并强调解码器可恢复性作为关键评估指标。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈