PixelCNN++:通过离散化逻辑混合似然函数及其他改进增强 PixelCNN

OpenAI Blog 论文

摘要

PixelCNN++ 对 PixelCNN 进行了多项架构改进,包括离散化逻辑混合似然函数、下采样和快捷连接,在 CIFAR-10 上取得了最先进的对数似然结果。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:45

# PixelCNN++:通过离散化逻辑混合似然函数及其他改进来增强 PixelCNN 来源:https://openai.com/index/pixelcnn-plus-plus/ ## 摘要 PixelCNN 是最近提出的一类强大的生成模型,具有可求迹的似然函数。在本文中,我们讨论了我们的 PixelCNN 实现,并将其发布在 https://github.com/openai/pixel-cnn(在新窗口中打开)。我们的实现包含了对原始模型的多项修改,这些修改既简化了模型结构,又改进了性能。1)我们在像素上使用离散化逻辑混合似然函数,而不是 256 路 softmax,这样可以加快训练速度。2)我们基于整个像素而不是 R/G/B 子像素进行条件化,简化了模型结构。3)我们使用下采样来有效地捕获多个分辨率的结构。4)我们引入了额外的短路连接以进一步加快优化速度。5)我们使用 dropout 对模型进行正则化。最后,我们在 CIFAR-10 上展示了最先进的对数似然结果,以证明这些修改的有效性。

相似文章

L2P:释放像素生成的潜在潜力

Hugging Face Daily Papers

L2P 论文提出了一种潜在空间到像素空间(Latent-to-Pixel)的迁移范式,该范式利用预训练的潜在扩散模型(LDM),以极低的训练开销构建高效的像素空间模型,并实现 4K 分辨率生成。

PiD:基于像素扩散的快速高分辨率潜在解码

Hugging Face Daily Papers

PiD 提出了一种像素扩散解码器,将潜在解码重新定义为条件像素扩散,从而在高分辨率下实现快速、高质量的图像合成,并降低计算需求。在消费级硬件上,它能在不到一秒内将潜在表示解码为 4 倍或 8 倍放大图像。

利用LLM扩展闭环特征通道配置

arXiv cs.LG

本文将基于LLM的闭环通道配置搜索扩展到每周期250个候选,在CIFAR-100上展示了正向的准确率趋势和参数效率提升,并揭示了LLM生成的通道先验中的架构规律性。

MiniCPM-V 4.5:通过架构、数据与训练配方打造高效多模态大语言模型

Papers with Code Trending

MiniCPM-V 4.5 是一款 8B 参数规模的多模态大语言模型,凭借统一的 3D-Resampler 架构、创新的数据策略以及混合强化学习方法,实现了高效率与卓越性能。据悉,该模型在显著降低 GPU 显存占用与推理耗时的同时,综合表现已超越更大规模的闭源及开源标杆模型。