diffusion-model

标签

Cards List
#diffusion-model

Comfy-Org/Ideogram-4

Hugging Face Models Trending · 2026-06-03 缓存

专为ComfyUI重新打包的Ideogram-4模型,包含fp8缩放扩散模型、Qwen3VL文本编码器和FLUX VAE。

0 人收藏 0 人点赞
#diffusion-model

TAPS:面向扩散草稿推测解码的目标感知前缀树选择

arXiv cs.AI · 2026-06-02 缓存

TAPS提出了一种面向扩散草稿推测解码的目标感知前缀树选择方法,通过改善接受-成本权衡,相较于先前方法实现了高达7.9倍的无损端到端加速。

0 人收藏 0 人点赞
#diffusion-model

jdopensource/JoyAI-Echo

Hugging Face Models Trending · 2026-06-02 缓存

京东开源发布了JoyAI-Echo(Echo-LongVideo),这是一个文本到音视频扩散模型,能够生成分钟级的多镜头视频,保持角色身份和声音一致,并利用DMD蒸馏实现了7.5倍的速度提升。

0 人收藏 0 人点赞
#diffusion-model

NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型

Hugging Face Daily Papers · 2026-06-02 缓存

NVIDIA推出OmniDreams,这是一个基于Cosmos扩散模型构建的生成式世界模型,用于实时动作条件视频生成,能够在复杂的未见场景中实现自动驾驶策略评估的闭环仿真。

0 人收藏 0 人点赞
#diffusion-model

@hank_aibtc: WTF?图像生成彻底变天了! PrismML 刚刚放出 Bonsai Image 4B —1-bit 二值和三值量化扩散模型! - 模型才 ~3GB(1-bit 版甚至压到 0.93GB), 而同参数的 FLUX.2 Klein 4B 要…

X AI KOLs Timeline · 2026-05-29 缓存

PrismML 发布了 Bonsai Image 4B,一种 1-bit 二值和三值量化扩散模型,大小仅为 3GB(1-bit 版 0.93GB),相比同参数 FLUX.2 Klein 4B 的 16GB 压缩了 8 倍以上,并支持完全本地化浏览器运行。

0 人收藏 0 人点赞
#diffusion-model

利用LLM驱动知识图谱推理生成逻辑一致的合成供应链数据

arXiv cs.CL · 2026-05-27 缓存

本文介绍了TabKG,一个知识图谱引导的框架,用于生成逻辑一致的合成供应链表格数据。它使用LLM集成发现操作依赖关系,并利用潜在扩散模型生成独立列,在保持统计保真度的同时实现高逻辑一致性。

0 人收藏 0 人点赞
#diffusion-model

DDGAD:基于扩散的图异常检测中的轨迹动力学

arXiv cs.LG · 2026-05-27 缓存

提出DDGAD,一种基于扩散的图异常检测框架,利用轨迹动力学区分正常节点与异常节点,通过可靠性感知的一致性机制和三种互补的异常信号缓解污染传播。

0 人收藏 0 人点赞
#diffusion-model

结构蛋白质组学引导的共折叠模型

arXiv cs.LG · 2026-05-27 缓存

介绍了AIMS-Fold,一种推理时引导扩散框架,整合了交联质谱(XL-MS)和氢-氘交换(HDX-MS)数据,以改善针对诱导接近药物靶点的蛋白质共折叠预测。

0 人收藏 0 人点赞
#diffusion-model

AirCast-SR: 基于潜在一致性扩散的公里尺度大气超分辨率基础模型

arXiv cs.LG · 2026-05-27 缓存

AirCast-SR 是一个基于扩散模型的基础模型,能够将全球AI天气预报从0.25°降尺度到1公里分辨率,每小时生成一次预报,可产生67小时预报,具有接近零偏差和结构真实感,同时在单个商用GPU上仅需数分钟即可完成推理。

0 人收藏 0 人点赞
#diffusion-model

MRT:面向大规模分层图像生成与编辑的掩码区域Transformer

Hugging Face Daily Papers · 2026-05-26 缓存

MRT是一个200亿参数的掩码区域扩散模型,统一了文本到层、图像到层以及层到层任务,用于可扩展的多层透明图像生成与编辑,达到了最先进的性能。

0 人收藏 0 人点赞
#diffusion-model

AutoRubric-T2I: 基于规则的文本到图像对齐鲁棒奖励模型

Hugging Face Daily Papers · 2026-05-20 缓存

AutoRubric-T2I 自动生成并选择显式评分标准,以指导视觉语言模型裁判对文本到图像生成进行评判,用极少的人工标注实现高质量奖励信号,并提升下游任务的生成质量。

0 人收藏 0 人点赞
#diffusion-model

用于宏布局生成的物理引导几何扩散

arXiv cs.LG · 2026-05-19 缓存

提出MacroDiff+,一种用于VLSI设计中宏布局的物理引导几何扩散框架,在ISPD2005基准测试上实现了6.1–6.2%的线长减少,具有卓越的稳定性和可扩展性。

0 人收藏 0 人点赞
#diffusion-model

LongLive-2.0:用于长视频生成的NVFP4并行基础设施

Hugging Face Daily Papers · 2026-05-18 缓存

LongLive-2.0 引入了一种基于NVFP4的并行基础设施,用于长视频生成,在训练上实现了高达2.15倍的加速,推理上实现了1.84倍的加速,5B模型达到了45.7 FPS。

0 人收藏 0 人点赞
#diffusion-model

stabilityai/stable-audio-3-medium

Hugging Face Models Trending · 2026-05-17 缓存

Stability AI 发布了 Stable Audio 3,这是一个潜在扩散模型系列,用于可变长度音频生成和编辑,其小型和中型模型的权重已在 Hugging Face 上提供。

0 人收藏 0 人点赞
#diffusion-model

Scenema Audio:零样本富有表现力的语音克隆与语音生成 [N]

Reddit r/MachineLearning · 2026-05-13

Scenema AI 发布了 Scenema Audio,一个开源的基于扩散模型的零样本富有表现力的语音克隆与语音生成模型,将情感表现与声音身份分离,使任何声音都能演绎任何情感。

0 人收藏 0 人点赞
#diffusion-model

@0xLogicrw: MIT 何恺明团队发布了新语言模型 ELF(Embedded Language Flows)。他们绕开了目前的自回归架构,把自己在视觉领域最拿手的扩散模型直接用在了文本生成上。具体做法是:把整个生成过程塞进连续的向量空间,直到最后一步才把…

X AI KOLs Timeline · 2026-05-13

MIT's Kai-Ming He team released ELF, a new language model that uses diffusion processes in continuous vector space for text generation, bypassing standard autoregressive architectures and significantly reducing data requirements.

0 人收藏 0 人点赞
#diffusion-model

AnyFlow:基于在策略流图蒸馏的任意步长视频扩散模型

Hugging Face Daily Papers · 2026-05-13 缓存

AnyFlow 提出了一种新颖的任意步长视频扩散蒸馏框架,通过流图过渡学习和反向模拟优化完整的 ODE 采样轨迹,在匹配甚至超越基于一致性模型的同时,能够随采样步数预算进行扩展。

0 人收藏 0 人点赞
#diffusion-model

Qwen-Image-VAE-2.0 技术报告

Hugging Face Daily Papers · 2026-05-13 缓存

Qwen-Image-VAE-2.0 是一个高压缩变分自编码器套件,通过增强的架构、大规模训练和语义对齐策略,提升了重建保真度和可扩散性。

0 人收藏 0 人点赞
#diffusion-model

@Honcia13: 开源TTS直接卷疯了!园区诈骗又有新武器? 清华 OpenBMB 刚刚放出 VoxCPM2: 200亿参数 + 200万小时多语言数据训练,48kHz录音棚级音质! 最狠的是——完全不用Tokenizer,直接在连续潜空间做扩散自回归,细…

X AI KOLs Timeline · 2026-05-12 缓存

清华大学 OpenBMB 发布了 VoxCPM2,这是一个拥有 200 亿参数的开源多语言 TTS 模型,支持无需 Tokenizer 的连续潜空间扩散自回归生成,具备 48kHz 录音棚级音质和强大的声音克隆与设计能力。

0 人收藏 0 人点赞
#diffusion-model

nVIDIA/PiD

Hugging Face Models Trending · 2026-04-28 缓存

NVIDIA 发布 PiD(Pixel Diffusion Decoder),这是一个条件像素空间扩散模型,将潜在空间到像素的解码和上采样统一到一个生成模块中,一次性生成超分辨率图像。模型检查点和 VAE 权重在非商业许可下发布。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈