diffusion-model

标签

Cards List
#diffusion-model

ThinkV2V:释放多模态大语言模型在指令引导视频编辑中的推理能力

Hugging Face Daily Papers ↗ · 2天前 缓存

ThinkV2V 提出一个推理驱动的框架,在视觉生成之前激活 MLLM 的思考过程,用于指令引导的视频编辑。该框架采用 MLLM-to-DiT 架构,结合渐进式课程训练与推理时思维扩展技术。作者还发布了 ThinkV2V-150K 数据集和 ThinkV2V-Bench,实验表明其 5B 规模的 DiT 模型性能超越了更大的 10B 基线模型。

0 人收藏 0 人点赞
#diffusion-model

VGGT-Diff:视觉几何与扩散在稀疏视角新视角合成中的融合

Hugging Face Daily Papers ↗ · 4天前 缓存

VGGT-Diff是一种基于几何路由的多视角扩散模型,它将视觉几何潜在变量与预训练扩散模型相结合,以改进稀疏视角新视角合成,达到竞争性或最先进的性能。

0 人收藏 0 人点赞
#diffusion-model

利用可组合接口从异质现场观测中生成大气超分辨率

arXiv cs.LG ↗ · 6天前 缓存

本文介绍了一种生成式大气超分辨率方法,该方法利用可组合接口,以异质现场观测为条件对预训练扩散模型进行调制,从而在不重新训练模型的情况下提升重建准确性。

0 人收藏 0 人点赞
#diffusion-model

Stefano Ermon:自回归推理是顺序执行且受内存限制的。扩散模型设计用于映射到GPU——这就是它获胜的原因。

Reddit r/artificial ↗ · 6天前

Augment Code将其编码代理后端切换到Stefano Ermon的Mercury 2.5扩散模型,在生产环境中实现了82%的延迟降低和90%的成本削减。文章强调了扩散模型的性能优势以及独立AI基准测试工具的必要性。

0 人收藏 0 人点赞
#diffusion-model

将预训练LLMs重新利用为高保真连续文本自编码器

arXiv cs.LG ↗ · 2026-09-24 缓存

论文提出LLMAE方法,利用潜在瓶颈将预训练的仅解码器LLMs重新定位为连续文本自编码器,实现高保真重建,并支持图像描述等下游任务。

0 人收藏 0 人点赞
#diffusion-model

@LinusEkenstam: 我喜欢看到前沿实验室多么迅速地加入创建分支。就在今天,我们看到了 omni-jev,现在又有 djev …

X AI KOLs Timeline ↗ · 2026-09-23 缓存

Google Gemma 团队已发布 DiffusionGemma-Jev (djev),这是 JEV 的一个分支,简化了在 Google Cloud Run 上的部署,性能指标为约 35-60 毫秒延迟,批量处理能力为每秒 100-123 个请求。

0 人收藏 0 人点赞
#diffusion-model

天王星:构建面向具身智能的新一代仿真基础设施

Hugging Face Daily Papers ↗ · 2026-09-23 缓存

天王星是一个面向具身智能的新一代仿真基础设施,它采用关节轨迹条件自回归扩散模型,能够以流式展开和可扩展控制的方式,实现可扩展、低延迟的机器人仿真生成。

0 人收藏 0 人点赞
#diffusion-model

[重磅发布] Supra2-IMG - 仅1亿参数的文本生成图像模型 - 达到尖端水准并完全开源发布!

Reddit r/LocalLLaMA ↗ · 2026-09-21

Supra2-IMG 是一个仅具1亿参数的小型文本到图像模型,它在单块H100显卡上经过不到10小时的从头训练,实现了图像生成领域最先进的质量,并已在Hugging Face上开源发布。

0 人收藏 0 人点赞
#diffusion-model

unsloth/Qwen-Image-2.1-GGUF

Hugging Face Models Trending ↗ · 2026-09-21 缓存

Qwen-Image-2.1 是一个统一的文本到图像生成和图像编辑模型,拥有70亿参数,在效率、透明度、多功能性和真实性方面有所改进。来自 unsloth 的这个 GGUF 量化版本支持高效的本地推理。

0 人收藏 0 人点赞
#diffusion-model

DSD:通过扩散技能发现学习多样且可复用的运动技能

arXiv cs.LG ↗ · 2026-09-17 缓存

DSD是一种基于扩散的方法,用于在模拟人形控制中发现多样且可复用的运动技能,通过更广泛的行为覆盖改进了先前的技能发现技术。

0 人收藏 0 人点赞
#diffusion-model

精炼本质上是可编辑的:基于生成精炼网络的免训练提示到提示图像编辑

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

RefineEdit 是一种免训练的提示到提示图像编辑方法,它使用生成精炼网络来增强编辑定位和背景保留,实现了顶级的基准分数。

0 人收藏 0 人点赞
#diffusion-model

超越分布匹配:基于弱语义先验的语义一致性表格扩散

arXiv cs.LG ↗ · 2026-09-16 缓存

SCTab-Diff 是一个语义一致的表格扩散框架,它利用弱语义先验来生成高保真合成表格数据,相比现有方法,提升了分布保真度和语义一致性。

0 人收藏 0 人点赞
#diffusion-model

Comfy-Org/Qwen-Image-2.1

Hugging Face Models Trending ↗ · 2026-09-15 缓存

为 ComfyUI 工作流程优化的 Qwen-Image-2.1 重打包模型文件,支持文本生成图像和图像编辑功能。

0 人收藏 0 人点赞
#diffusion-model

Qwen/Qwen-Image-2.1

Hugging Face Models Trending ↗ · 2026-09-14 缓存

Qwen-Image-2.1是一个开源的统一文本到图像和图像编辑模型,拥有70亿参数,具有高效的架构、透明度支持和多功能的编辑能力。

0 人收藏 0 人点赞
#diffusion-model

Dynin-Robotics:多模态统一扩散视觉-语言-动作模型

Hugging Face Daily Papers ↗ · 2026-09-11 缓存

Dynin-Robotics是一个多模态统一扩散模型,整合了视觉、语言和动作,用于语言条件下的机器人控制,通过联合去噪和测试时缩放提高适应性和成功率。

0 人收藏 0 人点赞
#diffusion-model

我训练了一个音频模型,能生成用于音乐制作的无限单次音效,并将文本提示转化为完全可演奏的合成器。我不仅发布了模型,还发布了一个视频,详细展示了如何实现这一点(以及让其他人制作基于文本合成器的推理流程)。

Reddit r/LocalLLaMA ↗ · 2026-09-09

一位独立音频研究员训练了名为 Foundation-1 的模型,该模型能生成用于音乐制作的无限单次音效,并将文本提示转化为可演奏的合成器,同时发布了模型、相关文档和推理工具。

0 人收藏 0 人点赞
#diffusion-model

Srijika:用于九种印度文字的OpenType布局复用字体重样式化系统

Hugging Face Daily Papers ↗ · 2026-09-04 缓存

Srijika是一个系统,通过使用潜在扩散模型重样式化字形,为九种印度文字生成可安装的OpenType字体,同时保持布局一致性。

0 人收藏 0 人点赞
#diffusion-model

DiDrive:一种用于自动驾驶安全离线强化学习的风险感知分层扩散框架

arXiv cs.LG ↗ · 2026-09-03 缓存

DiDrive是一种用于自动驾驶安全离线强化学习的风险感知分层扩散框架,通过集成表示学习和分布校正优化,提升复杂交通场景中的性能。

0 人收藏 0 人点赞
#diffusion-model

@Celeris_ai:推出 Celeris-1 Magnus。一个为智能体工作构建的模型。在 τ³-bench banking 上,Magnus 在 55 秒时达到 41.2%…

X AI KOLs Timeline ↗ · 2026-09-01 缓存

Celeris-1 Magnus 是一个针对智能体工作优化的混合扩散模型,在 τ³-bench banking 基准测试中,在中位时间 55 秒时达到 41.2% 的解决率,优于像 GPT-5.6-sol 这样的模型。

0 人收藏 0 人点赞
#diffusion-model

Puppeteer: 基于对象的姿势感知语音同步手势生成

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

本文介绍了Puppeteer,一个基于扩散的语音同步手势模型,它使用因果潜在令牌和对象几何来生成时间连贯、姿势感知且物理上基于的手势。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈