diffusion-model

标签

Cards List
#diffusion-model

DiDrive:一种用于自动驾驶安全离线强化学习的风险感知分层扩散框架

arXiv cs.LG · 昨天 缓存

DiDrive是一种用于自动驾驶安全离线强化学习的风险感知分层扩散框架,通过集成表示学习和分布校正优化,提升复杂交通场景中的性能。

0 人收藏 0 人点赞
#diffusion-model

@Celeris_ai:推出 Celeris-1 Magnus。一个为智能体工作构建的模型。在 τ³-bench banking 上,Magnus 在 55 秒时达到 41.2%…

X AI KOLs Timeline · 3天前 缓存

Celeris-1 Magnus 是一个针对智能体工作优化的混合扩散模型,在 τ³-bench banking 基准测试中,在中位时间 55 秒时达到 41.2% 的解决率,优于像 GPT-5.6-sol 这样的模型。

0 人收藏 0 人点赞
#diffusion-model

LayerRecall: 一个用于视频生成中长期一致性的状态条件记忆路由器

Hugging Face Daily Papers · 2026-08-28 缓存

LayerRecall 通过选择性地将历史记忆路由到特定层,并在跨视野预测匹配的监督下,改善扩散模型中的长视频一致性。

0 人收藏 0 人点赞
#diffusion-model

我训练了一个游戏音乐生成器

Reddit r/LocalLLaMA · 2026-08-23

我训练了一个1.2B DiT模型用于器乐游戏音乐生成,使用Stable Audio的VAE,旨在覆盖多样化的风格。该项目是开源的,包含一个WebUI和可在HuggingFace上获取的样本。

0 人收藏 0 人点赞
#diffusion-model

ADAPT: 基于扩散的物理感知世界模型用于自适应预测可迁移HVAC控制

arXiv cs.AI · 2026-08-21 缓存

ADAPT是一种用于HVAC控制的物理感知条件扩散模型,能够降低能耗和使用者不适,并具有对未见环境的强大可迁移性。

0 人收藏 0 人点赞
#diffusion-model

Block3D:基于块级扩散的高效文本到3D生成

Hugging Face Daily Papers · 2026-08-20 缓存

Block3D 通过使用块级扩散和置信度引导的校正来加速文本到3D生成,减少推理时间,同时保持几何保真度,实现了5.15倍的加速。

0 人收藏 0 人点赞
#diffusion-model

训练了一个在264KB RAM上运行的扩散模型 [P]

Reddit r/MachineLearning · 2026-08-18

一个人训练了一个扩散模型,在只有264KB RAM的Shrike lite微控制器上生成32x32像素的图像,尝试了FPGA加速但遇到了内存瓶颈,导致输出有时是噪声但有时很有趣。

0 人收藏 0 人点赞
#diffusion-model

incoai/Qwen3.8-27B-DFlash2

Hugging Face Models Trending · 2026-08-18 缓存

DFlash 2 是一个用于投机解码的块扩散草稿模型,可提升 Qwen3.8-27B 语言模型的推理速度,在基准测试中提供更高的接受长度和吞吐量。

0 人收藏 0 人点赞
#diffusion-model

@no_stp_on_snek: 本周越来越好。

X AI KOLs Following · 2026-08-14 缓存

Molei Tao 介绍了 FLARE,这是一种扩散语言模型,其性能接近 GPT5,且推理速度显著更快。

0 人收藏 0 人点赞
#diffusion-model

UniSwap:面向说话视频的流式音视频身份交换

Hugging Face Daily Papers · 2026-08-13 缓存

UniSwap 是一个用于说话视频中联合音视频身份交换的新框架,利用统一的流式音视频扩散 Transformer 来替换外观和嗓音音色,同时保留源内容与动态。

0 人收藏 0 人点赞
#diffusion-model

Surg-UniWorld:一种具有多模态控制专家的统一手术世界模型

arXiv cs.AI · 2026-08-10 缓存

Surg-UniWorld 是一个具有多模态控制专家的统一手术世界模型,支持利用边缘、深度和光流输入可控地生成连贯的器械-组织交互视频。它引入了一个新基准(Cholec80-SurgWAM),并且优于现有的可控视频生成方法。

0 人收藏 0 人点赞
#diffusion-model

Comfy-Org/MiniMax-Music-3

Hugging Face Models Trending · 2026-08-08 缓存

本文提供将重新打包的MiniMax-Music-3模型文件放入ComfyUI目录中以用于音乐生成的说明。

0 人收藏 0 人点赞
#diffusion-model

基于生成式AI的实时概率海啸预报

arXiv cs.LG · 2026-08-06 缓存

本文介绍了一种基于条件扩散模型的概率集成模型,用于实时海啸淹没预报,与确定性预警相比,该模型提供了不确定性量化。利用2011年东北地区海啸数据进行验证,结果表明生成式AI可以将海啸预报从确定性方法转变为概率方法。

0 人收藏 0 人点赞
#diffusion-model

Scenema Audio 登陆 ComfyUI,可在 8GB 显存上运行

Reddit r/LocalLLaMA · 2026-08-05

Scenema Audio,一款支持零样本声音克隆的表现力丰富的文本转语音模型,现已成为 ComfyUI 的原生自定义节点,并经过量化可在 8GB 显存上运行。此次发布新增了内联舞台指示提示、12 种预设语音,并简化了 ComfyUI 的提示词格式。

0 人收藏 0 人点赞
#diffusion-model

SynEnergy:用于合成能源数据生成的异常语义引导扩散

arXiv cs.LG · 2026-08-05 缓存

本文介绍了SynEnergy,一个两阶段基于扩散的框架,通过基于异构图的异常语义学习和异常语义引导扩散,在生成合成能源消耗数据的同时保留稀有异常事件。

0 人收藏 0 人点赞
#diffusion-model

UniNav:用于视觉导航的统一世界-动作扩散模型

arXiv cs.AI · 2026-08-05 缓存

UniNav是一个统一的世界-动作扩散模型,用于图像目标视觉导航。它在单个扩散过程中联合预测未来的视觉观察和航点轨迹,以高效推理实现了强大的基准测试结果。

0 人收藏 0 人点赞
#diffusion-model

MBDiff:多视图行为感知扩散模型用于概率性公用事业数据插补

arXiv cs.LG · 2026-08-03 缓存

提出MBDiff,一种用于概率性公用事业数据填补的多视图行为感知扩散模型,该模型从全局、局部和实例级视图学习用户行为,并使用条件注意力去噪网络。在佛罗里达州的真实公用事业数据上进行的评估表明,它优于最先进的基线模型。

0 人收藏 0 人点赞
#diffusion-model

面向可变基数的空间点过程的存在场扩散模型

arXiv cs.LG · 2026-07-30 缓存

提出存在场扩散模型(EFDM),通过带有存在变量的统一扩散过程联合建模点集的空间位置和基数,无需显式的离散转换。

0 人收藏 0 人点赞
#diffusion-model

通过指数倾斜的扩散引导搜索(DiffTilt):在安全关键系统反证中的应用

arXiv cs.LG · 2026-07-28 缓存

本文提出了DiffTilt,一种分布性框架,通过指数倾斜扩散模型在环境和执行上的联合分布,高效发现自主系统和信息物理系统中的罕见安全关键故障,在ARCH-COMP基准测试和一个新的拖挂卡车基准测试中优于条件采样策略。

0 人收藏 0 人点赞
#diffusion-model

显式层建模用于视频对象插入与层分解

Hugging Face Daily Papers · 2026-07-28 缓存

本文介绍了TriLayer,一个包含前景-背景-合成三元组的大规模视频数据集,以及DBL-Diffusion,一个用于显式分层视频表示的双分支扩散框架,实现了高保真度的对象插入和层分解。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈