标签
DiDrive是一种用于自动驾驶安全离线强化学习的风险感知分层扩散框架,通过集成表示学习和分布校正优化,提升复杂交通场景中的性能。
Celeris-1 Magnus 是一个针对智能体工作优化的混合扩散模型,在 τ³-bench banking 基准测试中,在中位时间 55 秒时达到 41.2% 的解决率,优于像 GPT-5.6-sol 这样的模型。
LayerRecall 通过选择性地将历史记忆路由到特定层,并在跨视野预测匹配的监督下,改善扩散模型中的长视频一致性。
我训练了一个1.2B DiT模型用于器乐游戏音乐生成,使用Stable Audio的VAE,旨在覆盖多样化的风格。该项目是开源的,包含一个WebUI和可在HuggingFace上获取的样本。
ADAPT是一种用于HVAC控制的物理感知条件扩散模型,能够降低能耗和使用者不适,并具有对未见环境的强大可迁移性。
Block3D 通过使用块级扩散和置信度引导的校正来加速文本到3D生成,减少推理时间,同时保持几何保真度,实现了5.15倍的加速。
一个人训练了一个扩散模型,在只有264KB RAM的Shrike lite微控制器上生成32x32像素的图像,尝试了FPGA加速但遇到了内存瓶颈,导致输出有时是噪声但有时很有趣。
DFlash 2 是一个用于投机解码的块扩散草稿模型,可提升 Qwen3.8-27B 语言模型的推理速度,在基准测试中提供更高的接受长度和吞吐量。
Molei Tao 介绍了 FLARE,这是一种扩散语言模型,其性能接近 GPT5,且推理速度显著更快。
UniSwap 是一个用于说话视频中联合音视频身份交换的新框架,利用统一的流式音视频扩散 Transformer 来替换外观和嗓音音色,同时保留源内容与动态。
Surg-UniWorld 是一个具有多模态控制专家的统一手术世界模型,支持利用边缘、深度和光流输入可控地生成连贯的器械-组织交互视频。它引入了一个新基准(Cholec80-SurgWAM),并且优于现有的可控视频生成方法。
本文提供将重新打包的MiniMax-Music-3模型文件放入ComfyUI目录中以用于音乐生成的说明。
本文介绍了一种基于条件扩散模型的概率集成模型,用于实时海啸淹没预报,与确定性预警相比,该模型提供了不确定性量化。利用2011年东北地区海啸数据进行验证,结果表明生成式AI可以将海啸预报从确定性方法转变为概率方法。
Scenema Audio,一款支持零样本声音克隆的表现力丰富的文本转语音模型,现已成为 ComfyUI 的原生自定义节点,并经过量化可在 8GB 显存上运行。此次发布新增了内联舞台指示提示、12 种预设语音,并简化了 ComfyUI 的提示词格式。
本文介绍了SynEnergy,一个两阶段基于扩散的框架,通过基于异构图的异常语义学习和异常语义引导扩散,在生成合成能源消耗数据的同时保留稀有异常事件。
UniNav是一个统一的世界-动作扩散模型,用于图像目标视觉导航。它在单个扩散过程中联合预测未来的视觉观察和航点轨迹,以高效推理实现了强大的基准测试结果。
提出MBDiff,一种用于概率性公用事业数据填补的多视图行为感知扩散模型,该模型从全局、局部和实例级视图学习用户行为,并使用条件注意力去噪网络。在佛罗里达州的真实公用事业数据上进行的评估表明,它优于最先进的基线模型。
提出存在场扩散模型(EFDM),通过带有存在变量的统一扩散过程联合建模点集的空间位置和基数,无需显式的离散转换。
本文提出了DiffTilt,一种分布性框架,通过指数倾斜扩散模型在环境和执行上的联合分布,高效发现自主系统和信息物理系统中的罕见安全关键故障,在ARCH-COMP基准测试和一个新的拖挂卡车基准测试中优于条件采样策略。
本文介绍了TriLayer,一个包含前景-背景-合成三元组的大规模视频数据集,以及DBL-Diffusion,一个用于显式分层视频表示的双分支扩散框架,实现了高保真度的对象插入和层分解。