标签
ThinkV2V 提出一个推理驱动的框架,在视觉生成之前激活 MLLM 的思考过程,用于指令引导的视频编辑。该框架采用 MLLM-to-DiT 架构,结合渐进式课程训练与推理时思维扩展技术。作者还发布了 ThinkV2V-150K 数据集和 ThinkV2V-Bench,实验表明其 5B 规模的 DiT 模型性能超越了更大的 10B 基线模型。
VGGT-Diff是一种基于几何路由的多视角扩散模型,它将视觉几何潜在变量与预训练扩散模型相结合,以改进稀疏视角新视角合成,达到竞争性或最先进的性能。
本文介绍了一种生成式大气超分辨率方法,该方法利用可组合接口,以异质现场观测为条件对预训练扩散模型进行调制,从而在不重新训练模型的情况下提升重建准确性。
Augment Code将其编码代理后端切换到Stefano Ermon的Mercury 2.5扩散模型,在生产环境中实现了82%的延迟降低和90%的成本削减。文章强调了扩散模型的性能优势以及独立AI基准测试工具的必要性。
论文提出LLMAE方法,利用潜在瓶颈将预训练的仅解码器LLMs重新定位为连续文本自编码器,实现高保真重建,并支持图像描述等下游任务。
Google Gemma 团队已发布 DiffusionGemma-Jev (djev),这是 JEV 的一个分支,简化了在 Google Cloud Run 上的部署,性能指标为约 35-60 毫秒延迟,批量处理能力为每秒 100-123 个请求。
天王星是一个面向具身智能的新一代仿真基础设施,它采用关节轨迹条件自回归扩散模型,能够以流式展开和可扩展控制的方式,实现可扩展、低延迟的机器人仿真生成。
Supra2-IMG 是一个仅具1亿参数的小型文本到图像模型,它在单块H100显卡上经过不到10小时的从头训练,实现了图像生成领域最先进的质量,并已在Hugging Face上开源发布。
Qwen-Image-2.1 是一个统一的文本到图像生成和图像编辑模型,拥有70亿参数,在效率、透明度、多功能性和真实性方面有所改进。来自 unsloth 的这个 GGUF 量化版本支持高效的本地推理。
DSD是一种基于扩散的方法,用于在模拟人形控制中发现多样且可复用的运动技能,通过更广泛的行为覆盖改进了先前的技能发现技术。
RefineEdit 是一种免训练的提示到提示图像编辑方法,它使用生成精炼网络来增强编辑定位和背景保留,实现了顶级的基准分数。
SCTab-Diff 是一个语义一致的表格扩散框架,它利用弱语义先验来生成高保真合成表格数据,相比现有方法,提升了分布保真度和语义一致性。
为 ComfyUI 工作流程优化的 Qwen-Image-2.1 重打包模型文件,支持文本生成图像和图像编辑功能。
Qwen-Image-2.1是一个开源的统一文本到图像和图像编辑模型,拥有70亿参数,具有高效的架构、透明度支持和多功能的编辑能力。
Dynin-Robotics是一个多模态统一扩散模型,整合了视觉、语言和动作,用于语言条件下的机器人控制,通过联合去噪和测试时缩放提高适应性和成功率。
一位独立音频研究员训练了名为 Foundation-1 的模型,该模型能生成用于音乐制作的无限单次音效,并将文本提示转化为可演奏的合成器,同时发布了模型、相关文档和推理工具。
Srijika是一个系统,通过使用潜在扩散模型重样式化字形,为九种印度文字生成可安装的OpenType字体,同时保持布局一致性。
DiDrive是一种用于自动驾驶安全离线强化学习的风险感知分层扩散框架,通过集成表示学习和分布校正优化,提升复杂交通场景中的性能。
Celeris-1 Magnus 是一个针对智能体工作优化的混合扩散模型,在 τ³-bench banking 基准测试中,在中位时间 55 秒时达到 41.2% 的解决率,优于像 GPT-5.6-sol 这样的模型。
本文介绍了Puppeteer,一个基于扩散的语音同步手势模型,它使用因果潜在令牌和对象几何来生成时间连贯、姿势感知且物理上基于的手势。