标签
Ring Forcing 是一个自回归视频扩散框架,通过环形结构训练、历史压缩和稀疏旋转嵌入,增强长期记忆以实现精确的分钟级视频连贯性。
4DAnyone通过生成多视角一致视频并将其提升到4D高斯溅射,从单目视频重建4D人物,并使用参考和目标上下文设计来解决扩展瓶颈。
AnyTalk 通过角色特定微调适应视频扩散模型,并优化混合形状参数,无需动画数据即可为任意角色生成 3D 语音动画,并提供实时蒸馏变体。
Marionette引入了一种世界模型,该模型显式预测用于交互式游戏的三维关节状态,通过零参数渲染器解耦几何渲染,并使用扩散模型进行外观合成,提高了可控性和长期一致性。
SCoPE 是 TencentARC 提出的一个模型,它将相机视线作为位置坐标添加到预训练的视频扩散 Transformer 中,从而能够在保持图像到视频先验的同时实现相机轨迹控制。该发布包含一个用于 Wan2.2-I2V-A14B 推理的自包含检查点。
LiveAnimate 提出了一个14B参数的视频扩散Transformer,通过PR-Sink注意力机制实现了实时、长时、姿态驱动的人体动画,具有稳定流式生成和恒定内存占用。在两个H100 GPU上实现了19.63 FPS的推理速度,在长达三分钟的流中保持质量。
本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。
MirrorWorld 是一个反射感知的视频修复框架,通过分别建模语义内容(SRD)和几何空间排布(GTA)来改善视频中的镜面反射生成,相比现有的基于图像和视频修复的基线方法,取得了更好的反射重建效果。
提出了UniWorld-View,一个用于从单目输入进行大基线新视图合成的统一框架,将遮挡感知的点云渲染与视频扩散模型相结合,以实现精确的相机控制和几何一致性。
TenStrip/10Eros-Max是一个实验性AI模型,通过正交投影从LTX 2.3、Wan 2.2和Krea 2视频与图像扩散模型中迁移学习模式,以修改MiniMax H3基础模型,增强美学与运动特性,同时保留核心视频和音频功能。
This paper proposes 'Mirror Learning', a framework for imitation learning from third-person observation that uses a fine-tuned video diffusion model for perspective transformation and an inverse dynamics model to synthesize pseudo first-person expert data, showing that this mirror data alone can train effective policies and improve behavior cloning.
DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。
本文介绍了一种静止状态框架,该框架从单个闭合配置中重建铰接物体,利用显式网格、视觉-语言输出和视频扩散模型来生成并验证关节假设,而无需观测运动。
WorldWeaver (W²) 将跨智能体世界状态寄存器引入多智能体视频扩散模型,实现跨智能体和视图的共享世界状态持久化,提升了双智能体 Minecraft 视频生成的逻辑一致性。
Sol-Engine 每周更新宣布集成 Sol Attention,一种用于视频扩散的无需训练的稀疏注意力方法,完整论文将于下周发布。
AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。
提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。
LongE2V利用预训练的视频扩散先验,并引入自回归展开、自适应上下文切换、重编码对齐和事件体素密度增强,从稀疏事件流中实现高质量的视频重建、预测和帧插值,优于现有最先进方法。
LingBot-Video是一个13B的稀疏MoE视频扩散Transformer(1.4B激活参数),通过强化学习后训练为动作条件世界模型,权重和代码已开源。它包含一个由VLM评分的物理合理性奖励,并将其自身定位为策略评估器和动作规划器,但缺少闭环机器人实验结果。