video-diffusion

标签

Cards List
#video-diffusion

Ring Forcing:迈向自回归视频扩散的精确长期记忆

Hugging Face Daily Papers · 2026-08-27 缓存

Ring Forcing 是一个自回归视频扩散框架,通过环形结构训练、历史压缩和稀疏旋转嵌入,增强长期记忆以实现精确的分钟级视频连贯性。

0 人收藏 0 人点赞
#video-diffusion

4DAnyone:从普通单目视频创建4D人物

Hugging Face Daily Papers · 2026-08-20 缓存

4DAnyone通过生成多视角一致视频并将其提升到4D高斯溅射,从单目视频重建4D人物,并使用参考和目标上下文设计来解决扩展瓶颈。

0 人收藏 0 人点赞
#video-diffusion

AnyTalk:利用视频生成模型为任意角色生成语音动画

Hugging Face Daily Papers · 2026-08-17 缓存

AnyTalk 通过角色特定微调适应视频扩散模型,并优化混合形状参数,无需动画数据即可为任意角色生成 3D 语音动画,并提供实时蒸馏变体。

0 人收藏 0 人点赞
#video-diffusion

Marionette:预测世界状态、渲染几何、描绘外观

Hugging Face Daily Papers · 2026-08-14 缓存

Marionette引入了一种世界模型,该模型显式预测用于交互式游戏的三维关节状态,通过零参数渲染器解耦几何渲染,并使用扩散模型进行外观合成,提高了可控性和长期一致性。

0 人收藏 0 人点赞
#video-diffusion

@_akhaliq:SCoPE 用于视频扩散Transformer的视线坐标位置编码 模型:https://huggingface.co/TencentAR…

X AI KOLs Timeline · 2026-08-13 缓存

SCoPE 是 TencentARC 提出的一个模型,它将相机视线作为位置坐标添加到预训练的视频扩散 Transformer 中,从而能够在保持图像到视频先验的同时实现相机轨迹控制。该发布包含一个用于 Wan2.2-I2V-A14B 推理的自包含检查点。

0 人收藏 0 人点赞
#video-diffusion

LiveAnimate:实时稳定长时流式人体动画

Hugging Face Daily Papers · 2026-08-13 缓存

LiveAnimate 提出了一个14B参数的视频扩散Transformer,通过PR-Sink注意力机制实现了实时、长时、姿态驱动的人体动画,具有稳定流式生成和恒定内存占用。在两个H100 GPU上实现了19.63 FPS的推理速度,在长达三分钟的流中保持质量。

0 人收藏 0 人点赞
#video-diffusion

超越像素:从视频先验到4D世界

Hugging Face Daily Papers · 2026-08-11 缓存

本文介绍了Latent-to-4D,一种直接从视频扩散潜变量生成4D场景的方法,无需跨生成器重新训练,在几何和时间稳定性上优于级联方法。

0 人收藏 0 人点赞
#video-diffusion

MirrorWorld:驯服视频扩散模型以生成镜面反射

Hugging Face Daily Papers · 2026-08-07 缓存

MirrorWorld 是一个反射感知的视频修复框架,通过分别建模语义内容(SRD)和几何空间排布(GTA)来改善视频中的镜面反射生成,相比现有的基于图像和视频修复的基线方法,取得了更好的反射重建效果。

0 人收藏 0 人点赞
#video-diffusion

UniWorld-View:基于视频扩散模型的大基线视图合成

Hugging Face Daily Papers · 2026-08-05 缓存

提出了UniWorld-View,一个用于从单目输入进行大基线新视图合成的统一框架,将遮挡感知的点云渲染与视频扩散模型相结合,以实现精确的相机控制和几何一致性。

0 人收藏 0 人点赞
#video-diffusion

TenStrip/10Eros-Max

Hugging Face Models Trending · 2026-08-04 缓存

TenStrip/10Eros-Max是一个实验性AI模型,通过正交投影从LTX 2.3、Wan 2.2和Krea 2视频与图像扩散模型中迁移学习模式,以修改MiniMax H3基础模型,增强美学与运动特性,同时保留核心视频和音频功能。

0 人收藏 0 人点赞
#video-diffusion

Mirror Learning

arXiv cs.LG · 2026-08-03 缓存

This paper proposes 'Mirror Learning', a framework for imitation learning from third-person observation that uses a fine-tuned video diffusion model for perspective transformation and an inverse dynamics model to synthesize pseudo first-person expert data, showing that this mirror data alone can train effective policies and improve behavior cloning.

0 人收藏 0 人点赞
#video-diffusion

DreamTraj:通过读取未渲染视频扩散潜变量生成6DoF物体轨迹

Hugging Face Daily Papers · 2026-08-01 缓存

DreamTraj通过解码内部视频扩散潜变量,从单个RGB图像和语言指令预测6自由度物体轨迹,在推理时无需视频、深度或CAD模型。它引入了具有细粒度语言-运动标注的MOVE数据集,实现了最先进的性能,同时运行速度比先生成后提取的流水线快4.6倍。

0 人收藏 0 人点赞
#video-diffusion

基于静止状态观察的铰接物体重建

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了一种静止状态框架,该框架从单个闭合配置中重建铰接物体,利用显式网格、视觉-语言输出和视频扩散模型来生成并验证关节假设,而无需观测运动。

0 人收藏 0 人点赞
#video-diffusion

带有世界状态寄存器的流式多智能体自回归扩散模型

Hugging Face Daily Papers · 2026-07-23 缓存

WorldWeaver (W²) 将跨智能体世界状态寄存器引入多智能体视频扩散模型,实现跨智能体和视图的共享世界状态持久化,提升了双智能体 Minecraft 视频生成的逻辑一致性。

0 人收藏 0 人点赞
#video-diffusion

@songhan_mit: 光速块稀疏注意力:

X AI KOLs Following · 2026-07-21 缓存

Sol-Engine 每周更新宣布集成 Sol Attention,一种用于视频扩散的无需训练的稀疏注意力方法,完整论文将于下周发布。

0 人收藏 0 人点赞
#video-diffusion

AlayaWorld: 交互式长视界世界建模 -- 完整技术报告

Hugging Face Daily Papers · 2026-07-20 缓存

AlayaWorld是一个150亿参数的交互式视频世界模型,可生成24帧/秒的540p和720p视频,采用自回归潜变量块生成、受限视觉上下文以及蒸馏技术来减少推理步骤。它在长视界生成基准iWorld-Bench上达到了最先进的性能。

0 人收藏 0 人点赞
#video-diffusion

从低重叠拍摄进行4D人体-场景重建

Hugging Face Daily Papers · 2026-07-10 缓存

提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。

0 人收藏 0 人点赞
#video-diffusion

灵活视频扩散(3分钟阅读)

TLDR AI · 2026-07-10 缓存

Flex-Forcing提出了一个统一的视频扩散框架,支持自回归和双向生成模式,为视频生成任务提供灵活的控制。

0 人收藏 0 人点赞
#video-diffusion

LongE2V: 基于视频扩散模型的长时段事件视频重建、预测与帧插值

Hugging Face Daily Papers · 2026-07-09 缓存

LongE2V利用预训练的视频扩散先验,并引入自回归展开、自适应上下文切换、重编码对齐和事件体素密度增强,从稀疏事件流中实现高质量的视频重建、预测和帧插值,优于现有最先进方法。

0 人收藏 0 人点赞
#video-diffusion

LingBot-Video: 稀疏MoE视频扩散Transformer(总参数13B,激活参数1.4B)后训练为动作条件世界模型[R]

Reddit r/MachineLearning · 2026-07-08

LingBot-Video是一个13B的稀疏MoE视频扩散Transformer(1.4B激活参数),通过强化学习后训练为动作条件世界模型,权重和代码已开源。它包含一个由VLM评分的物理合理性奖励,并将其自身定位为策略评估器和动作规划器,但缺少闭环机器人实验结果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈