video-diffusion

标签

Cards List
#video-diffusion

@songhan_mit: 光速块稀疏注意力:

X AI KOLs Following · 1小时前 缓存

Sol-Engine 每周更新宣布集成 Sol Attention,一种用于视频扩散的无需训练的稀疏注意力方法,完整论文将于下周发布。

0 人收藏 0 人点赞
#video-diffusion

从低重叠拍摄进行4D人体-场景重建

Hugging Face Daily Papers · 2026-07-10 缓存

提出StudioRecon,一种从低重叠相机拍摄中进行4D人体-场景重建的方法,使用背景(视频扩散)和人体(SMPL)的独立先验,并带有递归增强模块。已被SIGGRAPH 2026接收,在PSNR上超越先前方法+1.5至+5.0 dB。

0 人收藏 0 人点赞
#video-diffusion

灵活视频扩散(3分钟阅读)

TLDR AI · 2026-07-10 缓存

Flex-Forcing提出了一个统一的视频扩散框架,支持自回归和双向生成模式,为视频生成任务提供灵活的控制。

0 人收藏 0 人点赞
#video-diffusion

LongE2V: 基于视频扩散模型的长时段事件视频重建、预测与帧插值

Hugging Face Daily Papers · 2026-07-09 缓存

LongE2V利用预训练的视频扩散先验,并引入自回归展开、自适应上下文切换、重编码对齐和事件体素密度增强,从稀疏事件流中实现高质量的视频重建、预测和帧插值,优于现有最先进方法。

0 人收藏 0 人点赞
#video-diffusion

LingBot-Video: 稀疏MoE视频扩散Transformer(总参数13B,激活参数1.4B)后训练为动作条件世界模型[R]

Reddit r/MachineLearning · 2026-07-08

LingBot-Video是一个13B的稀疏MoE视频扩散Transformer(1.4B激活参数),通过强化学习后训练为动作条件世界模型,权重和代码已开源。它包含一个由VLM评分的物理合理性奖励,并将其自身定位为策略评估器和动作规划器,但缺少闭环机器人实验结果。

0 人收藏 0 人点赞
#video-diffusion

MV-Forcing:通过4D基底的时空自强迫实现长时间多视角视频生成

Hugging Face Daily Papers · 2026-07-06 缓存

MV-Forcing 提出了一种扩散框架,结合时间自回归和视角自回归,生成动态场景的长时间多视角一致视频。通过使用4D几何桥梁和时空蒸馏,实现基于少步学生模型的任意长度视频生成。

0 人收藏 0 人点赞
#video-diffusion

视频扩散模型在手部运动重建中的惊人有效性

Hugging Face Daily Papers · 2026-06-29 缓存

ViDiHand 利用预训练的视频扩散模型表示,直接从自我中心视频帧中重建4D手部运动,无需检测器或优化,在ARCTIC、HOT3D和HOI4D上优于现有方法。

0 人收藏 0 人点赞
#video-diffusion

@songhan_mit: 我们开发了一种基于智能体的原生方法来加速生成式AI,延续了KDA(内核设计智能体)在更高层次上的成功…

X AI KOLs Following · 2026-06-25 缓存

Enze Xie 宣布推出 Sol Video Inference Engine,这是一个基于智能体的原生、无需训练的全栈加速器,用于视频扩散,能够自动调整缓存、稀疏注意力、令牌剪枝、量化和内核融合,在像 64B Cosmos3-Super 和 22B LTX-2.3 这样的大模型上实现了 >2 倍的端到端加速。

0 人收藏 0 人点赞
#video-diffusion

从视频扩散潜变量生成三角片元(5分钟阅读)

TLDR AI · 2026-06-25 缓存

FLAT 是一种方法,能够直接从压缩的视频扩散潜变量中,通过单次前向传递解码出显式的三角片元,从而提升几何精度,同时支持快速光栅化和基于物理的交互。

0 人收藏 0 人点赞
#video-diffusion

世界模型自蒸馏:训练世界模型解决通用任务

Hugging Face Daily Papers · 2026-06-10 缓存

一个可扩展的框架结合了自蒸馏和强化学习,将任务解决能力从视觉语言模型迁移到视频扩散模型,无需标注的任务-视频数据。

0 人收藏 0 人点赞
#video-diffusion

FadeMem: 距离感知的记忆整合用于自回归视频扩散

Hugging Face Daily Papers · 2026-06-09 缓存

FadeMem 引入了一种距离感知的键值记忆整合机制,将历史视频数据组织成时间层次结构,在固定缓存约束下改进长视频生成。

0 人收藏 0 人点赞
#video-diffusion

Steady-Forcing: 在长时域自然视频扩散中平衡空间持久性与运动连续性

Hugging Face Daily Papers · 2026-06-02 缓存

Steady-Forcing 提出了一种记忆与训练框架,旨在长时域自然视频生成中平衡空间稳定性与运动连续性,在保持流体动态持续多分钟滚动生成的同时,提升背景一致性。

0 人收藏 0 人点赞
#video-diffusion

ByteDance/Bernini-R

Hugging Face Models Trending · 2026-06-01 缓存

字节跳动开源了 Bernini-R,一种视频扩散渲染器,结合了基于 MLLM 的语义规划器和基于 DiT 的渲染器,用于统一的视频生成和编辑,在视频编辑上达到顶尖性能。

0 人收藏 0 人点赞
#video-diffusion

τ_0-WM: 用于机器人操作的统一视频-动作世界模型

Hugging Face Daily Papers · 2026-05-31 缓存

τ_0-WM是一个统一的视频-动作世界模型,用于机器人操作,它通过共享的视频扩散主干集成了策略学习、视频预测和动作评估。在具有挑战性的长周期和细粒度任务上表现出卓越性能。

0 人收藏 0 人点赞
#video-diffusion

LVSA: 用于长视频扩散的无训练稀疏注意力

Hugging Face Daily Papers · 2026-05-29 缓存

LVSA 为视频扩散模型引入了一种无训练稀疏注意力机制,将计算量减少高达 3.17 倍,同时能够在训练时长之外进行生成,且无质量损失。

0 人收藏 0 人点赞
#video-diffusion

VideoMLA:用于分钟级自回归视频扩散的低秩潜变量KV缓存

Hugging Face Daily Papers · 2026-05-28 缓存

VideoMLA 用共享的低秩潜变量和解耦的 3D-RoPE 位置键替换了视频扩散模型中每个头的 KV 缓存,在 B200 上将每个 token 的 KV 内存降低了 92.7%,吞吐量提升了 1.23 倍,同时在 VBench 基准测试中保持了质量。

0 人收藏 0 人点赞
#video-diffusion

量化键偷走注意力:视频扩散中KV缓存压缩的偏差校正

arXiv cs.LG · 2026-05-27 缓存

本文指出,在分块自回归视频扩散的KV缓存压缩中,对键进行量化会导致注意力权重出现偏差,并提出了一种每注意力分数校正方法,该方法以可忽略的开销消除偏差,在INT2量化下恢复接近BF16的视频质量。

0 人收藏 0 人点赞
#video-diffusion

SCOPE:针对FPS世界模型在可玩环境中模拟跨游戏操作

Hugging Face Daily Papers · 2026-05-22 缓存

SCOPE提出了一种方法,通过在视频扩散模型的Transformer块中引入条件模块,将作用域内效果与作用域外视觉效果分离,无需分割标签,实现FPS游戏中的精确动作响应,并推出了CrossFPS,这是一个多游戏数据集,支持零样本跨游戏迁移。

0 人收藏 0 人点赞
#video-diffusion

WorldKV:基于世界检索与压缩的高效世界记忆

Hugging Face Daily Papers · 2026-05-21 缓存

WorldKV 是一个无需训练的框架,它检索并压缩键值缓存块,以在视频扩散世界生成中保持长期一致性,在匹配全记忆保真度的同时实现更高吞吐量。

0 人收藏 0 人点赞
#video-diffusion

FlowLong: 基于流形约束Tweedie匹配的推理时长视频生成

Hugging Face Daily Papers · 2026-05-20 缓存

一种新颖的推理时长视频生成方法,使用重叠滑动窗口结合Tweedie匹配和随机早期阶段采样,在不额外训练的情况下提高时间一致性和视觉质量。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈