EffectLearner:面向真实世界视频物体移除的世界感知物体-效果推理

Hugging Face Daily Papers 论文

摘要

EffectLearner 是一个面向真实世界视频物体移除的语义推理增强框架,它将基于 VLM 的物体-效果推理器与基于 DiT 的视频擦除器相结合,并引入了 EffectWorld 数据集以处理复杂的物体引发效果。

视频物体移除不仅需要消除目标物体,还需要消除其引发的效果,同时保持高保真度和时空一致的修复。现有方法主要从预定义效果类别和固定数据分布中隐式学习物体-效果对应关系,限制了它们对复杂真实世界场景的泛化能力,这些场景涉及组合效果、空间分离或弱相关效果、长尾物理现象以及动态演变的交互。我们提出了 EffectLearner,一个语义推理增强框架,将基于 VLM 的物体-效果推理器与基于 DiT 的视频擦除器相结合。在结构化效果分析提示的引导下,推理器对目标高亮视频进行跨模态推理,并提取紧凑的效果感知上下文,从而引导视频擦除器实现全面的物体-效果移除。运动感知掩码引导和运动一致性监督进一步提高了物体运动和场景动态演变下的移除覆盖率与时空稳定性。为了在具有挑战性的真实世界场景中充分利用该框架,我们进一步构建了 EffectWorld,一个专门针对复杂物体引发效果设计的成对视频数据集,并引入了一种将通用监督与复杂效果数据相结合的渐进式训练课程。在标准 ROSE-Bench 上,EffectLearner 在大多数指标上优于现有基线方法,并在 EffectWorld-Eval 和具有挑战性的 EffectWorld-Wild 上均取得明显优势,展示了其在复杂真实世界场景中提供高质量视频物体移除的能力。
查看原文
查看缓存全文

缓存时间: 2026/08/07 09:56

论文页面 - EffectLearner:面向真实世界视频物体移除的世界感知物体-效果推理

来源:https://huggingface.co/papers/2608.05565

相似文章

VideoKR:面向知识和推理密集型视频理解

Hugging Face Daily Papers

VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。

LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘

arXiv cs.LG

本文揭示了经过强化学习训练的多模态大型推理模型中的一个隐私漏洞:即使在最终答案中成功消除了敏感事实,模型仍可能在推理轨迹中重现这些事实。为此,本文提出LEMUR,一个无需训练、推理时运行的框架,利用熵动态来检测并抑制此类泄露。

LeAct:从专家动作中学习推理

arXiv cs.CL

LeAct 提出了一种方法,通过将链式思维(CoT)视为潜在变量,仅保留那些能显著提高学生复现专家动作概率的 CoT,从而从静默专家动作中恢复链式思维推理。在游戏和机器人任务中,该方法优于各类基线。