EffectLearner:面向真实世界视频物体移除的世界感知物体-效果推理
摘要
EffectLearner 是一个面向真实世界视频物体移除的语义推理增强框架,它将基于 VLM 的物体-效果推理器与基于 DiT 的视频擦除器相结合,并引入了 EffectWorld 数据集以处理复杂的物体引发效果。
查看缓存全文
缓存时间: 2026/08/07 09:56
论文页面 - EffectLearner:面向真实世界视频物体移除的世界感知物体-效果推理
来源:https://huggingface.co/papers/2608.05565
相似文章
MemLearner:学习为视频世界模型查询上下文记忆
MemLearner 提出了一种基于学习的自适应上下文查询方法,使用查询令牌来改善视频世界模型中的场景一致性和记忆,特别适用于具有遮挡和动态物体的长序列。
VideoKR:面向知识和推理密集型视频理解
VideoKR 引入了一个大规模视频推理数据集和基准,旨在通过专家领域内容和人机协同的示例生成,增强知识密集型视频理解。该数据集包含 31.5万个视频推理示例,覆盖 14.5万个专家领域视频。
LEMUR:基于视觉锚定推理重定向的潜在熵感知多模态遗忘
本文揭示了经过强化学习训练的多模态大型推理模型中的一个隐私漏洞:即使在最终答案中成功消除了敏感事实,模型仍可能在推理轨迹中重现这些事实。为此,本文提出LEMUR,一个无需训练、推理时运行的框架,利用熵动态来检测并抑制此类泄露。
LeAct:从专家动作中学习推理
LeAct 提出了一种方法,通过将链式思维(CoT)视为潜在变量,仅保留那些能显著提高学生复现专家动作概率的 CoT,从而从静默专家动作中恢复链式思维推理。在游戏和机器人任务中,该方法优于各类基线。
Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning
Introduces Latent Dynamics Reasoning (LDR), a video world model that integrates kinematic dynamics in a structured latent space, enabling extrapolation of learned dynamics far beyond training distributions while using far fewer parameters and running much faster than video diffusion baselines.