ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing
Summary
ThinkV2V introduces a reasoning-driven framework that activates MLLM thinking before visual generation for instruction-guided video editing, using an MLLM-to-DiT architecture with progressive curriculum training and inference-time thinking scaling. The authors also release the ThinkV2V-150K dataset and ThinkV2V-Bench, showing their 5B DiT model outperforms larger 10B baselines.
View Cached Full Text
Cached at: 10/01/26, 04:21 AM
Paper page - ThinkV2V: Unleashing the Reasoning Capability of MLLMs for Instruction-Guided Video Editing
Source: https://huggingface.co/papers/2609.38541 Authors:
,
,
,
,
,
,
,
,
,
,
,
Abstract
Instruction-guidedvideoeditinghasmadesignificantprogress,yetexistingmethodsusemultimodallargelanguagemodels(MLLMs)primarilyassemanticencoders,sotheyoftenfallshortinworkingwithimpliciteditsthatrequirecausalorsemanticreasoning.Tobridgethisfundamentalgapinvideoediting,weproposeThinkV2V,areasoning-drivenframeworkforcomplexinstruction-guidedvideoediting,explicitlyactivatingMLLMthinkingbeforevisualgeneration.Atitscore,ThinkV2VbuildsonapracticalMLLM-to-DiTarchitecturetoturnexplicitthinkingoverthesourcevideoandinstructionintorefinedconditioningsignalsforvideoediting.Further,weequipitwithadedicatedtrainingandinferencerecipe,combiningProgressiveCurriculumTraining,whichgraduallycultivatesthemodelfrombasiceditingtoreasoning-intensivecases,withInference-TimeThinkingScaling,whichiterativelyrefinescandidatepromptsandselectsthemostreliableone,tobetterelicitreasoninginchallengingeditingscenarios.WealsocuratetheThinkV2V-150KdatasetandintroduceThinkV2V-Benchtosupporttrainingandevaluationofvideoeditingwithimplicitintentandcausalreasoning.Experimentalresultsdemonstratethestate-of-the-artperformanceofThinkV2Vonbothcomplexandstandardeditingscenarios,inwhichour5B-scaleDiTmodelsubstantiallyoutperformslarger10B-scalebaselines.
View arXiv pageView PDFProject pageGitHub4Add to collection
Models citing this paper0
No model linking this paper
Cite arxiv.org/abs/2609.38541 in a model README.md to link it from this page.
Datasets citing this paper0
No dataset linking this paper
Cite arxiv.org/abs/2609.38541 in a dataset README.md to link it from this page.
Spaces citing this paper0
No Space linking this paper
Cite arxiv.org/abs/2609.38541 in a Space README.md to link it from this page.
Collections including this paper0
No Collection including this paper
Add this paper to acollectionto link it from this page.
Similar Articles
VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization
This paper introduces a paradigm where Vision-Language Models (VLMs) act as test-time teachers to guide Video Generation Models (VGMs) via differentiable rewards and LoRA optimization, achieving a 16.7-point average improvement on video reasoning benchmarks.
Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning
The paper introduces Internalized Visual Thinking (IVT), a post-training framework that trains multimodal models to predict future frame embeddings, enabling direct answer generation without synthesizing intermediate images, thereby reducing latency over 5x for proactive video reasoning.
Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning
This paper introduces an agentic framework combining LLMs and VLMs for consistent multi-instruction video editing across multiple shots, and proposes the MMLVE task and benchmark to evaluate performance.
A Very Big Video Reasoning Suite
This paper introduces the Very Big Video Reasoning (VBVR) dataset and benchmark, a large-scale resource with over one million video clips across 200 reasoning tasks, enabling systematic study of spatiotemporal reasoning and showing early signs of emergent generalization.
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
VisualThink-VLA introduces a visual intermediate reasoning framework for vision-language-action policies that preserves spatial precision and dramatically reduces latency compared to text-based reasoning, achieving sub-second inference and state-of-the-art success rates on robot manipulation benchmarks.