Tag
DRIFT is a framework that adapts pretrained vision-language models for continuous output decoding by combining coarse prediction with iterative flow matching refinement, improving performance on perception and planning tasks.