StreamOPD: 一种用于流式视频理解的后训练方法,结合时空线索门控
摘要
StreamOPD通过使用在线策略蒸馏和时空线索门控的后训练方法,增强流式视频理解,在不依赖推理时内存的情况下实现了显著的基准改进。
查看缓存全文
缓存时间: 2026/08/18 19:53
论文页面 - StreamOPD:基于时空线索门控的流式视频理解训练后优化方案
来源:https://huggingface.co/papers/2608.16320
摘要
StreamOPD通过采用带有可验证奖励的同策略蒸馏和时空线索门控机制,提升了流式视频理解能力,无需推理时内存开销即可达到接近教师模型的性能。
流式视频理解要求从正在展开的视频的因果观测前缀中直接生成响应。现有系统通常在推理时加入记忆、检索与压缩模块,但一个无需训练的滑动窗口基线方法已能与它们性能相当。因此,我们固定采用无记忆的近期窗口协议,并探究仅通过训练后优化能达到何种程度。基于可验证奖励的强化学习(https://huggingface.co/papers?q=verifiable%20rewards)并不适用于此场景,因为它会鼓励生成冗长的“先思考后回答”式内容;而同策略蒸馏(https://huggingface.co/papers?q=on-policy%20distillation)(OPD)能为学生模型轨迹提供密集的token级教师监督,但仅当两个模型都在思考模式(https://huggingface.co/papers?q=thinking%20mode)下训练时才稳定。这些观察促成了StreamOPD(https://huggingface.co/papers?q=StreamOPD)的提出,该方案结合了可验证的流式视频数据、思考模式OPD以及指令模式部署。它将StreamingBench分数从77.9%提升至83.9%——仅比9B教师模型低0.3个点——并在不改变推理过程的前提下,将OVO-Bench(除其幻觉检测子任务HLD外)提升了9.1个点。作为一项教师特权扩展,时空线索门控(https://huggingface.co/papers?q=Spatio-Temporal%20CueGate)(ST-CueGate)(https://huggingface.co/papers?q=ST-CueGate)将线索与无线索的教师似然比汇总为组相对响应分数,用于重新加权OPD。它在OVO-Bench(除HLD外)达到71.9%,在Video-MME上达到64.9%,并且是唯一一个在所有四个基准测试中均超越基础模型的变体。将教师模型替换为学生初始策略的冻结副本——即同策略自蒸馏(https://huggingface.co/papers?q=on-policy%20self-distillation)——能保留大部分这些收益,并将HLD提升至57.0%,超过未经训练的学生和9B教师模型,这表明拒绝损失(https://huggingface.co/papers?q=abstention%20loss)并非该方案的固有组成部分。我们为开源流式视频研究提供了一个透明且可复现的参考实现。
查看arXiv页面 (https://arxiv.org/abs/2608.16320) 查看PDF (https://arxiv.org/pdf/2608.16320) 项目主页 (https://unix-ai-lab.github.io/StreamOPD/) GitHub4 (https://github.com/UniX-AI-Lab/StreamOPD) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16320)
引用本文的模型 1
UniX-Lab/StreamOPD-4B-ST-CueGate Video-Text-to-Text• 5B• 更新于约17小时前 • 9 (https://huggingface.co/UniX-Lab/StreamOPD-4B-ST-CueGate)
引用本文的数据集 0
无关联数据集
在数据集的README.md中引用arxiv.org/abs/2608.16320,即可将此页面链接至该数据集。
引用本文的空间 0
无关联空间
在空间的README.md中引用arxiv.org/abs/2608.16320,即可将此页面链接至该空间。
包含本文的收藏 0
无收藏包含本文
将本文添加到收藏 (https://huggingface.co/new-collection),即可将此页面链接至该收藏。
相似文章
OPSD-V: 面向后训练少步自回归视频生成器的在线策略自蒸馏
OPSD-V 通过使用真实长视频数据作为训练时的时间上下文,提供密集的轨迹级监督,从而增强视觉质量和运动动态,同时不改变推理机制,改进了少步自回归视频扩散模型。
Simple-OPD: Demystifying Warm-up for On-policy Distillation
This paper investigates the warm-up stage for on-policy distillation (OPD), showing that teacher-compatible chain-of-thought supervision and LoRA-based training with near-saturation duration improve OPD effectiveness. It introduces Simple-OPD, a plug-and-play initialization method that boosts OPD performance across diverse settings.
D-OPSD:面向连续微调步骤蒸馏扩散模型的在线策略自蒸馏
本文介绍了 D-OPSD,一种用于步骤蒸馏扩散模型的新型训练范式,能够在监督微调过程中实现在线策略自蒸馏。该方法使模型能够在不损害其高效少步推理能力的前提下,学习新概念或新风格。
DanceOPD:基于策略的生成场蒸馏
DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。
On-policy distillation: 在PapersWithCode上最热门术语之一 [R]
Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。