StreamOPD: 一种用于流式视频理解的后训练方法,结合时空线索门控

Hugging Face Daily Papers 论文

摘要

StreamOPD通过使用在线策略蒸馏和时空线索门控的后训练方法,增强流式视频理解,在不依赖推理时内存的情况下实现了显著的基准改进。

流式视频理解要求对展开视频的因果观察前缀进行直接响应。现有系统添加了推理时内存、检索和压缩,然而一个无需训练的滑动窗口基线已经与之匹配。因此,我们固定了一个无内存的近窗口协议,并询问仅靠后训练能走多远。带可验证奖励的强化学习在这种情况下表现不佳,鼓励长“先思考后回答”的生成,而在线策略蒸馏(OPD)在学生轨迹上提供密集的词元级别教师监督,但只有在两个模型都以思考模式训练时才稳定。这些观察导致了StreamOPD,一种结合可验证流式视频数据、思考模式OPD和指令模式部署的方法。它将StreamingBench从77.9%提升到83.9%——与9B教师的差距在0.3个百分点内——并在不变推理下将OVO-Bench(不包括其幻觉检测子任务(HLD))提高了9.1个百分点。作为教师特权扩展,时空线索门控(ST-CueGate)将线索与无线索教师似然比聚合成一个组相对响应分数,该分数重新加权OPD。它在OVO-Bench(不包括HLD)上达到71.9%,在Video-MME上达到64.9%,并且是唯一在所有四个基准上保持高于基础模型的变体。将教师替换为学生初始策略的冻结副本——在线策略自蒸馏——保留了大部分这些增益,并将HLD提升到57.0%,高于未训练的学生和9B教师,因此弃权损失并非该方法所固有。我们为开源流式视频研究提供了一个透明且可复现的参考。
查看原文
查看缓存全文

缓存时间: 2026/08/18 19:53

论文页面 - StreamOPD:基于时空线索门控的流式视频理解训练后优化方案

来源:https://huggingface.co/papers/2608.16320

摘要

StreamOPD通过采用带有可验证奖励的同策略蒸馏和时空线索门控机制,提升了流式视频理解能力,无需推理时内存开销即可达到接近教师模型的性能。

流式视频理解要求从正在展开的视频的因果观测前缀中直接生成响应。现有系统通常在推理时加入记忆、检索与压缩模块,但一个无需训练的滑动窗口基线方法已能与它们性能相当。因此,我们固定采用无记忆的近期窗口协议,并探究仅通过训练后优化能达到何种程度。基于可验证奖励的强化学习(https://huggingface.co/papers?q=verifiable%20rewards)并不适用于此场景,因为它会鼓励生成冗长的“先思考后回答”式内容;而同策略蒸馏(https://huggingface.co/papers?q=on-policy%20distillation)(OPD)能为学生模型轨迹提供密集的token级教师监督,但仅当两个模型都在思考模式(https://huggingface.co/papers?q=thinking%20mode)下训练时才稳定。这些观察促成了StreamOPD(https://huggingface.co/papers?q=StreamOPD)的提出,该方案结合了可验证的流式视频数据、思考模式OPD以及指令模式部署。它将StreamingBench分数从77.9%提升至83.9%——仅比9B教师模型低0.3个点——并在不改变推理过程的前提下,将OVO-Bench(除其幻觉检测子任务HLD外)提升了9.1个点。作为一项教师特权扩展,时空线索门控(https://huggingface.co/papers?q=Spatio-Temporal%20CueGate)(ST-CueGate)(https://huggingface.co/papers?q=ST-CueGate)将线索与无线索的教师似然比汇总为组相对响应分数,用于重新加权OPD。它在OVO-Bench(除HLD外)达到71.9%,在Video-MME上达到64.9%,并且是唯一一个在所有四个基准测试中均超越基础模型的变体。将教师模型替换为学生初始策略的冻结副本——即同策略自蒸馏(https://huggingface.co/papers?q=on-policy%20self-distillation)——能保留大部分这些收益,并将HLD提升至57.0%,超过未经训练的学生和9B教师模型,这表明拒绝损失(https://huggingface.co/papers?q=abstention%20loss)并非该方案的固有组成部分。我们为开源流式视频研究提供了一个透明且可复现的参考实现。

查看arXiv页面 (https://arxiv.org/abs/2608.16320) 查看PDF (https://arxiv.org/pdf/2608.16320) 项目主页 (https://unix-ai-lab.github.io/StreamOPD/) GitHub4 (https://github.com/UniX-AI-Lab/StreamOPD) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16320)

引用本文的模型 1

UniX-Lab/StreamOPD-4B-ST-CueGate Video-Text-to-Text• 5B• 更新于约17小时前 • 9 (https://huggingface.co/UniX-Lab/StreamOPD-4B-ST-CueGate)

引用本文的数据集 0

无关联数据集

在数据集的README.md中引用arxiv.org/abs/2608.16320,即可将此页面链接至该数据集。

引用本文的空间 0

无关联空间

在空间的README.md中引用arxiv.org/abs/2608.16320,即可将此页面链接至该空间。

包含本文的收藏 0

无收藏包含本文

将本文添加到收藏 (https://huggingface.co/new-collection),即可将此页面链接至该收藏。

相似文章

Simple-OPD: Demystifying Warm-up for On-policy Distillation

arXiv cs.CL

This paper investigates the warm-up stage for on-policy distillation (OPD), showing that teacher-compatible chain-of-thought supervision and LoRA-based training with near-saturation duration improve OPD effectiveness. It introduces Simple-OPD, a plug-and-play initialization method that boosts OPD performance across diverse settings.

DanceOPD:基于策略的生成场蒸馏

Hugging Face Daily Papers

DanceOPD提出了一种基于策略的生成场蒸馏框架,用于流匹配模型。该框架通过能力特定路由和基于速度的训练,统一了文本到图像生成、局部编辑和全局编辑,在保持基准生成质量的同时,提升了多能力组合。

On-policy distillation: 在PapersWithCode上最热门术语之一 [R]

Reddit r/MachineLearning

Hugging Face的Niels介绍了On-policy Distillation (OPD),这是一种关键的后训练技术,用于Qwen 3.6/3.7、GLM-5.1和DeepSeek-V4等模型。该技术现已收录于PapersWithCode,并附有Sasha Rush和Dwarkesh Patel的白板讲解链接。