高效推理蒸馏:通过合成思维链与难度感知微调的小型视频语言模型
摘要
本文提出了一种方法,利用合成的思维链理由和难度感知微调,将推理能力蒸馏到紧凑的视频语言模型中,使较小的模型能够在最小的计算开销下超越较大的模型。
arXiv:2609.16255v1 公告类型:新
摘要:我们提出了一种高效的方法,将推理能力蒸馏到紧凑的视频语言模型(VLMs)中,用于视频问答(VideoQA)。我们的方法使用仅约$\sim$900个不确定性选择的示例来微调一个2B参数模型,每个示例都通过一个4B教师生成的合成思维链(CoT)理由进行增强。尽管计算开销极小——在单个A100 GPU上不到两小时——我们的方法使2B模型能够超越多达4$\times$更大的VLMs,并在CinePile、ActivityNet-QA和MLVU上泛化,接近其自身4B教师的性能。一个关键发现是,将CoT理由置于答案之后——与标准提示相反——显著提高了紧凑模型的推理能力。这一见解挑战了现有的CoT惯例,并揭示了在有限模型容量下的新对齐策略。我们的发现为训练可部署的、推理丰富的VLMs提供了实用蓝图,适用于移动和边缘应用。
查看缓存全文
缓存时间: 2026/09/16 08:45
# 高效推理蒸馏:基于合成思维链与难度感知微调的小型视频语言模型 来源:https://arxiv.org/html/2609.16255 Mantek Singh✉https://orcid.org/0009-0008-1556-7452Jeshwanth Challagundlahttps://orcid.org/0009-0005-5106-3743 隶属单位:卡内基梅隆大学,匹兹堡,美国 Siddharth Rainahttps://orcid.org/0009-0001-8745-0199 隶属单位:Meta,桑尼维尔,美国 Jasmin Jarsaniahttps://orcid.org/0009-0005-4713-3614 隶属单位:德克萨斯大学阿灵顿分校,德克萨斯州,美国 ###### 摘要 我们提出了一种高效方法,将推理能力蒸馏到紧凑的视频-语言模型(VLMs)中,用于视频问答(VideoQA)。我们的方法仅使用约900个不确定性筛选的样本对一个20亿参数模型进行微调,每个样本都通过40亿参数的教师模型生成的合成思维链(CoT)推理进行增强。尽管计算成本极低——在单个A100 GPU上运行不到两小时——我们的方法使得20亿参数的模型能够超越规模大至4倍的VLMs,并且在CinePile、ActivityNet-QA和MLVU上实现泛化,性能接近其自身的40亿参数教师模型。一个关键发现是:将CoT推理置于答案*之后*(与标准提示方式相反)显著提升了紧凑模型的推理能力。这一洞察挑战了现有的CoT惯例,并揭示了在有限模型容量下新的对齐策略。我们的研究结果为训练适合移动和边缘应用、具备丰富推理能力的可部署VLMs提供了实用蓝图。 ###### 关键词:视觉-语言模型 视频理解 思维链推理 高效微调 合成数据生成 不确定性估计 多模态学习 ## 1 引言 视频内容的激增要求开发适用于边缘设备的高效视频-语言模型(VLMs),但目前的模型对于在资源受限环境中部署来说过于庞大\[34 (https://arxiv.org/html/2609.16255#bib.bib1),7 (https://arxiv.org/html/2609.16255#bib.bib2)\]。本文旨在解决对紧凑且具有强大推理能力的VLMs的需求,以用于视频问答(VideoQA)。传统的视频QA数据集成本高昂、涉及隐私且常存在偏差\[32 (https://arxiv.org/html/2609.16255#bib.bib4),48 (https://arxiv.org/html/2609.16255#bib.bib5),6 (https://arxiv.org/html/2609.16255#bib.bib6)\],因此合成数据成为一种可扩展且保护隐私的数据增强替代方案\[22 (https://arxiv.org/html/2609.16255#bib.bib7),49 (https://arxiv.org/html/2609.16255#bib.bib8)\]。我们提出了一个样本高效框架,将推理能力从40亿参数的教师模型(InternVL2-4B)蒸馏到20亿参数的学生模型(InternVL2-2B)。我们的方法结合了两种核心策略: - • 合成思维链(CoT)生成:受LLMs\[41 (https://arxiv.org/html/2609.16255#bib.bib10),50 (https://arxiv.org/html/2609.16255#bib.bib3),2 (https://arxiv.org/html/2609.16255#bib.bib11)\]的启发,我们使用40亿参数的VLM生成简洁的CoT推理。这消除了对人工标注的需求\[15 (https://arxiv.org/html/2609.16255#bib.bib12),47 (https://arxiv.org/html/2609.16255#bib.bib13),16 (https://arxiv.org/html/2609.16255#bib.bib14)\],并允许我们探索适合紧凑模型的格式。 - • 用于微调的困难样本选择:我们不使用大型数据集,而是针对通过模型估计的难度和前2预测间隔(基于不确定性的采样)识别出的高价值训练点进行微调\[33 (https://arxiv.org/html/2609.16255#bib.bib15),23 (https://arxiv.org/html/2609.16255#bib.bib16)\],这与困难样本挖掘\[36 (https://arxiv.org/html/2609.16255#bib.bib18),40 (https://arxiv.org/html/2609.16255#bib.bib17)\]的理念一致。 我们在CinePile基准测试\[26 (https://arxiv.org/html/2609.16255#bib.bib9)\]上验证了我们的方法,并在ActivityNet-QA\[46 (https://arxiv.org/html/2609.16255#bib.bib19)\]和MLVU\[52 (https://arxiv.org/html/2609.16255#bib.bib51)\]上测试了泛化能力。我们的主要发现包括: - • 合成的CoT推理,即使来自小型的40亿参数教师模型,也能显著提升性能。 - • 基于前2间隔的采样策略始终优于其他选择策略。 - • 将推理置于答案*之后*显著提升了小模型的推理能力,这与标准的CoT提示方式相反。 - • 仅在900个样本(<0.5%的训练数据)上微调即可带来巨大且高效的收益。 - • 这些改进在未见的数据集和领域上具有强大的泛化能力。 据我们所知,这是首项将小规模CoT蒸馏、不确定性引导采样和格式感知的推理设计相结合的工作,为紧凑VLMs在现实世界部署约束下提供了一种实用且富含推理能力的对齐方案。更多结果、消融分析和定性示例请参见补充材料。 ## 2 相关工作 ### 2.1 合成数据与知识蒸馏 合成数据通过生成模型\[8 (https://arxiv.org/html/2609.16255#bib.bib22),12 (https://arxiv.org/html/2609.16255#bib.bib23),28 (https://arxiv.org/html/2609.16255#bib.bib24)\]等方法生成,解决了视觉领域中的数据稀缺和隐私限制问题\[22 (https://arxiv.org/html/2609.16255#bib.bib7),27 (https://arxiv.org/html/2609.16255#bib.bib20),30 (https://arxiv.org/html/2609.16255#bib.bib21)\]。虽然最近的VLMs可以直接从视觉输入生成问答对\[17 (https://arxiv.org/html/2609.16255#bib.bib25),49 (https://arxiv.org/html/2609.16255#bib.bib8)\],但我们的工作强调通过思维链(CoT)蒸馏侧重于推理的合成推理,而非直接的问答生成。知识蒸馏将表征从大型“教师”模型迁移到较小的“学生”模型\[10 (https://arxiv.org/html/2609.16255#bib.bib26),29 (https://arxiv.org/html/2609.16255#bib.bib27),31 (https://arxiv.org/html/2609.16255#bib.bib28)\]。然而,小型模型(<<3B)由于容量有限,常常难以吸收复杂的监督信号\[16 (https://arxiv.org/html/2609.16255#bib.bib14)\]。虽然像AoTD\[51 (https://arxiv.org/html/2609.16255#bib.bib47)\]这样的方法引入了大规模的视频推理蒸馏,但它们依赖于大量的监督。相反,我们证明了使用一个适度的40亿参数教师模型和仅900个训练样本就能实现强大的推理提升,使得边缘部署成为可能。 ### 2.2 思维链推理与困难样本选择 CoT提示通过鼓励中间步骤来提高推理能力\[41 (https://arxiv.org/html/2609.16255#bib.bib10)\],并已扩展到多模态VQA\[50 (https://arxiv.org/html/2609.16255#bib.bib3),37 (https://arxiv.org/html/2609.16255#bib.bib29)\]。近期的研究将符号推理蒸馏到大型VLMs中\[11 (https://arxiv.org/html/2609.16255#bib.bib48),35 (https://arxiv.org/html/2609.16255#bib.bib52)\]。相比之下,我们专注于低资源场景,使用来自40亿参数教师模型的900个简洁CoT对一个20亿参数模型进行微调。我们独特地研究了紧凑模型的CoT*位置*和推理格式,将图像QA的CoT蒸馏\[18 (https://arxiv.org/html/2609.16255#bib.bib46)\]扩展到长视频领域,强调事后推理和格式感知的对齐。困难样本选择通过关注模型决策边界附近的不确定样本来加速收敛\[36 (https://arxiv.org/html/2609.16255#bib.bib18)\]。我们应用基于间隔的不确定性采样\[33 (https://arxiv.org/html/2609.16255#bib.bib15)\]来定位模糊的高价值样本。与典型的从易到难课程学习\[1 (https://arxiv.org/html/2609.16255#bib.bib30),39 (https://arxiv.org/html/2609.16255#bib.bib31)\]不同,我们采用了“先难后易”的方法,我们发现当与合成的CoT推理结合时,这种方法非常有效。 ### 2.3 VideoQA 数据集 我们在多个基准测试上评估了我们的方法,总结见表1 (https://arxiv.org/html/2609.16255#S2.T1)。我们用于微调的主要数据集是长时程、时间信息丰富的CinePile\[26 (https://arxiv.org/html/2609.16255#bib.bib9)\]。我们在多样化的网络视频数据集ActivityNet-QA\[46 (https://arxiv.org/html/2609.16255#bib.bib19)\]和组合式多任务设计的MLVU\[52 (https://arxiv.org/html/2609.16255#bib.bib51)\]上测试了零样本泛化能力。我们对这些数据集的关注使我们的工作区别于在覆盖时长较短的基准(如MSVD-QA\[44 (https://arxiv.org/html/2609.16255#bib.bib32)\]和TVQA\[14 (https://arxiv.org/html/2609.16255#bib.bib33)\])或具有不同长上下文任务(如EgoSchema\[20 (https://arxiv.org/html/2609.16255#bib.bib49)\]和LongVideoBench\[43 (https://arxiv.org/html/2609.16255#bib.bib50)\])上的评估。 表 1:视频QA数据集比较。 ## 3 方法论 我们的目标是通过合成数据和轻量级微调来增强InternVL2-2B的视频推理能力,并为边缘部署进行优化。我们的流程如图1 (https://arxiv.org/html/2609.16255#S3.F1)所示,集成了困难样本选择、合成CoT推理生成和高效监督。 ### 3.1 困难样本选择与推理生成 为了最大化微调的影响,我们首先识别出InternVL2-2B最不确定的N个样本。我们探索了三种策略:随机采样、模型估计的难度(按负对数概率排序)和前2间隔采样(选择前两个预测之间间隔最小的样本\[33 (https://arxiv.org/html/2609.16255#bib.bib15),23 (https://arxiv.org/html/2609.16255#bib.bib16)\])。我们发现性能在N=700附近趋于饱和(见第4节 https://arxiv.org/html/2609.16255#S4),并选择N=900以确保鲁棒性,这对应于完整数据集的<0.5%。对于这900个样本,我们使用40亿参数的教师模型(InternVL2-4B)生成简短、结构化的CoT推理,避免了更大模型的冗长\[16 (https://arxiv.org/html/2609.16255#bib.bib14)\]。我们使用的提示是:Q: [问题]。A: [答案]。生成推理...用1-2句话总结它(最多20个token)。推理被限制在20个token以内,人工检查确认85%的有效性;我们应用过滤器去除格式不正确的样本。 参考图注图1:使用合成思维链推理和困难样本选择改进VLM的方法概述。 ### 3.2 微调与评估 我们在N=900个增强样本上对InternVL2-2B进行微调。我们测试了将CoT置于答案之前(如标准提示\[41 (https://arxiv.org/html/2609.16255#bib.bib10)\]),但观察到性能下降(例如,最终选项偏差)。将推理作为输入上下文提供("解释: [推理]...")也产生了较低的提升。相比之下,将推理置于答案*之后*带来了显著提升,因此我们采用了“答案-然后-推理”的格式:[答案]。[推理文本]。我们发现简洁的1-2句话推理就足够了。训练使用AdamW\[19 (https://arxiv.org/html/2609.16255#bib.bib34)\],学习率为2e-5,训练3个epoch,优化标准的交叉熵损失。我们的主要基准测试是CinePile\[26 (https://arxiv.org/html/2609.16255#bib.bib9)\],我们报告平均和按类别的准确率。为了测试泛化能力,我们在ActivityNet-QA\[46 (https://arxiv.org/html/2609.16255#bib.bib19)\]上进行零样本评估。由于ActivityNet-QA是开放式的,我们使用GPT-4o\[5 (https://arxiv.org/html/2609.16255#bib.bib35)\]为每个问题生成四个干扰项,将其转换为多项选择格式,以确保与我们的训练设置一致。基线包括零样本的InternVL2-2B、更大的模型(mPLUG-Owl3, LongVA)以及我们未使用CoT进行微调的模型。 ### 3.3 实现细节 InternVL2-2B使用基于ViT的视觉编码器\[4 (https://arxiv.org/html/2609.16255#bib.bib37)\]和LLaMA风格的解码器\[38 (https://arxiv.org/html/2609.16255#bib.bib38)\]。由于反向传播约束\[21 (https://arxiv.org/html/2609.16255#bib.bib36)\],我们在微调时每个视频使用3帧,推理时使用12帧。该流程在PyTorch\[24 (https://arxiv.org/html/2609.16255#bib.bib39)\]和Hugging Face Transformers\[42 (https://arxiv.org/html/2609.16255#bib.bib40)\]中实现。微调在4xA100节点上可在2小时内完成。我们计划发布代码以支持可重复性。 ## 4 实验与结果 参考图注图2:基于用于微调的样本数量,InternVL2 2B模型在CinePile数据集上的平均准确率。 我们进行了实验,以评估使用针对性的合成数据增强VLM的方法。我们的关键研究问题是: - • (Q1) 与随机采样相比,不同的困难样本选择策略对于微调效率有多有效? - • (Q2) 结合合成生成的思维链(CoT)推理有何影响,推理的整合方式如何影响性能? - • (Q3) 我们的方法能否显著缩小紧凑的InternVL2-2B模型与更大的VLMs在具有挑战性的CinePile基准上的性能差距? - • (Q4) 在CinePile上学习的推理改进,当以零样本设置评估时,能否泛化到未见的数据集(ActivityNet-QA)? 模型 | #参数量 | 平均 | CRD | NPA | STA | TEMP | TH --- | --- | --- | --- | --- | --- | --- | --- InternVL2 2B | 2B | 30.34 | 31.91 | 33.26 | 30.35 | 23.26 | 31.58 InternVL2 4B | 4B | 39.89 | 42.99 | 47.73 | 36.23 | 32.99 | 41.58 mPLUG-Owl3 | 8B | 38.27 | 40.91 | 45.71 | 33.86 | 33.09 | 46.20 InternVL2 8B | 8B | 32.28 | 35.25 | 40.39 | 28.46 | 24.71 | 38.42 LongVA 7B | 7B | 41.04 | 43.28 | 51.84 | 38.45 | 33.58 | 38.42 InternVL2 2B (Random) | 2B | 31.02 | 31.16 | 31.96 | 31.62 | 26.06 | 40.21 InternVL2 2B (Difficulty) | 2B | 33.68 | 34.45 | 38.15 | 33.10 | 27.74 | 40.48 InternVL2 2B (Top-2 Gap) | 2B | 36.34 | 37.73 | 44.35 | 34.58 | 29.43 | 40.74 InternVL2 2B (Random + CoT) | 2B | 32.52 | 33.10 | 33.46 | 33.12 | 27.56 | 41.71 InternVL2 2B (Difficulty + CoT) | 2B | 35.18 | 35.95 | 39.65 | 34.60 | 29.24 | 41.98 InternVL2 2B (Top-2 Gap + CoT, 26B teacher) | 2B | 37.41 | 38.45 | 47.17 | 35.62 | 30.12 | 42.21 InternVL2 2B (Top-2 Gap + CoT) | 2B | 38.34 | 39.73 | 46.50 | 36.58 | 30.85 | 42.74 表 2:视觉-语言模型性能比较。我们还比较了来自26B教师模型(斜体行)与4B教师模型(最后一行)生成的合成CoT。4B教师模型表现更优,支持其作为高效推理生成器的使用。 ### 4.1 实验设置 - • 数据集: - – CinePile\[26 (https://arxiv.org/html/2609.16255#bib.bib9)\]:我们用于微调和评估的主要数据集。它包含30.5万个多项选择问答对,源自9000多个电影片段(平均长度160秒)。我们使用官方训练集进行微调样本选择,使用官方测试集进行评估。其对长视频和推理的关注使其成为合适的测试平台。 - – ActivityNet-QA\[46 (https://arxiv.org/html/2609.16255#bib.bib19)\]:用于零样本泛化测试。它包含5.8k个网络视频(平均长度180秒)上的58k个开放式问答对。我们在标准验证集上进行评估。为了与我们的多项选择微调范式对齐,我们使用GPT-4o合成了ActivityNet-QA验证集的多项选择选项。 - • 评估指标: - – CinePile:我们报告所有问题的平均准确率,并按提供的问题类型类别细分准确率:TEMP(时序)、CRD(角色与关系动态)、NPA(叙事与情节分析)、STA(场景与技术分析)和TH(主题探索)。 - – ActivityNet-QA:我们报告标准的多项选择准确率。 - • 基线与比较模型: - – 基础模型:InternVL2-2B(零样本)\[3 (https://arxiv.org/html/2609.16255#bib.bib41)\]。 - – 微调(无CoT):在N=900个样本上微调的InternVL2-2B,样本选择方法:(i) 随机,(ii) 模型估计的难度(记为Difficulty),(iii) 前2置信度间隔(记为Top-2 Gap)。 - – 微调(+合成CoT):相同的
相似文章
通过混合层蒸馏和关键信息的逐步注意力改进小模型的推理能力
本文提出一种新颖的思维链蒸馏框架,通过混合层模块的动态层对齐,将教师模型对关键信息的逐步注意力转移到学生模型中。该方法通过明确指导学生模型在推理过程中逐步聚焦关键信息,在数学和常识推理基准测试中实现了一致的性能提升。
OpenCoF:通过视频生成学习推理
OpenCoF 提出了一个推理视频数据集和一个微调的视频生成模型,通过多样化的监督和显式推理令牌来改进时间推理,在四个视频推理基准上取得了显著提升。
基于代理上下文的链式思维微调长上下文推理
提出ProxyCoT训练框架,通过先在小代理上下文中获取链式思维推理轨迹(通过强化学习或蒸馏),再通过监督微调将其锚定到完整长上下文中,从而提升大语言模型的长上下文推理能力。实验表明,该方法在降低计算成本的同时持续优于基线。
通过推理空间压缩的结构化理由蒸馏
本文提出了 D-RPC,一种通过将推理路径压缩为可复用库,从而将大型语言模型的推理能力蒸馏给较小模型的方法,该方法在数学和常识基准测试中实现了更好的性能和一致性。
大型学习模型中增强且高效的推理
本文提出了一种改进大型语言模型推理的方法,通过重新编码数据以显式表示关系,实现高效且原则性的推理,并具备关系规则的多项式时间可学习性,从而解决幻觉问题并支持跨多次调用的可靠推理。