NLPCC 2026 共享任务1综述:难度感知的多语言多模态医学教学视频理解评估
摘要
本文介绍了NLPCC 2026 共享任务1:难度感知的多语言多模态医学教学视频理解评估(DA-MIVQA)。该任务在以往基准测试的基础上,增加了难度感知标注,并包含三个赛道:时间答案定位、视频语料库检索以及语料库内定位。数据集来自公共频道的医学教学视频,旨在评估系统在不同推理需求下的表现。
arXiv:2607.06618v1 公告类型:cross
摘要:继NLPCC 2023–2025的CMIVQA、MMI-VQA和M4IVQA挑战之后,我们为NLPCC 2026引入了难度感知的医学教学视频问答(DA-MIVQA)共享任务。DA-MIVQA通过根据回答问题所需证据的类型和复杂程度明确区分问题,扩展了以往的多语言多模态医学视频基准。具体而言,简单问题通常可以从基于字幕的文本线索中回答,而复杂问题则需要视觉定位、程序性理解以及跨模态证据整合。该挑战包含三个赛道:单视频中的难度感知时间答案定位(DA-TAGSV)、难度感知视频语料库检索(DA-VCR)以及视频语料库中的难度感知时间答案定位(DA-TAGVC)。数据集来自公共医学教学频道,涵盖急救、应急响应、康复、护理及一般医学教育等多种场景,并经过人工验证并标注难度。本文介绍了DA-MIVQA的任务动机、数据集构建、评估协议、参与概况、竞赛结果以及代表性系统。DA-MIVQA为在不同文本、视觉、时间和程序推理需求下评估医学教学视频问答系统提供了一个实用基准。
查看缓存全文
缓存时间: 2026/07/09 07:58
# NLPCC 2026 共享任务 1 概述:难度感知的多语言和多模态医学教学视频理解评估
来源:https://arxiv.org/html/2607.06618
1 计算机科学与技术学院,北京理工大学
邮箱:\{liushenxi,likan,tianyuhang\}@bit\.edu\.cn
2 计算机系,香港理工大学
邮箱:25019897r@connect\.polyu\.hk
3 中国科学院深圳先进技术研究院
邮箱:b\.li2@siat\.ac\.cn
###### 摘要
继 NLPCC 2023–2025 的 CMIVQA、MMI-VQA 和 M4IVQA 挑战之后,我们为 NLPCC 2026 引入了难度感知的医学教学视频问答(DA-MIVQA)共享任务。DA-MIVQA 通过根据回答问题所需证据的类型和复杂度明确区分问题,扩展了先前的多语言和多模态医学视频基准。具体而言,简单问题通常可以基于字幕文本线索来回答,而复杂问题则需要视觉定位、流程理解以及跨模态证据整合。该挑战包含三个赛道:单视频中的难度感知时序答案定位(DA-TAGSV)、视频语料库中的难度感知检索(DA-VCR),以及视频语料库中的难度感知时序答案定位(DA-TAGVC)。数据集来自公共医学教学频道,涵盖急救、应急响应、康复、护理和一般医学教育等多种场景,并经过人工验证并标注了难度。本文介绍了 DA-MIVQA 的任务动机、数据集构建、评估协议、参与概况、竞赛结果以及代表性系统。DA-MIVQA 为在不同文本、视觉、时序和流程推理要求下评估医学教学视频问答系统提供了一个实用基准。
## 1 引言
近年来,AI 辅助医疗在临床和教育场景中展现出潜力,如医学影像、决策支持和流程培训[7 (https://arxiv.org/html/2607.06618#bib.bib5),24 (https://arxiv.org/html/2607.06618#bib.bib6),25 (https://arxiv.org/html/2607.06618#bib.bib7)]。医学教学视频越来越多地用于获取急救、应急响应、护理、康复和一般医学教育等实用技能[27 (https://arxiv.org/html/2607.06618#bib.bib8),26 (https://arxiv.org/html/2607.06618#bib.bib9),9 (https://arxiv.org/html/2607.06618#bib.bib10)]。与纯文本相比,这些视频展示了医学动作、工具使用、姿势变换和时序流程,为医学学习和问答提供了更丰富的证据[16 (https://arxiv.org/html/2607.06618#bib.bib38),30 (https://arxiv.org/html/2607.06618#bib.bib39),17 (https://arxiv.org/html/2607.06618#bib.bib40)]。
这一价值推动了一系列 NLPCC 关于医学教学视频问答的共享任务,包括 CMIVQA 2023[13 (https://arxiv.org/html/2607.06618#bib.bib1)]、MMIVQA 2024[15 (https://arxiv.org/html/2607.06618#bib.bib2)] 和 M4IVQA 2025[12 (https://arxiv.org/html/2607.06618#bib.bib3)]。这些任务已从中文医学视频 QA 扩展到多语言、多模态和多跳推理设置[19 (https://arxiv.org/html/2607.06618#bib.bib4)],包含两个核心方向:时序答案定位(在未裁剪视频中定位答案相关片段)和视频语料库检索(从大量视频中识别相关视频)[4 (https://arxiv.org/html/2607.06618#bib.bib11),33 (https://arxiv.org/html/2607.06618#bib.bib12)]。
然而,现有基准并未明确区分需要何种证据来回答现实医学场景中的问题[23 (https://arxiv.org/html/2607.06618#bib.bib14),35 (https://arxiv.org/html/2607.06618#bib.bib15)]。有些问题可以通过字幕或基本语义匹配来回答,而其他问题则需要视觉定位、动作理解、对象状态识别和流程上下文建模。因此,医学教学视频理解的难度不应仅由推理深度或推理跳数定义,还应根据是否需要超出文本线索的显式视觉证据来定义。
为弥补这一空白,NLPCC 2026 引入了**难度感知的医学教学视频问答**挑战,即 **DA-MIVQA**¹¹¹https://med-m3-dataset.github.io/ 获取更多信息。与以往侧重语言范围、模态覆盖或多跳推理的任务不同,DA-MIVQA 根据每个问题所需的证据结构来评估系统。它将问题分为*简单*和*复杂*子集:简单问题通常可通过字幕对齐的文本线索或显式单一来源证据来回答,而复杂问题则需要视觉定位和流程理解。这种设计更好地反映了现实医疗使用场景,用户不仅需要文本提示,还需要关于该做什么、在哪里操作以及流程步骤何时发生的视觉证据[2 (https://arxiv.org/html/2607.06618#bib.bib16),5 (https://arxiv.org/html/2607.06618#bib.bib17),18 (https://arxiv.org/html/2607.06618#bib.bib18)]。
DA-MIVQA 保留了以往 NLPCC 共享任务的三个赛道形式,同时对每个赛道应用难度感知评估。**DA-TAGSV** 要求系统在单个视频中定位答案片段;**DA-VCR** 从语料库中检索最相关的视频;**DA-TAGVC** 首先检索相关视频,然后在其内部进行时序答案定位。在所有三个赛道中,在简单、复杂和混合设置下进行评估,可以细致分析系统在流程和跨模态难度级别上的鲁棒性。
DA-MIVQA 数据集来自 YouTube 上的公共医学教学频道,涵盖急救、应急管理、康复、护理和一般医学教育等场景[6 (https://arxiv.org/html/2607.06618#bib.bib13)]。遵循以往的共享任务,问题和时序答案由具有医学背景的标注者人工验证,每个问题根据所需证据被标记为简单或复杂。这种标注有助于揭示系统是真正理解视觉和流程内容,还是主要依赖字幕匹配。
表 1:NLPCC 医学教学视频 QA 共享任务的概念比较。DA-MIVQA 为教育、技能获取、紧急指导和多语言知识获取提供更可靠的医学视频 QA。它还提供了一个基准,用于区分主要匹配字幕的系统与在医学场景中整合视觉、文本和流程证据的系统。本文概述了 DA-MIVQA,涵盖其动机、任务定义、数据集构建、评估协议、参与总结和代表性系统。
## 2 任务介绍
DA-MIVQA 挑战旨在促进在难度感知评估设置下的医学教学视频问答。与以往主要强调多语言理解、多模态融合或多跳推理的 NLPCC 共享任务不同[13 (https://arxiv.org/html/2607.06618#bib.bib1),15 (https://arxiv.org/html/2607.06618#bib.bib2),12 (https://arxiv.org/html/2607.06618#bib.bib3),19 (https://arxiv.org/html/2607.06618#bib.bib4)],DA-MIVQA 明确评估系统在不同证据要求下的表现[22 (https://arxiv.org/html/2607.06618#bib.bib19),10 (https://arxiv.org/html/2607.06618#bib.bib20)]。所有问题被分为*简单*和*复杂*子集。简单问题主要通过字幕对齐的文本匹配或基本语义理解来回答,而复杂问题则需要视觉定位、流程解释以及整合医学教学视频中的文本和视觉证据。遵循以往 NLPCC 医学视频共享任务的设计范式,DA-MIVQA 包含三个赛道:难度感知的单视频时序答案定位、难度感知的视频语料库检索,以及难度感知的视频语料库时序答案定位。
### 2.1 每个赛道的定义
该挑战包含三个互补的赛道,涵盖时序定位、语料库检索及其在医学教学视频理解中的联合建模。
参见图注
图 1:DA-MIVQA 中复杂问题的多模态特征。
#### 赛道 1:难度感知的单视频时序答案定位(DA-TAGSV)
给定一个医学或健康相关的问题和一个未经裁剪的医学教学视频,DA-TAGSV 要求系统定位答案片段的起始和结束时间戳。它评估在字幕主导的简单问题和基于视觉的复杂问题下的细粒度时序定位能力。
#### 赛道 2:难度感知的视频语料库检索(DA-VCR)
给定一个问题和一个包含大量未经裁剪医学教学视频的语料库,DA-VCR 要求系统从语料库中检索最相关的视频。它评估在多语言和多模态条件下问题与候选视频之间的语义匹配,同时进一步比较在简单和复杂问题上的检索鲁棒性。
#### 赛道 3:难度感知的视频语料库时序答案定位(DA-TAGVC)
给定一个问题和一个视频语料库,DA-TAGVC 要求系统首先检索相关视频,然后在其内部定位答案片段。该赛道结合了 DA-TAGSV 和 DA-VCR 的挑战,由于检索和定位错误可能累积,因此更具要求性,尤其对于复杂问题。
### 2.2 评估指标
遵循以往的 NLPCC 医学教学视频共享任务,DA-MIVQA 为三个赛道采用特定任务的指标,并在简单仅、复杂仅和混合子集上报告结果[13 (https://arxiv.org/html/2607.06618#bib.bib1),15 (https://arxiv.org/html/2607.06618#bib.bib2),12 (https://arxiv.org/html/2607.06618#bib.bib3)]。该协议不仅衡量整体有效性,还衡量在不同证据复杂性级别下的鲁棒性。
对于 **DA-TAGSV**,评估基于预测答案片段与真实答案片段之间的时序重叠。我们采用交并比(IoU)、平均交并比(mIoU)以及 *R@1, IoU = μ*,其中 μ ∈ {0.3, 0.5, 0.7}。主要排名指标是 mIoU。
对于 **DA-VCR**,评估基于相关视频在返回列表中的排名。我们使用基于召回率的指标 *R@n*,其中 n ∈ {1, 10, 100},以及平均倒数排名(MRR)。主要排名指标是 *Overall* 分数,计算为 R@1、R@10、R@100 和 MRR 的平均值。
对于 **DA-TAGVC**,评估结合了检索和定位。我们报告 *R@1|mIoU*、*R@10|mIoU* 和 *R@100|mIoU*,这些反映了在不同检索深度下的定位质量。主要排名指标是 *Average* 分数,计算为这三个值的平均值。
### 2.3 数据集
DA-MIVQA 数据集来自 YouTube 上的公共医学教学频道,涵盖多种医学和健康相关场景,包括急救、医疗应急管理、康复指导、护理实践和一般医学教育[1 (https://arxiv.org/html/2607.06618#bib.bib21)]。遵循以往的共享任务,问题和时序答案由具有医学背景的标注者人工验证,以确保标注质量和医学有效性[8 (https://arxiv.org/html/2607.06618#bib.bib22)]。每个视频可能包含多个问答对,每个问题关联一个由起始和结束时间戳标记的唯一时序答案片段。
与以往数据集相比,DA-MIVQA 进一步引入了难度标签,即*简单*和*复杂*,根据回答每个问题所需的证据类型。这种重新标注策略区分了字幕主导的匹配问题和真正的多模态流程理解问题[20 (https://arxiv.org/html/2607.06618#bib.bib23)]。数据集分为训练集、验证集和测试集,每个集合包含中文和英文问题,并带有简单和复杂标签。总体而言,DA-MIVQA 为多语言和多模态医学教学视频理解提供了一个更细粒度的基准。
表 2:三个赛道的样本数量统计。
## 3 基线
为给提出的 DA-MIVQA 评估提供参考点,我们设计了两个互补的基线:纯文本 oracle 基线和多模态编码器-解码器基线。前者估计仅使用字幕信息系统能达到的上限,而后者为建模视觉证据、时序上下文和跨模态交互提供实用参考。这两个基线一起允许我们检查在不同证据要求下基于字幕的推理与多模态视频理解之间的性能差距。
### 3.1 纯文本 Oracle 基线
对于纯文本 oracle 基线,我们使用冻结的 Qwen3.5-9B[28 (https://arxiv.org/html/2607.06618#bib.bib24)] 模型作为骨干大语言模型。仅提供带时间戳的 SRT 字幕作为输入,模型通过任务特定提示适应 DA-MIVQA,不更新骨干参数。每个实例包含一个问题、相应的字幕序列以及预期的任务特定输出。
对于 DA-TAGSV,模型预测给定视频中最能支持答案的时序片段。对于 DA-VCR,它根据字幕级文本证据从候选语料库中识别最相关的视频。对于 DA-TAGVC,它首先推断相关视频,然后在该视频内预测支持答案的片段。此基线并非旨在作为可部署的多模态解决方案,而是作为仅从字幕可达到的性能上限估计。
### 3.2 多模态编码器-解码器基线
第二个基线采用多模态编码器-解码器框架,联合建模来自医学教学视频的问题、带时间戳的字幕和视频片段。其概念受用于视觉答案定位的跨模态相互知识迁移所启发[31 (https://arxiv.org/html/2607.06618#bib.bib25)],但针对 DA-MIVQA 的证据感知设置进行了调整,而非直接复制原始模型。
该框架首先提取字幕、问题和视频片段的表示。然后进行多模态证据挖掘,选择与问题相关的字幕片段和视频片段,随后在文本和视觉表示之间进行迭代的跨模态推理。生成的多模态表示被送入三个赛道的任务特定解码器:用于 DA-TAGSV 的时间戳预测、用于 DA-VCR 的视频相关性评分,以及用于 DA-TAGVC 的联合检索和时序定位。模型通过定位、检索和跨模态一致性目标进行优化。
总体而言,此基线通过在一个统一架构中结合字幕线索、视觉演示和时序证据,提供了实用的多模态参考。与纯文本 oracle 相比,它预期能更好地处理需要视觉定位和流程理解的复杂问题。
## 4 评估结果
在本节中,我们总结 NLPCC 2026 关于难度感知的医学教学视频问答(DA-MIVQA)共享任务的参与状况和评估结果。相似文章
Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力
Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。
MedLoCoMo:面向大语言模型的长上下文多会话医疗对话基准
MedLoCoMo 是一个新基准,用于评估大语言模型在长上下文、多会话医疗对话推理上的表现,基于 MIMIC-IV 数据构建。它测试了单次入院、跨入院以及对抗性不可回答的问题,揭示出即使对于拥有长上下文窗口的模型,跨入院推理仍然具有挑战性。
Video-MME-Logical: 一种用于视频时间逻辑推理的受控诊断基准
提出 Video-MME-Logical,一个用于评估多模态大语言模型中视频时间逻辑推理的受控基准,揭示了一个显著的人机差距。
基于视觉基础模型引导的注意力一致性纵向医学视觉问答
提出了一种用于纵向医学视觉问答的注意力引导编码器-解码器,使用冻结的基于DINO的掩码生成器和辅助损失函数来提高一致性和可解释性,在Medical-Diff-VQA基准上取得了强劲的结果。
MTDiag:面向临床意义的多轮诊断数据集,用于评估大语言模型
本文介绍了MTDiag,一个多轮诊断对话数据集,用于在现实临床诊断场景中评估大语言模型,解决了静态问答基准测试的局限性。