TeachObs:一个经过人工验证的多模态教学观察与模型评估基准
摘要
TeachObs引入了一个经过人工验证的多模态教学观察基准,包含30个课堂视频,这些视频标注了片段级别的二元编码和课程级别的专家评分,并评估了五个前沿LLM在三个轨道上的表现,发现没有单一模型能持续优于其他模型,并且模型评估对程序清晰的课程给出了过高评价。
arXiv:2605.30673v1 公告类型:新
摘要:课堂视频包含可观察的教学实践,但其教学和视觉信号很少以适合模型评估的形式进行组织。我们提出了\textit{TeachObs},一个用于课堂视频中多模态教学观察的经过人工验证的基准。\textit{TeachObs}包含来自八个国家的30个公开课程视频,划分为5,158个固定的15秒场景。七位研究人员为每个场景标注了39个二元观察代码,涵盖20个视觉代码(如手势、板书、指向和视觉材料)和19个非视觉代码(如指令、监控、提问、反馈和反思)。基于Krippendorff's alpha,使用可靠性和普及性感知规则构建了黄金片段标签。除了片段级标签外,三位专家评分员对30节课进行了课程级别的评分和定性评估,涵盖教学设计、教学实施、学生反应、学习材料和课程收尾,评分员覆盖范围详见正文。利用这两个人工参考层,我们在三个轨道上评估了五个具备视觉能力的先进LLM:纯文本片段编码、文本+帧片段编码,以及在LLM作为评判者协议下的课程级别覆盖评分。结果发现,没有任何一个模型在所有三个轨道上都能持续优于其他模型;添加中间帧会同时增加每个场景的真实归属和错误归属;与专家评分员相比,模型评估对程序清晰的课程给出了过高评价。因此,\textit{TeachObs}既支持细粒度的标注基准测试,也支持整节课评估,展示了AI系统在哪些方面可以辅助课堂视频分析,以及在涉及不同学科、课堂形式和标注难度的情况下,专家判断仍然不可或缺。
查看缓存全文
缓存时间: 2026/06/01 09:27
# TeachObs:一个经人工验证的多模态教学观察与模型评估基准 来源:https://arxiv.org/html/2605.30673 \(2026\) ###### 摘要 课堂视频包含了可观察的教学实践,但其教学与视觉信号很少以适合模型评估的形式组织。我们提出 **TeachObs**,一个用于课堂视频中多模态教学观察的经人工验证的基准。**TeachObs** 包含来自八个国家的30个公开课堂视频,分为5,158个固定的15秒场景。七位研究人员为每个场景标注了39个二元观察代码,涵盖20个视觉代码(如手势、板书、指示、视觉材料)和19个非视觉代码(如指导、监控、提问、反馈、反思)。基于Krippendorff’s alpha的信度和流行度感知规则构建了黄金片段标签。除了片段级标签外,三位专家评估者对30堂课进行了课程级评分和定性评估,涵盖教学设计、教学传递、学习者回应、学习材料和课堂收尾,评估者覆盖范围详见正文。利用这两个人工参考层,我们评估了五个具备视觉能力的前沿大语言模型,涉及三个赛道——纯文本片段编码、文本+帧片段编码,以及基于LLM-as-judge协议的课程级覆盖评估——发现没有单一模型在所有三个赛道中持续表现最佳,添加中间帧会增加每个场景的真假归因,且模型评估相对于专家评估者而言高估了程序清晰的课程。因此,**TeachObs** 既支持细粒度标注基准测试,也支持整课评估,展示了AI系统在哪些方面可以辅助课堂视频分析,以及哪些方面仍然需要专家判断,尤其是在不同学科、课堂形式和标注难度级别上。 课堂视频, 教学观察, 多模态基准, 教育AI, 大语言模型评估 ††版权:ACM许可 ††期刊年份:2026 ††DOI:XXXXXXX.XXXXXXX ††会议:第35届ACM国际信息与知识管理会议,2026年11月7-11日,意大利罗马 ††ISBN:978-1-4503-XXXX-X/26/11 ††CCS:计算方法学 自然语言处理 ††CCS:应用计算 计算机辅助教学 ††CCS:计算方法学 计算机视觉 ††CCS:应用计算 交互式学习环境 ## 1. 引言 参考图说明 图1. **TeachObs** 概览。两个经人工验证的参考层——片段级多标签代码和课程级专家叙述——共享相同的30节课语料库,并支持三个评估赛道,这些赛道沿不同轴(纯文本片段编码、文本+帧片段编码、课程级覆盖)比较前沿LLM。 教师在课堂上做了什么,以及由此产生的课程效果如何,是人类观察者通过多年训练才能回答的两个问题。第一个问题——*在特定时刻执行了哪些教学行为*——基于细粒度、可观察的信号,如手势、板书和话语动作。第二个问题——*整堂课如何设计教学并吸引学习者*——需要对整个课程进行综合的定性判断。构建能接近任一问题的AI系统,都需要能够明确区分两者的参考数据,并且这些数据由经过训练的人类观察者标注。 现有的课堂视频资源在三个方面未能满足这一需求。首先,包含教学镜头的视频数据集通常针对通用动作或狭窄领域进行标注(Kay等,2017;Mangalam等,2023),使可观察的*教学*行为大多未被覆盖。其次,教育NLP的工作集中在对话和辅导文本上(Macina等,2023),在真实课堂的视觉通道中扎根有限。第三,来自专家评估者的课程级定性观察——传统教师观察评分表所产生的那种文字——很少与细粒度的片段标注一起发布,因此两种粒度无法在同一课程上进行联合研究。 本文介绍 **TeachObs**111https://anonymous.4open.science/r/teacherOps-57D6/,一个基于30个公开K-12课堂视频的人工标注基准。**TeachObs** 发布了由训练有素的人类标注者产生的两个参考层(图1):一个基于5,158个固定15秒场景的片段级多标签黄金标准,针对39项观察方案(20个视觉代码和19个非视觉代码),由七位研究人员在基于Krippendorff’s α的信度和流行度感知共识程序下生成;以及一组涵盖十个评估类别的课程级定性叙述,由三位专家评估者生成,其每课覆盖范围详见§3.6。这两个层覆盖相同的课程,旨在可组合,以便片段级行为和课程级定性观察可以在相同的录音上进行分析。 #### 贡献 - • **TeachObs**,一个K-12课堂基准,包含两个经人工验证的参考层,涉及30节课程——5,158个十五秒场景,对应39个观察代码,以及涵盖十个类别的课程级专家叙述(§3)。 - • 三个评估赛道(纯文本和文本+帧片段编码,以及课程级覆盖),并提供五个具备视觉能力的前沿LLM的总体数据(§4)。 - • 关于模型失败模式的三个三角验证发现——视觉驱动的过度归因、教学话语过度延伸、以及课程级过度评分——均经过独立专家重新判断验证(§5)。 ## 2. 相关工作 表1. **TeachObs** 相对于近期视频VLM评估基准(第1组)、为分类器基线发布的课堂数据资源(第2组)以及两个课堂领域VLM评估基准(第3组)的定位。*模态* - V视频,T转录或对话,A音频。*学科*和*国家*统计不同的学校学科和来源国家;"n/a"标记非课堂资源。*年级*列出学校级别覆盖。*标注者*报告谁产生了标签以及多少人(如果已知)。*教师*标记教师是否为标注主体。*课程叙述*标记是否发布由人类专家撰写的自由文本课程评估(AI生成或模板填充的报告不计入)。 | 基准 | 年份 | 模态 | 规模 | 学科 | 国家 | 标注者 | 教师 | 课程叙述 | |------|------|------|------|------|------|--------|------|----------| | **第1组. VLM评估基准(通用视频)** | | Kinetics-700 (Kay等, 2017) | 2017 | V | 650K片段 | n/a | n/a | 众包工作者 | ✗ | ✗ | | EgoSchema (Mangalam等, 2023) | 2023 | V | 5K MCQ over 250 h | n/a | n/a | 人工策划 | ✗ | ✗ | | MVBench (Li等, 2024) | 2024 | V+T | 4K QA, 20任务 | n/a | n/a | 自动+验证 | ✗ | ✗ | | VideoMME (Fu等, 2025) | 2024 | V+T | 2.7K视频,最长1h | n/a | n/a | 专家标注者 | ✗ | ✗ | | MMBench-Video (Fang等, 2024) | 2024 | V+T | 600视频,2K+ QA | n/a | n/a | 人工标注 | ✗ | ✗ | | E.T. Bench (Liu等, 2024b) | 2024 | V+T | 7K视频,7.3K样本 | n/a | n/a | 人工标注 | ✗ | ✗ | | **第2组. 课堂数据资源(非LLM评估)** | | HowTo100M (Miech等, 2019) | 2019 | V+T | 100M片段 | n/a | n/a | 自动(旁白) | ✗ | ✗ | | CIMA (Stasaski等, 2020) | 2020 | T | 700会话 | 1(植物学) | 1 | 众包工作者 | ✗ | ✗ | | EduNet (Sharma等, 2021) | 2021 | V | 7.8K片段,20动作 | 1(通用) | 1 | 研究团队 | ✗ | ✗ | | NCTE Transcripts (Demszky and Hill, 2023) | 2023 | T | 1.7K课程,317教师 | 1(数学) | 1(美国) | 训练有素的评分者(CLASS) | ✓ | ✗ | | SCB-Dataset (Yang and Wang, 2023) | 2023 | V | 13K图像,19类 | 1(通用) | 1(中国) | 研究团队 | ✗ | ✗ | | MathDial (Macina等, 2023) | 2023 | T | 2.9K会话 | 1(数学) | n/a | 教师招募 | ✗ | ✗ | | MM-TBA (Liu等, 2025) | 2025 | V+T+A | 354课程,3.2K片段 | 2(数学,IT) | 1(中国) | 4名本科生(+LLM生成报告) | ✓ | ✗ | | **第3组. 课堂领域VLM评估基准** | | SciIBI (Shen等, 2026) | 2026 | V+T | 113片段 | 1(科学) | 1(美国) | 教育研究者 | ✓ | ✗ | | TeachObs (ours) | 2026 | V+T | 30课程,5,158场景,1,030声明 | 9(数学,科学,英语,语言艺术,社会研究等) | 8 | 7名研究者 | ✓ | ✓ | ### 2.1 课堂视频与教育标注 大多数公开的课堂视频语料库都是围绕教师观察框架组织的,如Danielson的《教学框架》(Alvarez, 2014),但其底层的片段级标注很少发布。教育NLP工作产生了对话和辅导数据集(Stasaski等,2020;Macina等,2023)以及大规模的小学数学课堂NCTE转录本(Demszky and Hill, 2023),但真实课堂的视觉通道——板书、手势、学习材料——在这些资源中基本缺失。最近的课堂视频工作已开始解决视觉方面的问题;EduNet(Sharma等,2021)列出了K-12镜头中二十个教师和学生动作类别;SCB-Dataset(Yang and Wang, 2023)在静态图像上检测学生和教师行为;MM-TBA(Liu等,2025)将短视频教师手势标注与四维讲座评估报告相结合,其文本内容由微调后的LLM生成,而非由专家评估者撰写。这些是课堂数据资源;它们为下游分类器发布标签,但并非围绕LLM评估协议构建。邻近的K-12教育基准在考试式问题上评估多模态科学或多学科推理,而非在课堂视频上(Jiang等,2024;Zhou等,2025)。据我们所知,最接近的、既是课堂视频语料库又是明确LLM/VLM评估基准的新兴工作,是SciIBI(Shen等,2026)(arXiv预印本),它在113个NGSS对齐的科学片段上评估多模态LLM的核心教学实践编码。**TeachObs** 处于这一交叉点,是第一个将涵盖视觉和话语层面教学的模态方案与课程级专家定性叙述层配对在同一录音上的基准。 ### 2.2 多模态与长视频资源 通用的多模态视频资源标注动作识别、字幕生成和问答(Kay等,2017;Mangalam等,2023;Fu等,2025;Zhou等,2024),最近的基准针对全面的多任务视频理解(Li等,2024;Liu等,2024a)、长形式整体理解(Fang等,2024;Wu等,2024)、细粒度时间推理(Cai等,2024)、超长自我中心视频理解(Wang等,2025)以及开放式事件级推理(Liu等,2024b)。这些语料库不针对教育实践,将视频视为通用事件流而非结构化的教学片段。关于教学视频的工作集中在烹饪等领域的程序性理解(Miech等,2019),其时间与语义结构与课堂教学不同。表1将**TeachObs** 与三类代表性基准进行了对比——通用VLM评估基准、用于下游分类器的课堂数据资源,以及另一个课堂领域VLM评估基准。直接比较对象是SciIBI,它在单一学科(科学)和单一国家背景下的113个片段上评估LLM的核心教学实践编码,由作者研究团队标注。**TeachObs** 位于同一交叉点,但在三个独立轴上更广泛——学科(9 vs. 1)、来源国家(8 vs. 1)和学校级别(幼儿园、小学、初中、高中)——从片段方面看规模大约大四十六倍(5,158个场景 vs. 113个片段),并且是比较中唯一一个将严格专家编码评分表与经过训练的评估者在相同K-12课程上的课程级专家叙述相结合的资源。 ## 3. **TeachObs** 基准 **TeachObs** 是一个经人工验证的多模态教学观察课堂视频基准。与那些仅关注转录本、学生回应或辅导对话的数据集不同,**TeachObs** 在两个互补层面代表课堂教学。在片段层面,它为固定的15秒场景提供细粒度的二元观察标签。在课程层面,它提供专家评分和对整堂课的定性评估。这两个层共同允许模型不仅在局部证据识别(如检测手势、板书、指导或反馈)上进行评估,也在整体教学观察(如判断教学设计、教学传递、学习者回应、材料和收尾)上进行评估。 我们首先从三个来源组中识别了公开可访问的课堂视频:TIMSS 1999视频研究档案、马萨诸塞州中小学教育部(Mass DESE)校准视频资源,以及韩国公开课堂视频。TIMSS 1999视频研究是一项大规模的八年级数学和科学教学课堂视频研究,涉及七个国家,录制并分析了超过一千个课堂的教学实践。Mass DESE来源包括为教育者评估和课堂观察校准开发的公开校准视频。韩国视频来自公开可访问的整课课堂录制。每个视频被分割为固定的15秒场景;转录本和场景描述通过自动视频分析管道生成,并作为编码的结构化支持,而非最终标签。222发布的基准仅将这些自动化产物用作编码辅助;最终片段级标签由独立的人工编码产生(§3.3-§3.5)。七名研究
相似文章
EduPanel: 一种用于教学视频的三智能体LLM评判器——可靠性、互补性与人类信任校准
EduPanel是一种基于评分标准、面向学习者的LLM评判器,它使用三个专门的智能体来评估教学视频质量,实现了与人类专家相当的可靠性,同时提高了评分准确性并保持对不可靠输出的可检测性。
智能体是否准备好教学?面向真实教学工作的多阶段基准
介绍了EduAgentBench,一个基于源的基准,用于评估辅导智能体在教学专业判断、多轮辅导以及自主教学工作流程执行方面的能力。对前沿模型的评估表明,它们在情境化辅导和工作流任务中仍未能达到专业教学标准。
Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力
Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。
OVO-S-Bench:面向多模态大语言模型流式空间智能的层次化基准测试
OVO-S-Bench 构建了一个全面的人工标注基准测试,涵盖 348 个视频中的 1,680 道问题,用于评估多模态大语言模型的流式空间智能能力。结果显示,即便是表现最佳的模型(Gemini-3.1-Pro)也比人类专家低 27 分。该基准测试揭示了若干关键局限:以他者为中心的空间映射是主要瓶颈,而思维链推理则会放大空间错误。
LiveK12Bench: 大型多模态模型真的征服了高中水平的考试吗?
介绍了LiveK12Bench,这是一个动态的多模态基准,用于评估大型模型在多个学科的真实高中考试中的表现,揭示了在现实约束下的显著性能差距。