引用或拒绝:面向STEM课程视频的严格课程基础聊天机器人
摘要
本文报告了针对STEM课程视频的检索增强聊天机器人的学期部署,该机器人提供课程隔离的答案并带有时间戳引用,提高了正确性并符合学生的学习习惯。
arXiv:2609.01846v1 公告类型:新
摘要:录制讲座视频通常具有搜索和摘要功能,是标准的学习资源。然而,学生无法轻松提出课程特定问题或根据讲师的讲座验证答案。我们报告了在VideoPoints平台上部署了一个学期的检索增强聊天机器人,该机器人从课程讲座材料中回答问题并返回带时间戳的引用。聊天机器人仅从当前课程检索,使用章节摘要指导转录文本排名,并返回可点击的时间戳引用。学生使用它进行快速查找和考试复习。在833条消息中,70.5%包含引用,没有跨越课程边界,当没有讲座证据匹配时,聊天机器人通常拒绝回答而不是回答。在用户中,引用是最一致有用的功能,而练习题生成是最未满足的请求。我们还在EduVidQA的真实世界测试集上评估了该设计,EduVidQA是一个用于讲座视频问答的公共多模态基准。我们的设计比仅密集检索提高了6.3个百分点的正确讲座检索率。总之,结果表明有效部署依赖于课程隔离、支持引用以及与学生学习习惯的对齐。
查看缓存全文
缓存时间: 2026/09/03 05:48
# 引用或拒绝:一个基于严格课程内容的STEM讲座视频聊天机器人 来源:https://arxiv.org/html/2609.01846 Jaspal Subhlok所属机构:休斯顿大学邮箱:[[email protected]](mailto:) ###### 摘要 录制的讲座视频通常配有搜索和总结功能,是标准的学习资源。然而,学生无法轻松地提出特定课程的问题或验证答案是否符合讲师的讲座内容。我们报告了在VideoPoints平台上为期一个学期的部署,该平台配备了一个检索增强聊天机器人,能够从课程讲座材料中回答问题并返回带时间戳的引用。该聊天机器人仅从活跃课程中检索内容,使用章节摘要来指导转录文本排序,并返回可点击的带时间戳引用。学生将其用于快速查找和考试复习。在833条消息中,70.5%包含了引用,没有一条跨越课程边界,当没有讲座证据匹配时,聊天机器人通常选择拒绝回答而非自行作答。在用户中,引用是持续最有用的功能,而练习题生成则是最强烈的未满足需求。我们还在EduVidQA的真实测试集上评估了该设计,这是一个用于讲座视频问答的公共多模态基准。与仅密集检索相比,我们的设计将正确的讲座检索率提高了6.3个百分点。综合来看,结果表明有效的部署取决于课程隔离、支持引用以及与学生学习习惯的一致性。 ## 1 引言 录制的讲座视频是高等教育中的重要资源,用于复习难点材料和备考。先前的研究表明,可索引和可搜索的讲座视频能够支持STEM学习,因为学生可以跳转到相关的兴趣片段,而不是回放完整的录像(Barker等人,2014 (https://arxiv.org/html/2609.01846#bib.bib1);Tuna等人,2017 (https://arxiv.org/html/2609.01846#bib.bib15))。十多年来,VideoPoints平台通过基于主题的分割、字幕和搜索(Tuna等人,2015 (https://arxiv.org/html/2609.01846#bib.bib14);Rahman等人,2024 (https://arxiv.org/html/2609.01846#bib.bib9))支持这种直观的导航方式。 目前最先进的技术在将讲座视频集转变为互动学习伙伴这一更广泛目标上仍存在显著差距。章节索引可以显示讨论主题的位置,但无法回答学生的问题。通用聊天机器人可以回答学生的问题,但其内容可能与讲师的阐述不匹配。此外,聊天机器人无法回答具体的后勤问题,如测验的日期和形式。 该项目始于对讲师的承诺:答案必须来自活跃课程的讲座材料,并且每个答案都必须指向相关的视频片段。因此,课程关联是必需的,而不仅仅是技术偏好。 在VideoPoints平台中实现和部署讲座视频聊天机器人的方法如下。在第一阶段(2025年秋季),使用Gemini-2.5 flash-lite将讲座视频划分为章节,并使用GPT-4.1 Mini为每个章节生成摘要。学生可以访问这些摘要。在第二阶段(2026年春季),章节摘要成为检索层中排序的辅助工具,用于生成最符合学生问题的基于课程的回答。因此,章节摘要既作为面向学生的导航辅助,也作为检索锚点。 我们围绕三个研究问题组织这项研究:RQ1,学生如何在真实的课程作业中使用基于课程的视频聊天机器人;RQ2,聊天机器人在何时提供引用支持、课程隔离的答案,何时拒绝或未能满足学生请求,以及这些结果取决于哪些检索设计选择;RQ3,学生如何看待章节摘要、带时间戳的引用、信任和考试实用性,以及他们报告了哪些未满足的学习需求。 为了回答这些问题,我们结合了生产日志、检索痕迹、调查响应以及对引用支持和拒绝行为的诊断性审计。我们还在EduVidQA上评估了检索设计,这是一个公共的讲座视频问答基准(Ray等人,2025 (https://arxiv.org/html/2609.01846#bib.bib17))。这项控制性评估在相同的语料库、问题和检索预算下,将完整系统与检索基线进行比较。 本文有三方面的贡献。首先,它报告了一个为期一个多学期、多课程的部署,并描述了学生如何使用和看待一个以引用优先的讲座视频聊天机器人。其次,它分别评估了系统的关联性和其检索设计。生产审计估算了所引用的讲座片段在多大程度上支持生成的答案,而控制性基准则将检索设计与仅密集检索和无课程限制的基线进行了比较。第三,它确定了关于课程隔离、问题重构以及基于检索的问答与学生任务导向需求之间不匹配的可转移部署经验。这项贡献不是一个新的RAG架构,而是关于已知架构在真实教学和部署约束下如何运作的证据。 ## 2 相关工作 ##### 讲座视频导航。 讲座视频系统长期以来一直致力于帮助学生找到相关内容。VideoPoints平台为STEM课程引入了基于主题的分割和索引讲座导航(Tuna等人,2015 (https://arxiv.org/html/2609.01846#bib.bib14);Tuna等人,2017 (https://arxiv.org/html/2609.01846#bib.bib15))。后来的工作增加了AI生成的视觉和文本摘要,以改善导航和复习(Rahman等人,2020 (https://arxiv.org/html/2609.01846#bib.bib8);Rahman等人,2024 (https://arxiv.org/html/2609.01846#bib.bib9))。其他系统使用视觉锚点、结构提示或转录文本来支持对教育视频的非线性访问(Yadav等人,2016 (https://arxiv.org/html/2609.01846#bib.bib16);Das和Das,2019 (https://arxiv.org/html/2609.01846#bib.bib2))。这些系统改善了对讲座内容的访问,而本文工作的目标是部署在讲座视频之上的、基于课程的对话式聊天机器人。LLM生成的摘要可以支持学生复习。先前的研究发现,同时获得讲座视频和AI生成摘要的学生报告了积极的评价,并且在某些情况下,学习成果有所提高(Gonzalez等人,2023 (https://arxiv.org/html/2609.01846#bib.bib5))。 ##### 教育中的检索增强生成。 检索增强生成为从外部材料回答问题提供了一种自然方法(Lewis等人,2020 (https://arxiv.org/html/2609.01846#bib.bib6))。教育RAG系统可以提高课程特定性,但它们也引发了对信任、引用质量以及生成答案与教学情境不匹配的担忧。Tanner等人(2025)(https://arxiv.org/html/2609.01846#bib.bib13)在评估环境中研究了基于讲座视频的检索增强问答。SyllabusQA研究了基于课程后勤文档的问答(Fernandez等人,2024 (https://arxiv.org/html/2609.01846#bib.bib3))。教育聊天机器人已经支持了学生支持、辅导和课程协助(Taneja等人,2024 (https://arxiv.org/html/2609.01846#bib.bib4);De La Roca等人,2024 (https://arxiv.org/html/2609.01846#bib.bib11);Rouhani和Yadegari,2025 (https://arxiv.org/html/2609.01846#bib.bib12))。我们的研究通过专注于生产使用:真实课程、真实学生问题、带时间戳的视频引用以及由讲师驱动的课程隔离,来补充这些工作。 ## 3 系统与部署环境 ### 3.1 VideoPoints平台 部署使用了VideoPoints,这是一个在大型公立大学STEM课程中使用的生产讲座视频平台。该平台提供缩略图、字幕、搜索、转录文本、关键词、视觉高亮,以及讲师用于调整章节边界的工具(Rahman等人,2024 (https://arxiv.org/html/2609.01846#bib.bib9);Biswas等人,2025 (https://arxiv.org/html/2609.01846#bib.bib7))。它还使用Gemini-2.5 flash-lite将讲座划分为基于主题的章节。本文讨论的部署利用了现有的VideoPoints基础设施。聊天机器人界面的完整视图在附录A.1 (https://arxiv.org/html/2609.01846#A1.SS1)中提供(图2 (https://arxiv.org/html/2609.01846#A1.F2))。 ### 3.2 章节摘要 每个讲座章节都使用GPT-4.1 Mini生成一个LLM生成的标题和摘要。摘要显示在平台的播放器页面上,当鼠标悬停在章节索引上时可见。实际目标很简单:学生应该能够在观看一个章节之前决定它是否相关。这个设计在聊天机器人部署之前的第一阶段进行了测试。界面的章节摘要视图示例在附录A.1 (https://arxiv.org/html/2609.01846#A1.SS1)中提供(图3 (https://arxiv.org/html/2609.01846#A1.F3))。 这些摘要在春季聊天机器人中扮演了第二个角色。使用第一阶段评估的相同提示,为2026年春季的讲座生成了新的摘要。由于每个摘要只生成一次并与章节一起存储,聊天机器人可以在查询时将其用作相关性信号,而无需生成新的摘要。与原始的转录文本片段相比,章节摘要提供了更短、更清晰的讲座主题描述。因此,系统在对转录文本和幻灯片文本块进行排序时,使用查询摘要相似度作为软先验。这个先验不排除活跃课程中的任何材料。它只是提高了那些摘要更匹配学生问题的章节的文本块的分数。 ### 3.3 以引用优先的RAG流水线 讲座视频支持聊天机器人的设计反映了以下关键的部署约束。首先,讲师要求仅提供课程内的答案。其次,引用必须是可点击的并绑定到时间戳。第三,学生文本必须在不保留身份信息的情况下进行处理。第四,系统必须响应足够快以供日常学习使用。这些约束排除了通用聊天机器人,并推动了一个仅检索的设计。 图1 (https://arxiv.org/html/2609.01846#S3.F1)总结了部署的流水线。首先,使用all-MiniLM-L6-v2嵌入(Reimers和Gurevych,2019 (https://arxiv.org/html/2609.01846#bib.bib10))对学生问题进行编码。其次,检索被限制在活跃课程内。第三,章节摘要被用作软相关性先验而非硬性过滤:所有转录文本和幻灯片文本块仍然有资格,但来自摘要匹配度更好的章节的文本块排名更高。最终分数结合了密集相似度、BM25词汇相似度和章节摘要先验。这种设计在保持召回率的同时,使用摘要作为嘈杂讲座转录文本的更清晰的检索锚点。第四,检索到的上下文被传递给Gemini-2.5 flash-lite以生成答案,提示要求基于时间戳。最后,系统返回一个带有时间戳引用的答案,链接回讲座视频中的相关章节。 学生问题→\\rightarrow课程过滤→\\rightarrow章节摘要先验→\\rightarrow密集/BM25/先验排序→\\rightarrow前-k个转录文本/幻灯片文本块→\\rightarrow答案生成→\\rightarrow带时间戳的引用。 图1:Cite或Decline聊天机器人检索流水线。附录A.2 (https://arxiv.org/html/2609.01846#A1.SS2)给出了评分函数和模型选择。 ### 3.4 部署阶段与使用情况 表1 (https://arxiv.org/html/2609.01846#S3.T1)总结了部署和学生使用情况。第一阶段于2025年秋季运行,从128名受访者中收集了摘要反馈。聊天机器人尚未部署。第二阶段于2026年春季运行,在93天内收集了聊天机器人日志。它还从41名学生中收集了调查响应,其中22名自称是聊天机器人用户。两个阶段都在我们实验室现有的基础设施上运行,因此唯一的边际成本是模型API使用费:总计约100美元,包括开发费用。 表1:部署概述。第一阶段测量了聊天机器人发布前对章节摘要的看法。第二阶段测量了聊天机器人的使用情况、检索痕迹和学生看法。 ## 4 评估方法论 评估结合了调查数据、系统日志、检索痕迹、去标识化的案例分析、对生产消息的诊断性审计以及控制性的离线检索评估。它不测量学习成果,也不包含随机对照组。因此,我们的声明集中在部署行为、感知的有用性、关联性覆盖范围和生产故障模式上。 ##### 调查测量。 2025年秋季调查测量了摘要准确性、导航价值、复习价值、期望的摘要长度以及对聊天机器人的部署前兴趣,而2026年春季调查测量了聊天机器人体验,包括易用性、信任、引用有用性、考试实用性、答案长度偏好、教科书集成兴趣以及练习题兴趣。所有调查项目均使用1-5 Likert量表。我们报告每个项目的响应数量,因为有些受访者并未回答每个项目。我们请讲师通过电子邮件向学生介绍这些功能并分发调查链接,VideoPoints网站上的横幅也链接到这些内容。参与完全是可选的。 ##### 隐私与日志测量。 为保护学生隐私,会话标识符在分析前进行了加盐哈希处理。原始日志保留在本地基础设施上。对于诊断性审计,问题和响应经过了去标识化处理,并在筛选后的文本发送到外部模型API之前筛查了直接标识符。本文中我们没有报告逐字的学生示例,所有案例描述都是转述且去标识化的。每个存储的聊天记录包含学生的问题、聊天机器人的响应以及任何返回的视频匹配项。 ##### 诊断性审计。 生产日志中的引用存在并不能表明所引用的讲座片段是否支持答案。因此,我们对224条独特消息进行了分层的LLM辅助审计。样本包括所有四个引用-拒绝结果组,其中两个较小的组和所有祈使句请求被完全审计。该审计评估了引用支持、证据相关性、拒绝适当性以及原始正则表达式遗漏的隐式拒绝。抽样权重将审计组映射回833条消息的总体。这些判断提供诊断性估计值,而非经过人工验证的真实性标签。附录A.4 (https://arxiv.org/html/2609.01846#A1.SS4)报告了抽样设计、评判者配置和置信区间程序。 ##### 离线检索评估。 生产流量无法提供实时基线,因为讲师要求仅检索课程内容。因此,我们在EduVidQA(Ray等人,2025 (https://arxiv.org/html/2609.01846#bib.bib17))的真实测试集上评估了检索设计。该评估包含来自99个讲座的269个问题,涵盖了十门课程中的七门,语料库包含139个视频、10门课程、1,062个章节和5,924个文本块。我们使用LLM将视频分组为课程,并生成章节边界和摘要;这些分配只产生一次,并在所有检索臂中保持不变。每个检索臂使用相同的语料库、问题、嵌入、分块、上下文预算和检索预算。该实验重现了
相似文章
学生ChatGPT写作指南
OpenAI发布了一份面向学生的指南,指导如何负责任地使用ChatGPT来提升写作和思维能力,同时保持学术诚信,强调AI使用的透明度和适当引用。
如何教学在作业写作中道德使用AI?
本文讨论了教导学生在学术写作中道德使用ChatGPT的策略,重点在于通过提示工程支持批判性思维,而非取代它。
嘿,Chat,你能教我吗?面向人类现实学习的苏格拉底式对话结构化
本文提出了一种系统,将先验知识图谱与基于PPO的策略相结合,以结构化LLM的苏格拉底式辅导,实验表明,在学生的掌握程度和效率上,该系统优于启发式方法和前沿模型基线。
CRISS:用于辅助肿瘤登记员的检索增强型AI聊天机器人
CRISS 是一种检索增强型AI聊天机器人,旨在协助肿瘤登记员解读复杂的编码与分期指南,已在培训场景中评估其准确性与实用性。
TRACE:可信检索增强对话引擎
TRACE 是一种面向公共服务聊天机器人的检索增强对话引擎,通过增强对嘈杂目录的检索质量来改进约束感知推荐,同时减少幻觉响应。