TeachMateGPT:基于多智能体的知识驱动框架,用于从科学课程材料生成教学评估
摘要
TeachMateGPT提出一个多智能体框架,改进了检索增强生成技术,用于从科学教科书创建教学评估,与基线系统相比,实现了更高的忠实度和答案相关性。
arXiv:2608.13708v1 公告类型:新
摘要:自动生成基于教科书的评估项目可以减轻科学教师的工作负担,但现有的检索增强生成(RAG)系统依赖扁平检索,仅支持单一问题生成,缺乏对弱证据的保护措施,并且不适用于低资源、考试结构化的课程。我们通过TeachMateGPT解决这些局限性,这是一个多智能体系统,为基于课程的科学评估编写做出了四项贡献。 (i) COPE,一个分层知识库,用多分辨率索引替代了基于令牌窗口的分块,该索引沿着教学大纲结构对文档进行分段,并通过可遍历的图谱世系在三个粒度上链接它们,将证据匹配到每个主题的教学水平。 (ii) 一个分阶段、失败关闭的代理管道,替代一次性的检索然后生成:路由门控搜索,检索在覆盖门控下融合密集和词汇证据,该门控在证据不足时阻止生成,专家代理起草客观题和建构反应题。 (iii) SAVER,一个源归因验证协议,根据检索的证据对忠实度、相关性和幻觉风险进行评分,在每个创造性问题的四个子部分应用更严格的接地检查,与教师在环评估而非自动过滤配对。 (iv) NCTB-SciGen8,一个基于课程的数据集,包含198个项目(143个多项选择题,55个创造性问题),涵盖NCTB八年级科学教科书的所有14章,由该管道生成并由三位在职教师评分。TeachMateGPT提高了忠实度(0.68 → 0.96)和答案相关性(0.60 → 0.89)相比原始RAG基线。
查看缓存全文
缓存时间: 2026/08/17 09:43
# TeachMateGPT:一种用于从科学课程教材生成教学评估项的多智能体知识基框架 **来源:** https://arxiv.org/html/2608.13708 **作者:** Mukaffi Bin Moin(孟加拉国阿赫桑努拉科技大学),M. F. Mridha(孟加拉国美国国际大学),Jubayer Al Mahmud(孟加拉国杰索尔理工大学) **通讯邮箱:** [[email protected]](mailto:[email protected]), [[email protected]](mailto:[email protected]) ###### 摘要 自动生成基于教材的评估项可以减轻理科教师的工作负担,但现有的检索增强生成(RAG)系统依赖扁平检索、仅支持单一问题生成、缺乏对弱证据的保障措施,且不适用于低资源、以考试大纲结构为主的课程。我们通过 **TeachMateGPT** 解决了这些局限性,这是一个多智能体系统,为基于课程的科学评估设计带来了四项进展: (i) **COPE**,一个分层知识库,用多分辨率索引替代了基于令牌窗口的分块方法,该索引沿课程结构分割文档,并通过可遍历的图谱式谱系以三种粒度链接文档,使证据与每个主题的教学层级相匹配。 (ii) 一个分阶段、失败即关闭的智能体流水线,替代了一次性的“检索后生成”模式:路由门控搜索,检索在覆盖度门控下融合密集和词汇证据,当证据不足时会阻止生成;此外,专用智能体负责起草客观题和建构反应题。 (iii) **SAVER**,一种来源归因验证协议,针对检索到的证据对忠实度、相关性和幻觉风险进行评分,并对每个创造性问题的四个子部分实施更严格的接地检查,结合**教师在环评估**而非自动过滤。 (iv) **NCTB-SciGen8**,一个基于课程的评估数据集,包含198个评估项(143道选择题,55道创造性问题),涵盖孟加拉国国家课程与教材委员会(NCTB)八年级科学教材的所有14章,由流水线生成并由三名在职教师评级。 TeachMateGPT 将**忠实度**(0.68 → 0.96)和**答案相关性**(0.60 → 0.89)相比原生 RAG 基准线显著提升。 ## 1 引言 参见插图 **图1**:该图展示了从教师的自然语言查询(包含目标难度级别)到基于课程的评估生成的流程。**TeachMateGPT** 检索相关教材内容,并生成与请求主题和难度相匹配的考试大纲式 CQ 和 MCQ。 大语言模型(LLMs)可以加速评估创作,但不受约束的生成可能引入无支撑的事实、章节偏离、弱干扰项或无效的考试结构。这要求在具有教学约束的知识基、多格式生成,能检索可靠证据、在证据不足时阻止生成,并提供出处供教师验证。这对孟加拉国理科教师尤为重要,他们需要根据国家课程与教材委员会(NCTB)大纲为八年级准备评估,其中评估项必须与教材对齐、使用孟加拉语,并匹配预期难度。 检索增强生成(RAG)通过将 LLM 与外部知识库耦合、在检索到的段落上条件化生成来解决幻觉问题,目前在教育自然语言处理中已很常见(27;21)。最近的基于 RAG 的系统检索课程材料或考试语料库来生成评估项和答案键(16;14;26),从领域知识库构建混合格式的考试(9),并支持如孟加拉语 B-RAG 和 NCTB-QA 等教材资源(1;15;8)。其他研究通过师生推理改进干扰项质量(23),以及通过知识图谱进行难度控制生成(3)。 然而,现有的 RAG 系统依赖于对通用分块的扁平检索,且目标是通用问题生成,而非特定课程、考试大纲式的评估设计。对于孟加拉语 NCTB 资源,现有系统主要专注于回答问题,而不是生成面向教师、具有证据感知拒绝能力的多格式评估。 虽然 RAG 提供了接地,但原生的“检索后生成”流水线对于评估设计仍然不足。教师的请求可能需要澄清,检索必须考虑课程上下文和有噪声的教材来源,评估格式施加了不同的教学约束,生成的评估项需要在课堂使用前进行验证。因此,近期的教育系统采用了智能体工作流,协调路由、检索、生成和验证,而不是依赖单一的生成步骤(5;26;3;29;12)。然而,现有系统仍以英语为中心,在查询澄清、多格式生成和来源归因验证方面支持有限。 基于这些观察,我们引入了 **TeachMateGPT**,一个用于孟加拉语八年级 NCTB 科学评估生成的多智能体、基于课程的框架,具有四项贡献。 首先,**COPE**(课程导向教学嵌入),一个分层课程索引,在多个教学分辨率上组织教材内容;不同于通用的父-子分块,每个分块在摄取时都携带谱系和邻居链接,检索可以遍历这些链接以恢复相关的教学内容,移除 COPE 会导致答案相关性在消融组件中下降最大,同时刺激真实性也显著降低。 其次,一个分阶段、失败即关闭的多智能体流水线,用于查询路由、混合检索、证据细化和特定格式生成,包含用于证据恢复的 **CCI**(上下文内容注入)和用于减少冗余的 **CCR**(基于共识的冲突解决)。 第三,**SAVER**(来源归因验证与证据排名),在提交给教师前对忠实度、相关性和幻觉风险进行评分,并将无支撑的评估项标记以供审查,而非自动过滤。 第四,**NCTB-SciGen8**,一个基于课程的评估数据集,直接由流水线生成并由三名在职科学教师评审。 这四项贡献共同解决了以下研究问题: - • **RQ1**:如何将授权的科学教科书组织成一个检索就绪的课程知识库,以保留用于评估生成的教学层级? - • **RQ2**:教师查询应如何安全路由和澄清,以便只有明确指定的课程评估请求才能进入证据检索? - • **RQ3**:如何检索和细化课程证据,以使生成的评估保持主题一致、上下文完整,并在覆盖不足时阻止生成? - • **RQ4**:如何在可控难度下生成多种课堂评估格式(选择题和考试大纲式创造性问题),同时保持基于检索到的课程证据? - • **RQ5**:如何通过自动来源归因验证结合教师在环审查过程,支持在课堂使用前对 AI 生成评估项的可靠接受、编辑或警示? 图1展示了与 **TeachMateGPT** 的示例交互,并说明了从教师查询到基于课程的评估项的多智能体工作流。 ## 2 相关工作 ### 2.1 用于教育自然语言处理的检索增强生成 RAG 将 LLM 与外部知识源连接,在生成过程中纳入证据。最近的综述强调了它在教育应用中日益增长的作用,特别是在需要可靠访问教学材料的知识密集型任务中(27;21)。现有研究探索了基于检索的评估创建,包括从课程文档和考试档案中生成带答案键的 MCQ(16;14;26),从领域知识库构建混合格式考试(9),以及基于教材的教育问答(1)。对于低资源教育环境,如 B-RAG 和 NCTB-QA 等孟加拉语资源提供了特定课程的检索基准,并展示了基于 NCTB 的教育系统的潜力(15;8)。补充研究探索了基于推理的策略以改进干扰项质量(23),以及具有认知难度控制的知识图谱引导生成(3)。 ### 2.2 用于教育评估生成的智能体工作流 近期的教育系统越来越多地使用基于智能体的架构,将复杂的评估任务分配给专门的组件。**CODE-GEN** 提出了一个用于编程理解 MCQ 的人类在环 RAG 智能体框架,其中独立的模块处理评估项创建和质量评估(5)。其他方法将教育工作流分布在文档分析、检索、问题构建和评估等智能体中,以提高与课程内容的一致性(26)。知识图谱增强的多智能体 RAG 框架进一步通过布鲁姆分类法和项目反应理论整合认知目标和难度校准(3)。相关研究探索了协作生成策略,如多智能体 MCQ 构建和师生推理,以提高干扰项质量和评估可靠性(28;23)。 ### 2.3 研究缺口 尽管最近的研究推进了教育评估生成,但它们主要关注流水线的孤立组件。表1总结了代表性系统,并突出了现有方法中缺失的能力。 ## 3 TeachMateGPT 框架 图2展示了 **TeachMateGPT** 的端到端架构,它将教师的教学请求转化为基于课程的评估。算法1(附录F)总结了完整的框架。 ### 3.1 任务定义 给定一组授权的 NCTB 八年级科学课程文档,目标是生成由可验证的课程证据支持的、对齐课程的评估。形式上,设 $\mathcal{D} = \{d_1, d_2, \ldots, d_n\}$ 表示课程文档集合。该框架首先构建一个分层的课程知识库: $\mathcal{K} = \mathrm{COPE}(\mathcal{D})$ (1) 其中 **COPE** 将课程文档转换为分层的检索就绪表示。给定教师查询 $q$,检索模块访问课程知识库并返回支持证据: $E = R(\mathcal{K}, q)$ (2) 其中 $R(\cdot)$ 表示课程检索模块。使用检索到的证据 $E$、请求的难度级别 $\ell$ 以及评估类型 $S \in \{\mathrm{MCQ}, \mathrm{CQ}\}$,生成模块产生评估集: $A = G(E, \ell, S, q)$ (3) 其中 $G(\cdot)$ 表示评估生成模块。最后,生成的评估由 **SAVER** 进行验证: $V = \mathrm{SAVER}(q, E, A)$ (4) 其中 $V$ 是验证报告,$\mathrm{SAVER}(\cdot)$ 执行来源归因验证和证据排名,详见第3.6节。 **图2**:**TeachMateGPT** 的端到端架构。每个教师查询流经基于 COPE 的课程知识库 $\mathcal{K}$、意图分析和路由、混合密集-BM25 检索(含上下文恢复和覆盖度检查)、基于教材的 MCQ 和考试大纲式创造性问题($U_d/d_i/p_k$,子问题 $k\text{--}h$)的生成、证据支持、忠实度和相关性的来源归因验证,以及打包成可审计、可追溯至教材的输出,详细内容见后续小节。 ### 3.2 阶段一:知识库构建(COPE) 可靠的基于课程的生成需要保留教育内容教学结构的检索单元。**COPE** 将授权的 NCTB 八年级科学教科书构建为分层的课程知识库,作为部署前的一次性预处理步骤。COPE 包括五个顺序步骤:课程获取、分层结构分割、多分辨率教学分块、图感知知识构建和基于嵌入的索引。 ##### (1) 课程获取。 该框架收集授权的 NCTB 文档,并将它们转换为机器可读文本,同时保留章标题、节标题、定义、示例、表格、题目块和科学术语,适用于数字生成和扫描的教科书。在分割之前,归一化阶段会移除转换和 OCR 伪影,同时保留语义完整性。结果是一个干净的、结构保真的语料库,准备进行分层结构分割。 ##### (2) 分层结构分割。 与使用固定大小窗口的传统 RAG 系统不同,**COPE** 直接建模课程文档的教学组织。每本教科书沿教学边界被划分为结构单元:章、课、节、总结、练习块,较长的单元会进一步分解为更细的粒度,同时保留父-子关系。因此,每个文本片段都保留了其在课程层级中的位置,让检索可以利用局部内容和更广泛的教学上下文。 ##### (3) 多分辨率教学分块。 教育查询的粒度各不相同:有些需要广泛的概念解释,而另一些则针对特定的定义或事实细节。因此,**COPE** 以多个教学分辨率表示课程内容,而不是依赖单一的固定分块大小。较大的分块保留章级上下文,中等分块捕获连贯的概念,而更细的分块隔离详细知识,允许检索动态匹配适当的抽象层级以响应教师的请求。表3
相似文章
智能体是否准备好教学?面向真实教学工作的多阶段基准
介绍了EduAgentBench,一个基于源的基准,用于评估辅导智能体在教学专业判断、多轮辅导以及自主教学工作流程执行方面的能力。对前沿模型的评估表明,它们在情境化辅导和工作流任务中仍未能达到专业教学标准。
利用课程先决条件图从对话式AI交互中检测知识缺口
该论文提出了一种流水线,利用少样本文本分类器和GPT-4提取的先决条件知识图谱,将学生在对话式AI助教中提出的问题映射到课程主题。在1,340个问题事件上实现了80%的准确率,并与学生自我报告的难度相关。
使用ChatGPT Work和Codex学习与教学的新方法
OpenAI宣布为ChatGPT Work和Codex推出三款新的教育插件,旨在帮助学生和教育工作者利用智能体AI能力处理课程材料,可通过ChatGPT Edu和ChatGPT for Teachers获取。
LectūraAgents: 自适应个性化AI辅助学习与具身教学的多智能体框架
LectūraAgents是一个用于自适应个性化学习的多智能体框架,它模拟教授与学生的互动,并生成与学习者画像对齐的具身教学动作。它引入了层级架构、自适应具身教学机制以及教学动作-语音对齐算法,在现有方法上表现出一致的改进。
ChatGPT 现已开始为教科书生成内容。
本文报道,AI 工具 ChatGPT 目前正被用于编写教育教科书的内容。这标志着大语言模型在出版行业的一个新应用领域。