标签
StudentSim从稀疏数据中训练个性化的基于LLM的学生模拟器,以镜像学习者响应并适应导师指导,在国际象棋、写作和数学领域超越GPT-5.4。
该论文介绍了一种使用Poly-Encoders的新方法,用于计算高效的自动化创造力评估,其性能与大型语言模型相当,且计算需求显著降低。
OmniPhys 是一个大规模的多模态基准测试,专注于物理理解与生成,涵盖了从中学到大学级别的问题,源自中国教育语料库。其目标是评估并推动多模态大型语言模型在科学领域的发展。
本研究考察了不同模型和对话上下文中LLM生成的回复的语义一致性,强调了维护基于对话评估的稳定响应所需的基础设施和设计策略。
本文提出了一种针对AI生成教育视频的双层把关系统,结合教育工作者的输入和自动化指标来提升教学法质量,展示了基于原则的对AI输出的抵抗如何改进教学设计。
TRACE-BN 介绍了一个课程引导的数据集,用于结构化的孟加拉语-英语辅导,并展示了如何使用 LoRA 将此行为迁移到低于10亿参数的语言模型中,在资源受限的离线环境中显著提高了辅导质量。
TeachMateGPT提出一个多智能体框架,改进了检索增强生成技术,用于从科学教科书创建教学评估,与基线系统相比,实现了更高的忠实度和答案相关性。
本文介绍了LittleLearner,一个用于研究LLM知识获取的受控沙箱,使用K-5课程过滤的数据集,发现诸如规模化和后训练等干预措施能增强范围内的性能,但无法提升范围外的能力。
ProPRL提出了一种属性感知的前置关系学习框架,用于教育知识图谱,结合概念-资源超图和有向行为图,采用自适应成对条件融合与不可逆性约束,实现了最先进的性能。
本文提出了一种条件概化框架,用于在自动作文评分中评估不同作答条件下的非一致信度。
本文介绍了VectorizationLLM,这是一个基于Google开放权重模型和RAG知识库构建的专业LLM,旨在帮助学生使用MATLAB学习智能向量化、傅里叶分析和微分方程,而不直接提供答案。
本文评估了监督机器学习/深度学习模型和提示大语言模型在自动进行布卢姆分类学试题分类时的跨数据集泛化能力,发现大语言模型在不同教育背景下具有更强的鲁棒性。
IntElicit 是一个框架,利用带有分解过程奖励机制的对话策略优化,通过自适应AI访谈来激发和评估情境化创造力,减少领域知识和参与度等混杂因素。实验表明,与静态评估方法相比,它改善了创造性成果。
在塞拉利昂进行的一项预先注册试验发现,AI驱动的 Guided Learning 显著提高了数学成绩,在八周内实现了1.2至1.7年的进步,同时教师报告称其专业成长得到加强,并转向了引导者角色。
本文介绍了Elmes+,一个面向长尾教育场景下LLMs细粒度评估标准构建的自动化框架,并提出了涵盖11个学科330个场景的Edu-330基准。该框架使用多智能体引擎和自演化模块来协同优化评估标准与测试数据,揭示了顶级LLMs在多维教育能力上的差异。
TeachObs引入了一个经过人工验证的多模态教学观察基准,包含30个课堂视频,这些视频标注了片段级别的二元编码和课程级别的专家评分,并评估了五个前沿LLM在三个轨道上的表现,发现没有单一模型能持续优于其他模型,并且模型评估对程序清晰的课程给出了过高评价。
本文提出一个框架,利用领域专家知识来引导大语言模型,根据学生的书面推理提供即时自适应反馈。在一门大规模大学课程中,该框架使学生成绩提升了超过80%。
本文提出了一种用于教育类比生成的模块化流水线,将任务分解为四个阶段,并评估了12种大语言模型和7种嵌入模型。结果表明,子概念基础化能够提升解释质量和检索精度,同时采用了一种新颖的LLM作为裁判的评估方法,并针对七名人类标注员的标注进行了验证。
本文提出了高等教育中智能体多智能体AI平台的前瞻性视角,探讨了对支持学习、教学和机构运营的集成化、包容性系统的需求。它识别了当前碎片化AI工具的不足,并提出了可扩展、与人类对齐的多智能体生态系统的发展方向。
本文详细介绍了 RETUYT-INCO 团队参与 BEA 2026 共享任务 2 的情况,提出了一种用于德语简答题基于评分标准(rubric-based)评分的元提示词(meta-prompting)方法。