智能体是否准备好教学?面向真实教学工作的多阶段基准
摘要
介绍了EduAgentBench,一个基于源的基准,用于评估辅导智能体在教学专业判断、多轮辅导以及自主教学工作流程执行方面的能力。对前沿模型的评估表明,它们在情境化辅导和工作流任务中仍未能达到专业教学标准。
arXiv:2605.14322v1 Announce Type: new
摘要:语言智能体正越来越多地部署在复杂的专业工作流程中,而辅导已成为一项高风险能力,但在现有基准中却鲜有衡量。有效的辅导智能体不仅需要给出正确答案或执行准确的工具调用:一个稳健的辅导者必须诊断学习者状态、随时间调整支持、做出基于教育证据的教学合理决策,并在真实的学习管理系统中执行干预。我们引入了EduAgentBench,一个基于源的基准,用于全面评估辅导智能体在教学工作全范围的能力。它包含150个质量控制任务,涵盖三个能力层面:专业教学判断、情境化多轮辅导以及Canvas式教学工作流程完成。任务通过教学洞察驱动的流程构建,并采用互补验证信号和人工审查进行评估。通过对前沿模型的全面评估,我们的发现表明,当前模型通常能够进行有限的教学判断,但在情境化辅导和自主教学工作流程执行方面仍未达到专业教学标准。据我们所知,EduAgentBench是首个理论支撑且真实的基准,用于评估辅导智能体的整体教学能力,为开发能够支持真实教学工作的未来辅导智能体提供了测量基础。
查看缓存全文
缓存时间: 2026/05/15 06:23
# 智能体准备好教学了吗?面向真实教学工作流的多元基准评测
来源:https://arxiv.org/html/2605.14322
陈梓昕¹˒²\thanks{实习期间于Qwen团队完成的工作}\; 刘鹏²\; 圣睿¹\; 李浩博¹\; 涂剑虹²\; 邓晓东¹\; 沈嘉顺¹˒²\; 刘大亨¹\; 屈华民²
¹香港科技大学 ²阿里巴巴Qwen团队
[email protected]
###### 摘要
语言智能体正越来越多地部署在复杂的专业工作流中,其中教学辅导正成为一种高风险能力,但现有基准评测对此几乎未做测量。一个有效的辅导智能体不仅需要给出正确答案或准确调用工具:一个稳健的辅导智能体必须诊断学习者的状态,随时间调整支持,做出基于教育证据的教学合理决策,并在真实的学习管理系统中执行干预。我们提出**EduAgentBench**,一个基于真实来源的基准,用于全面评估辅导智能体在教学工作的全范围中的表现。它包含150个经过质量控制的评测任务,涵盖三个能力层面:专业教学判断、情境化多轮辅导以及Canvas风格教学工作流完成。任务通过一个教学洞察驱动的流水线构建,并使用互补的验证信号和人工评审进行评估。在对前沿模型的全面评估中,我们的发现表明,当前模型通常能够进行有限的教学判断,但在情境化辅导和自主教学工作流执行方面仍达不到专业教学标准。据我们所知,**EduAgentBench**是第一个以理论为基础、面向现实场景的基准,用于评估辅导智能体的整体教学能力,为开发能够支持真实教学工作的未来辅导智能体提供了测量基础。
## 1 引言
语言智能体正开始承担专业领域中日益复杂的工作,从软件工程到客户支持,甚至到科学发现[20, 21, 22, 38, 23]。教育是一个自然而重要的下一个前沿领域,但教学对智能体提出了异常广泛的要求。一个稳健的辅导智能体需要做的远不止回答问题:它必须诊断学习者的理解水平,决定何种支持在教学上是适当的,维持富有成效的互动,并且在许多情况下,通过课程管理系统采取行动,因为消息、成绩、测验和干预措施会影响真实的学生[37]。
当前的评测尚未测量这完整的教学对象。现有的教育基准通常评估学科能力或局部辅导支持:解答试题、生成解释、提供提示或对单个学生查询给出反馈。这些信号无法揭示智能体是否能在学生反复失败后调整支架,区分侥幸答对与真正理解,或验证学生的知识迁移。相比之下,智能体基准越来越多地测试工具使用和与环境交互,但很少将完成一个*教学*工作流定义为成功。一个模型可以调用正确的API、发送通知或生成测验,同时却基于错误的证据行动,忽略学习困难学生的情感和动机需求,或创建未能针对已诊断误解的材料。
基于教学理论,我们认为辅导智能体的准备度需要三个可分离的能力层面。首先,**教学判断**是教师推理问题:智能体必须诊断学生的误解,评估评估证据,推理先决条件,并做出基于教学知识和形成性评估的干预决策[1, 2, 14, 39, 4]。其次,**情境化辅导**是对轨迹敏感的交互问题:同一个提示在对话早期可能有帮助,但在学习者已经反复失败后可能有害[12, 13, 40, 15]。第三,**教学工作流执行**是制度性行动问题:一个可信的辅导智能体必须将教育决策转化为基于证据的消息、学习材料、评估工件以及通过学习管理环境与学生进行的沟通。
为了为开发能够支持真实教学工作的未来辅导智能体提供测量基础,我们提出**EduAgentBench**,一个理论驱动、基于真实来源的基准,用于全面评估辅导智能体在教学工作全范围中的表现。**EduAgentBench**包含150个经过质量控制的评测任务,涵盖上述三个教学层面和六种教师工作能力:诊断、设计、创造、教学、沟通和评估[37]。我们不是随意构建任务,而是使用一个*教学洞察驱动*的流水线:每个任务从一个目标教学洞察开始,基于真实的教育来源(如公开评估、课程开放材料或教学文献),然后转化为一个包含课程状态、学生数据、可通过工具访问的工件以及可验证的成功标准的情境化场景。例如,一个任务将智能体置于一个有120名学生的课程中,提供测验历史和近期提交,要求它诊断哪些学生因先决概念受阻并向其发送有针对性的反馈,然后通过确定性检查所选学生、引用的证据以及生成的Canvas消息内容来评判成功与否。这种构建方式让**EduAgentBench**不仅能评估智能体是否知道正确的教学原则,还能评估它是否能够通过真实的教学行动应用该原则。
在对前沿模型的全面评估中,我们的发现揭示了“知道教学法”与“实践教学法”之间存在明显差距。当前模型在有限的教学判断任务上通常表现良好,例如识别误解、选择反馈策略以及回答结构化的教学决策问题。然而,当这些判断必须在现实环境中执行时,性能显著下降:多轮辅导、跨学生历史协调证据,或完成工具中介的教学工作流。这些结果促使**EduAgentBench**成为辅导智能体开发下一阶段的基础:从知道什么是好的教学,转向在真实教育环境中可靠地实施它。总之,我们的贡献如下:
- •我们提出了一个理论驱动的框架,用于评估辅导智能体在三个教学层面——教学判断、情境化辅导和教学工作流执行——以及六种教师工作能力上的表现。
- •我们提出了**EduAgentBench**,一个包含**150个经过质量控制的评测任务**的基于来源的基准,通过洞察优先、验证器匹配的构建流水线,将真实的教育来源转化为情境化、可验证的辅导智能体任务。
- •我们评估了前沿模型,并识别出教学判断与教学行动之间的核心差距,失败集中在多轮辅导和工具中介的工作流中,这些工作流需要证据使用、学生适应和忠实执行。
## 2 相关基准与缺失的教学系统评测
现有基准为评估教育智能体提供了重要组成部分,但它们尚未将辅导智能体作为完整的教学系统来测量。教育QA和考试型基准(如MATH、MMLU、E-EVAL、EduEval和EduBench)评估学科能力、认知难度、教育场景或考试型问题解决[6, 24, 25, 26, 27]。辅导对话和辅导回应资源(如MathDial、MathTutorBench、TutorBench和LearnLM风格评测)通过评估提示、解释、反馈或局部辅导质量更接近教学[5, 28, 29, 30]。学生建模和学习分析资源(如ASSISTments、EdNet和MOOCCubeX)估计学习者状态、参与度或风险[31, 32, 33]。通用智能体基准(如τ-bench、TheAgentCompany和Toolathlon)评估工具使用、状态变更和长程工作流执行,但未围绕教学有效性设计[34, 35, 36]。这些资源涵盖了重要成分,但教师级别的准备度需要它们的结合:教学判断、跨轨迹的适应性辅导以及在学习管理环境中基于证据的行动。
| 基准/资源 | 单位 | 主题内容 | 局部辅导回应 | 完整辅导轨迹 | 教师判断/PCK | LMS/工具行动 | 受教学约束的行动 | 状态/过程检查 | 学习结果 |
|-----------|------|----------|--------------|--------------|--------------|--------------|------------------|----------------|----------|
| *教育QA和考试型基准* | | | | | | | | | |
| MATH | 问题 | ✓ | × | × | × | × | × | × | × |
| MMLU | 试题 | ✓ | × | × | × | × | × | × | × |
| E-EVAL | 试题 | ✓ | △ | × | △ | × | × | × | × |
| EduEval | 教育场景 | ✓ | △ | × | △ | × | × | × | × |
| EduBench | 教育场景 | ✓ | △ | × | △ | × | × | × | × |
| *辅导对话和局部辅导回应基准* | | | | | | | | | |
| MathDial | 对话 | △ | ✓ | △ | △ | × | △ | × | × |
| MathTutorBench | 辅导回应 | △ | ✓ | △ | △ | × | △ | △ | △ |
| TutorBench | 辅导回应 | △ | ✓ | △ | △ | × | △ | △ | △ |
| LearnLM评测 | 辅导场景 | △ | ✓ | △ | △ | × | △ | △ | △ |
| *学生建模和学习分析资源* | | | | | | | | | |
| ASSISTments | 学习者日志 | △ | × | × | △ | × | × | △ | ✓ |
| EdNet | 学习者日志 | △ | × | × | △ | × | × | △ | ✓ |
| MOOCCubeX | 学习图谱 | △ | × | × | △ | × | × | △ | △ |
| *通用智能体和工具使用基准* | | | | | | | | | |
| τ-bench | 工具任务 | × | × | × | × | ✓ | × | ✓ | × |
| TheAgentCompany | 工作场所任务 | × | × | × | × | ✓ | × | ✓ | × |
| Toolathlon | 工具工作流 | × | × | × | × | ✓ | × | ✓ | × |
| *教学系统基准* | | | | | | | | | |
| **EduAgentBench** | 教学片段 | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ | ✓ |
表1:与代表性教育和智能体基准的定位比较。✓表示主要目标,△表示部分或间接覆盖,×表示无主要覆盖。先前资源涵盖了重要成分,但**EduAgentBench**针对教师级别准备度所需的关键结合:教学判断、情境化辅导和受教学约束的制度性教学行动。
因此,缺失的对象不仅仅是一个更大的教育数据集或一个更真实的工具使用基准。它是一个*教学系统片段*:一个评测单元,其中智能体必须从教育证据进行推理,在教学约束下行动,并留下可检查的可观察痕迹。一个模型可以回答试题而不知道如何辅导学习困难的学生;它可以写出一个看似合理的提示但无法在轨迹中适应;它可以预测学生风险但不选择干预;它可以调用LMS工具而不将行动基于学生证据。**EduAgentBench**旨在评测这个缺失的结合:教学判断、情境化多轮辅导以及在教学约束下的教学工作流执行。下一节定义了这个基准对象,并描述了如何从目标教育洞察、基于证据和验证器匹配的评估信号构建每个任务。
## 3 EduAgentBench:基于真实来源的基准设计
**EduAgentBench**将第2节中识别的缺失教学系统片段转化为150个基于真实来源的测量合约:50个教学判断任务、40个情境化辅导任务和60个教学工作流任务。每个合约指定四个元素:目标教育洞察、使该洞察可恢复的证据、智能体必须在其上行动的运行时层面,以及拒绝似是而非的捷径的验证器族。这种基于合约的观点至关重要:基准不是一个提示集合,而是一组可审计的教育情境。
设计遵循逆向设计原则。我们从称职教师应该完成的工作出发,而不是从可用的工具或方便的提示开始。能力分类基于教学内容知识、形成性评估、支架式教学、教学设计、评估素养和数据驱动教学[1, 2, 14, 13, 12, 3, 4, 16]。这些理论驱动了六种教师工作能力——诊断、设计、创造、教学、沟通和评估——通过三个分阶段的能力层面实现。图1总结了构建和评估流水线。相似文章
LessonBench-V1:评估AI课程生成代理的基准数据集
LessonBench-V1是一个新的基准数据集,将647个人类编写的STEM课程与逆向工程的教学计划配对,能够系统评估AI课程生成代理。
HealthAgentBench: 面向前沿AI智能体的统一真实医疗智能体环境基准套件
本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。
SaaS-Bench:计算机使用代理能否利用真实世界的SaaS解决专业工作流程?
SaaS-Bench是一个新的基准测试,基于23个可部署的SaaS系统,覆盖六个专业领域,包含106个长周期任务,用于评估计算机使用代理。实验表明,即使是最强的模型,端到端完成任务的比例也不足4%,凸显了当前代理能力的显著限制。
JobBench:让智能体工作与人类意愿对齐
JobBench 是一个基于工人调查构建的基准,用于评估 AI 智能体在工人最希望自动化的任务上的表现,涵盖 35 个职业的 130 个任务,并配备详细的评分细则。
Agent-ValueBench:一个评估智能体价值观的综合基准
本文提出了 Agent-ValueBench,这是一个旨在评估自主智能体价值观的综合基准,揭示了智能体的价值观与其底层语言模型存在分歧。