EduPanel: 一种用于教学视频的三智能体LLM评判器——可靠性、互补性与人类信任校准

Hugging Face Daily Papers 论文

摘要

EduPanel是一种基于评分标准、面向学习者的LLM评判器,它使用三个专门的智能体来评估教学视频质量,实现了与人类专家相当的可靠性,同时提高了评分准确性并保持对不可靠输出的可检测性。

教学视频正成为教育的主要媒介,对可扩展的教学质量评估需求日益增长。现有的自动评判器未能完全满足这一场景,因为教学质量依赖于多模态证据,并且应当针对目标学习者而非作为通用属性进行评估。我们提出EduPanel,一种基于评分标准、面向学习者的LLM评判器,它将评估分解到专门的智能体上,从而为教学质量的不同方面生成可解释的评估。通过专家研究、架构消融实验和学习者角色分析,EduPanel达到了与中位数人类专家相当的可靠性。在专家评估中,其反馈提高了评分准确性(MAE从0.87降至0.73),而专家仍然能够检测到不可靠的输出(AUC=0.77),而不是盲目接受。这些结果表明,EduPanel可以作为教育评估的有效助手,而非人类专家的替代品。
查看原文
查看缓存全文

缓存时间: 2026/07/22 06:41

论文页面 - EduPanel:面向教学视频的三智能体LLM评估器——可靠性、互补性与人类信任校准

来源:https://huggingface.co/papers/2607.18529 发布于 7月20日

·

提交自 https://huggingface.co/Snooow1029

董家愷 (https://huggingface.co/Snooow1029) 于7月22日

摘要

教学视频正成为教育的主要媒介,这催生了对其教学质量的规模化评估需求。现有的自动评估器并未完全针对这一场景,因为教学质量依赖于多模态证据,并且应针对目标学习者而非作为通用属性进行评估。我们提出EduPanel——一种基于评分标准、面向学习者条件的LLM评估器,它将评估任务分解到多个专门化智能体,从而为教学质量的不同方面生成可解释的评估结果。通过专家研究、架构消融实验以及学习者角色分析,EduPanel的可靠性达到中等人类专家水平。在专家评估中,其反馈提升了评分准确性(MAE从0.87降至0.73),而专家仍能检测出不可靠输出(AUC=0.77),而非盲目接受。这些结果表明,EduPanel可以作为教育评估的有效辅助工具,而非人类专家的替代品。

查看 arXiv 页面 (https://arxiv.org/abs/2607.18529) 查看 PDF (https://arxiv.org/pdf/2607.18529) GitHub 0 (https://github.com/snooow1029/edupanel) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.18529)

在您的智能体中获取此论文:

hf papers read 2607\.18529

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型与此论文关联

请在模型 README.md 中引用 arxiv.org/abs/2607.18529 以在此页面建立链接。

引用此论文的数据集 0

没有数据集与此论文关联

请在数据集 README.md 中引用 arxiv.org/abs/2607.18529 以在此页面建立链接。

引用此论文的 Spaces 0

没有 Space 与此论文关联

请在 Space README.md 中引用 arxiv.org/abs/2607.18529 以在此页面建立链接。

包含此论文的收藏集 0

没有收藏集包含此论文

请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以在此页面建立链接。

相似文章

TeachObs:一个经过人工验证的多模态教学观察与模型评估基准

arXiv cs.CL

TeachObs引入了一个经过人工验证的多模态教学观察基准,包含30个课堂视频,这些视频标注了片段级别的二元编码和课程级别的专家评分,并评估了五个前沿LLM在三个轨道上的表现,发现没有单一模型能持续优于其他模型,并且模型评估对程序清晰的课程给出了过高评价。

教育中的LLM评判:基于课程大纲的评分流水线

arXiv cs.AI

本文提出了一种基于课程大纲的LLM评判流水线,用于高风险考试备考中的自动化试题评分。该流水线利用教学大纲材料及评分指南,提升一致性与透明度。初步评估显示,其评分结果与人工导师相当。