标签
Ai2推出了TutorMoments,一个基于回放的评估框架和数据集,用于衡量大语言模型在1对1数学辅导中能否平衡何时提供帮助与何时放手。初步结果显示,模型倾向于过度帮助,而提示工程只能部分缩小与人类导师的差距。
本文介绍了教学适宜性指数(PSI),这是一个综合指标,用于评估和改进基于LLM的AI导师如何使回答与学习者的准备程度和课程进度保持一致,并表明PSI引导的反馈能够改善薄弱的教学案例。
美国富裕家庭正转向像Forge Prep和Alpha School这样的AI驱动私立学校,为AI导师和项目制学习支付数万美元,尽管公众普遍对AI不信任且对教育成果感到担忧。
斯坦福法学院的一项研究发现,在对合同法课程简答题辅导的盲评中,法学院教授对大型语言模型生成的答案评分高于同伴答案,LLM在75.33%的比较中胜出,且较少被标记为有害。
Praktika是一款由人工智能驱动的语言学习应用,它采用基于GPT-5.2和GPT-5 Pro的多智能体系统,通过自适应课程交付、进度跟踪和动态学习规划,提供个性化的会话课程,模拟真实人类教师的体验。