Edu-Theater: 一种数据高效的智能体框架,通过阶段式点名实现可扩展的学习者行为模拟

arXiv cs.LG 论文

摘要

Edu-Theater是一种数据高效的智能体框架,利用基于LLM的生成式智能体模拟教育场景中的学习者行为。它采用了一种群体感知的点名范式,以更少的数据和计算资源推断学习者状态,实现了更高的模拟精度。

arXiv:2606.15225v1 公告类型:新 摘要:大规模学习者-任务交互数据对于智能教育系统至关重要,但收集成本高昂,且受到隐私和学习者参与度的限制。学习模拟器在模拟可扩展的学习者行为方面发挥着关键作用,无需真实学习者的持续参与。然而,现有方法主要是**以个体为中心**的,为每个学习者配对模拟器,从密集的交互历史中迭代推断潜在知识状态,这既耗费数据和计算资源,在冷启动场景下也很脆弱。我们提出了一种**群体感知的点名模拟范式**,首先构建群体级别的能力先验,然后通过少量有针对性的诊断查询来细化个体学习者状态。基于该范式,我们引入了**Edu-Theater**,这是一个基于LLM的智能体系统,通过教师智能体和回顾性点名探测学习者日志,执行群体感知的学习者模拟。Edu-Theater无需密集的每个学习者的历史记录即可实现可扩展的未来行为模拟。在两个真实世界数据集上的实验表明,Edu-Theater以显著更少的LLM调用实现了更高的模拟精度,产生的合成数据增强了自适应测试等下游应用。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:39

# 1  Edu-Theater示意图:基于LLM生成式智能体的学习者行为模拟框架。该系统模拟了一个课堂环境,中央教师智能体(中心)对具有不同认知特征和学习历史的学习者群体进行诊断性探查(右侧)。Edu-Theater利用群体感知先验高效推断学习者状态,同时可灵活切换至传统的“私教”模式(左侧)进行个性化交互。我们的方法利用基于LLM的智能体模拟复杂学习过程,实现了教育场景中可扩展、高保真的学习者行为模拟。
来源:https://arxiv.org/html/2606.15225
Edu\-Theater

Edu\-Theater:

一种数据高效的可扩展学习者行为模拟智能体框架:通过分阶段点名实现

高伟博¹,², 刘淇¹,², 岳林楠³, 张正¹,², 杜一超⁴, 姚芳舟¹,², 于奥¹,², 黄振亚¹,², 王士进⁵,²

¹中国科学技术大学
²认知智能全国重点实验室
³东南大学
⁴阿里巴巴集团
⁵科大讯飞股份有限公司

###### 摘要

**摘要** 大规模的学习者-任务交互数据对于智能教育系统至关重要,但其收集成本高昂,且受到隐私和学习者参与度的限制。学习者模拟器在无需真实学习者持续参与的情况下,模拟可扩展的学习者行为方面发挥着关键作用。然而,现有方法主要是以个体为中心的,为每个学习者配对一个模拟器,从密集的交互历史中迭代推断潜在知识状态,这既耗费数据和计算资源,在冷启动场景下也很脆弱。我们提出了一种**群体感知的点名模拟范式**,该范式首先构建群体层面的熟练度先验,然后通过少量针对性诊断查询来细化个体学习者状态。基于此范式,我们引入了**Edu-Theater**,一个由LLM驱动的智能体系统,通过教师智能体和基于学习者日志的回顾式点名探查,实现群体感知的学习者模拟。Edu-Theater能够在不依赖每个学习者密集历史的情况下,实现可扩展的未来行为模拟。在两个真实世界数据集上的实验表明,Edu-Theater以显著更少的LLM调用实现了更高的模拟精度,其生成的合成数据能够增强自适应测试等下游应用。

**关键词:** LLM智能体,教育数据挖掘,数据合成,人类模拟

![[未标注图片]](https://arxiv.org/html/2606.15225v1/x1.png)

**图1:** 基于LLM生成式智能体的学习者行为模拟框架Edu-Theater示意图。该系统模拟了一个课堂环境,中央教师智能体(中心)对具有不同认知特征和学习历史的学习者群体进行诊断性探查(右侧)。Edu-Theater利用群体感知先验高效推断学习者状态,同时可灵活切换至传统的“私教”模式(左侧)进行个性化交互。我们的方法利用基于LLM的智能体模拟复杂学习过程,实现了教育场景中可扩展、高保真的学习者行为模拟。

## 1 引言

教育是生成式AI最具交互性的领域之一[7](https://arxiv.org/html/2606.15225#bib.bib84)。每个学习任务(如练习或课程)都会引发学习者的行为,并留下交互痕迹,包括提交的答案和修订轨迹。现代辅导平台利用大规模的学习者-任务交互来建模学习进度并提供个性化支持,例如提示和任务推荐[19](https://arxiv.org/html/2606.15225#bib.bib30)。然而,收集此类记录成本高昂,因为学习需要时间和认知努力,并且数据收集常受隐私政策限制[10](https://arxiv.org/html/2606.15225#bib.bib11)。因此,直接在真实学习者的交互数据上大规模训练和评估个性化支持算法十分困难。生成式学习者模拟器因此成为关键推动力,它能够根据观察到的历史生成可扩展的交互数据,并支持高效的离线训练和评估,而无需持续涉及真实学习者[35](https://arxiv.org/html/2606.15225#bib.bib9)。

我们从简单但根本的角度重新审视学习者模拟:*模拟器如何从观察到的交互数据中推断学习者的潜在状态,并将其作为模拟未来学习行为的证据?* 现有大多数方法[18](https://arxiv.org/html/2606.15225#bib.bib87), 35](https://arxiv.org/html/2606.15225#bib.bib9), [11](https://arxiv.org/html/2606.15225#bib.bib85), [37](https://arxiv.org/html/2606.15225#bib.bib88) 遵循**以个体为中心**的范式。为了理解一个学习者,模拟器与同一个学习者进行**一对一**的长期配对。它观察学习者参与学习任务时的学习轨迹,逐渐形成对该学习者知识掌握状态的个性化估计,从而预测未来行为。从这个意义上说,学习者模拟器类似于一位陪伴式的**私人教师**。其操作可以看作向学习者呈现学习任务,根据返回的学习轨迹总结知识掌握情况,并利用这些信号模拟未来行为,如图1左侧所示。这种私教式范式依赖于足够丰富的交互数据来实现细粒度的个性化和长期状态追踪,但代价不菲。对密集历史数据和重复模型调用的依赖使其在规模上既耗费数据又耗费计算。此外,当观测有限时,个体层面的状态估计可能变得不稳定,使得长周期模拟变得困难。这引出一个关键问题:*我们能否使学习者模拟更加数据高效,在减少成本的同时,在有限观测下仍保持可靠?*

为了应对这一挑战,私教的视角自然引导我们走向一个对比鲜明但熟悉的课堂场景。面对一个新班级时,教师很少从一开始就深入了解每个学生。相反,他们通常依赖**点名式的诊断探查**。通过仅从少数学习任务中观察每个学生的初始行为,并借鉴先前教授过**相似群体**的经验,教师无需逐个详尽询问每个学生,就能快速形成对班级熟练度分布的粗略看法。在教学过程中,几轮点名提问便足以确定每个个体的学习状态并预测后续学习行为,因为大多数学生与群体层面的基线只有细微差别。这一观察表明,学习者模拟可以受益于**群体感知推断**[4](https://arxiv.org/html/2606.15225#bib.bib89)。核心直觉是学习者并非独立存在。具有相似先前经验的学生往往遵循相似的学习轨迹,群体层面的规律可以作为估计个体潜在状态的信息性先验。受此启发,我们形式化了一种**点名模拟范式**。模拟器首先通过将具有相似历史的学习者分组并估计群体层面的熟练度分布,从观察到的群体经验中构建群体级别先验。然后,通过少量有针对性的交互查询来细化每个学习者的状态,从而一次性地生成未来行为,同时保留个体差异。

基于这一见解,我们提出了**Edu-Theater**,一个数据高效、由LLM驱动的智能体系统,它实现了点名式的学习者理解,用于可扩展的学习者行为模拟。顾名思义,每次模拟运行都像一场精心安排的“表演”,结合了群体感知诊断和有针对性的点名探查。所有交互都是回顾性的,不查询真实学习者,如图1右侧的示例所示。Edu-Theater首先根据学习历史将学习者分配到群体(“班级”)中,并指派一个**教师智能体**来编排模拟。与之前的方法将每个学习者建模为一个完整的智能体不同,Edu-Theater将**学习者**表示为轻量级的、带索引的日志**数据库**,当被查询时返回基于真实数据的交互轨迹。这种设计提供了可靠的证据,同时避免了昂贵的、面向学习者的长周期推理。在排练阶段,教师智能体维护一个群体层面的知识熟练度状态,并从回顾式点名轨迹中推导出个体学习者的知识熟练度估计值,同时认知诊断道具提供辅助的掌握度参考。当两种掌握度评估不一致时,使用教师端的检索器提出信息量丰富的探查任务以进一步细化。在此过程中,来自不同群体的教师还可以讨论和分享各自的群体经验,并在适当时将某个学习者调整到更合适的群体。一旦评估一致,就认为该学习者被完全理解。排练后,教师通过重放和重新组织现有证据,执行可扩展的未来行为模拟。总体而言,Edu-Theater将学习者模拟从孤立的一对一辅导重新定义为一种群体感知的点名协议。这使得在显著减少对大量交互历史依赖的情况下实现可靠模拟成为可能。值得注意的是,当每个群体只包含一个学习者时,Edu-Theater能够灵活切换到传统的“私教”模式。

我们的贡献总结如下:

- •**新视角**。我们从教师的角度审视学习者模拟,强调了数据高效学习者模拟的重要性。
- •**新框架**。我们引入了Edu-Theater,一个群体感知、由LLM驱动的模拟框架,它利用群体级别先验和个体化探查,以最少的数据高效预测学习者行为。
- •**实证评估**。我们通过在两个真实世界数据集上进行大量实验来评估Edu-Theater,证明了其与现有模拟器相比的卓越性能和成本效益,特别是在数据稀疏条件下。

## 2 预备知识

### 2.1 Edu-Theater中的角色和道具

Edu-Theater将学习者模拟形式化为一个分阶段进行的课堂点名过程,所有交互都是回顾性的,不查询真实学习者。系统重放历史学习者-任务交互,由教师智能体执行推理和生成。每个群体内的模拟涉及两个角色:一个教师智能体和一组学习者,并由两个道具支持:任务检索和认知诊断估计。

#### 2.1.1 Edu-Theater中的角色

##### 教师(智能体)\(\mathcal{A}^{\mathcal{T}}\)

教师智能体 \(\mathcal{A}^{\mathcal{T}}\) 是Edu-Theater中的核心角色,负责生成模拟的学习者行为。它维护一个内部记忆状态 \(\mathcal{M}\),用于总结检索到的交互证据。给定一个目标任务 \(e^{\star}\) 和学习者-任务交互轨迹 \(\mathcal{Q}_u\),教师生成对学习者 \(u\) 的预测结果如下:

\[
\hat{y}_{u,e^{\star}} = \mathcal{A}^{\mathcal{T}}\!\left(x_{e^{\star}}, \mathcal{M}, \mathcal{Q}_u\right),
\]
(1)

其中 \(\mathcal{Q}_u\) 表示学习者 \(u\) 的一小组历史交互记录,每条记录为任务-响应对 \((x_e, y_{u,e})\),例如 \(x_e\) 是问题陈述或课程提示,\(y_{u,e}\) 是相应的答案或动作。

##### 学习者(日志数据库)\(\mathcal{D}_u\)

每个学习者 \(u\) 被表示为一个静态的、带索引的日志数据库 \(\mathcal{D}_u\),该库存储历史交互,并作为回顾式点名的唯一证据来源。给定一个任务 \(e\),它返回相应的记录交互:

\[
(x_e, y_{u,e}) = \mathcal{D}_u(e).
\]
(2)

#### 2.1.2 Edu-Theater中的道具

##### 认知诊断模型

认知诊断道具是一个监督模型,它拟合收集到的学习者-任务交互,并为每个学习者输出概念层面的掌握度估计值:

\[
\boldsymbol{\mu}_u = \mathrm{CD}_\phi(\mathcal{Q}_u), \quad \mu_u(c) \in [0,1].
\]
(3)

该模型在所有群体之间共享,并通过拟合任务解答的正确性进行训练,最小化监督损失 \(\sum_u \mathcal{L}_{\mathrm{CD}}(\phi; \mathcal{Q}_u)\)。在我们的实现中,我们采用 NeuralCD[29](https://arxiv.org/html/2606.15225#bib.bib10) 作为认知诊断道具,其中 \(\boldsymbol{\mu}_u\) 的每个维度对应于知识概念 \(c\) 的掌握度估计值 \(\mu_u(c)\)。

##### 教师端任务检索器

任务检索器 \(\mathcal{R}\) 根据教师当前的评估和辅助诊断参考,为每个学习者提出一小组信息量丰富的探查任务。具体的检索机制详见第3节。

### 2.2 问题形式化

我们考虑一个学习者群体 \(u \in \mathcal{U}\) 和一组学习任务 \(e \in \mathcal{E}\)。每个学习者与存储在特定学习者数据库 \(\mathcal{D}_u\) 中的一组历史交互日志相关联。鉴于定义的角色和支持道具,Edu-Theater在一个分阶段的课堂环境中运行,其中所有交互都是回顾性的,不查询真实学习者。给定一个未来的未见任务 \(e^{\star}\),学习者模拟的目标是预测学习者的响应 \(\hat{y}_{u,e^{\star}}\)(公式(1)),同时仅依赖于有限的回顾性交互记录和高效的教师端模型调用。

Edu-Theater是一个基于LLM的智能体框架,用于**点名式**学习者模拟,并采用**群体感知推断**。该框架采用戏剧化的抽象:教师智能体进行一场分阶段的课堂表演,而学习者是被动的日志实体,其过去的行为按需重放。所有探查操作严格是回顾性的,不涉及与真实学习者的在线交互。系统仅重新组织和总结现有的历史日志,而教师则像进行课堂点名一样执行推理和生成。遵循这一比喻,每次模拟运行包括三个阶段,如图2所示:**分派**(群体构建)、**排练**(回顾式点名诊断与学习者状态估计)和**最终表演**(以教师为中心的可扩展模拟)。每个学习者 \(u\) 被表示为一个静态的日志数据库 \(\mathcal{D}_u\),而单个教师智能体 \(\mathcal{A}^{\mathcal{T}}\) 则协调所有群体的证据检索、学习者状态估计和行为生成。**本节中的所有提示词详见附录。**

### 3.1 第一阶段:分派(群体构建)

分派阶段通过将具有相似观察历史的学习者分组,构建**群体层面的先验**。每个群体作为一个最小的**课堂单元**,至少包含一个学习者,并与一个专门的教师智能体配对。这一设计允许

相似文章

EASy:迈向基于LLM的高效智能体系统

arXiv cs.CL

本文提出了EASy,一个可训练的智能体框架,利用强化学习联合优化任务性能与计算效率,并引入了里程碑-规划-执行工作流、依赖感知执行图和用于训练的树形展开。

LectūraAgents: 自适应个性化AI辅助学习与具身教学的多智能体框架

Hugging Face Daily Papers

LectūraAgents是一个用于自适应个性化学习的多智能体框架,它模拟教授与学生的互动,并生成与学习者画像对齐的具身教学动作。它引入了层级架构、自适应具身教学机制以及教学动作-语音对齐算法,在现有方法上表现出一致的改进。

有没有其他人尝试过不进行微调来训练智能体网络?

Reddit r/AI_Agents

作者分享了一个确定性学习框架,它通过将成功的策略提升为持久化的剧本,让多智能体系统在不进行微调或提示词编辑的情况下跨回合改进。在 Mini Amusement Park 基准测试上,奖励从 12,121 提升到 483,019,达到了排行榜第一名。