StudentSim:训练基于LLM的学生模拟器
摘要
StudentSim从稀疏数据中训练个性化的基于LLM的学生模拟器,以镜像学习者响应并适应导师指导,在国际象棋、写作和数学领域超越GPT-5.4。
查看缓存全文
缓存时间: 2026/09/02 03:45
论文页面 - StudentSim:基于大语言模型的学生模拟器训练
来源:https://huggingface.co/papers/2609.01591
摘要
StudentSim从稀疏数据中训练个性化学生模拟器,以镜像学习者反应并适应导师指导,在国际象棋、写作和数学领域超越现有模型。
人工智能导师在适应每个学生的优势、劣势和偏好指导方式时最为有效,但关于哪种指导对哪种学生有效的证据稀疏、收集缓慢且成本高昂。学生模拟器(https://huggingface.co/papers?q=Student%20simulators)可以作为代理提供这种信号,然而现有方法存在局限:状态追踪模型能拟合学生行为,但难以处理解释或纠正;而大语言模型角色扮演能流畅遵循指导,却无法可靠匹配被模仿学生的能力水平。我们提出StudentSim训练框架,通过池化训练(https://huggingface.co/papers?q=pooled%20training)与针对单个学生的专门化处理(https://huggingface.co/papers?q=per-student%20specialization),将稀疏的个体学生数据转化为个性化模拟器。生成的模拟器既能镜像学生自身的反应,也能在导师指导下更新反应。我们还引入了StudentSimEval标准化评估方案,涵盖国际象棋、二语英语写作和数学领域的60名学生,使用公开的学习者数据集及已去标识化的研究共享记录。StudentSimEval通过行为保真度(https://huggingface.co/papers?q=behavioral%20fidelity)(F,即模拟器匹配学生反应的程度)和指导响应性(https://huggingface.co/papers?q=guidance%20responsiveness)(R,即在导师指导下更新反应的意愿程度)进行评估,所有方法均在相同记录上进行拟合与评估。在所有三个领域,StudentSim在两项指标上均优于GPT-5.4。在国际象棋中,StudentSim达到F=0.51和R=0.91,而GPT-5.4为0.23和0.72,Maia2为0.45和0.27。作为概念验证,将StudentSim用作导师强化学习(https://huggingface.co/papers?q=reinforcement%20learning)的奖励模型(https://huggingface.co/papers?q=reward%20model),构建的国际象棋导师经专家人类评估,比无强化学习基线及针对GPT-5.4模拟器奖励训练的导师更准确、指导更优、个性化更强。代码已发布于 https://github.com/microsoft/StudentSim。
查看arXiv页面 (https://arxiv.org/abs/2609.01591)查看PDF (https://arxiv.org/pdf/2609.01591)项目主页 (https://microsoft.github.io/StudentSim/)GitHub10 (https://github.com/microsoft/StudentSim)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.01591)
在您的代理中获取此论文:
hf papers read 2609\.01591
尚未安装最新CLI?请执行curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型0
暂无模型链接本文
在模型README.md中引用 arxiv.org/abs/2609.01591 以将其链接到本页面。
引用本文的数据集0
暂无数据集链接本文
在数据集README.md中引用 arxiv.org/abs/2609.01591 以将其链接到本页面。
引用本文的空间0
暂无空间链接本文
在空间README.md中引用 arxiv.org/abs/2609.01591 以将其链接到本页面。
包含本文的合集0
暂无合集包含本文
将此论文添加到合集 (https://huggingface.co/new-collection)以将其链接到本页面。
相似文章
从掌握程度档案到模拟响应:随机学生知识图谱(SSKG)用于忠实的LLM学生模拟
本文提出了随机学生知识图谱(SSKG),以实现LLM对学生知识的忠实模拟,克服了LLM倾向于按自身能力水平表现而非模拟不同掌握程度档案的限制。
INSIDE the Student's Mind: Jointly Modeling Latent Reasoning and Action in LLM Student Simulators
This paper presents INSIDE, a framework that fine-tunes LLMs to generate internal dialogue grounded in Bloom's Taxonomy, enabling student simulators to model both latent reasoning and observable actions. Evaluations show improved action fidelity and reasoning alignment compared to prompting baselines.
KnowSim:使用学习型用户模拟器评估LLM助手的信息校准
本文介绍了KnowSim,一个通过建模用户知识状态来评估LLM助手信息校准的评估框架,经人类判断验证并优于基线模拟器。
LLM-as-a-Tutor:面向不可验证强化学习的策略感知提示自适应
LLM-as-a-Tutor提出了一种框架,通过成对比较和添加约束动态调整提示难度,将LLM的角色从评判者扩展为导师,从而提升强化学习中的指令跟随性能。
SimSkill:一个用于自主掌握交通仿真的终身学习AI代理
SimSkill是一个终身学习AI代理,通过识别能力差距、生成任务并使用记忆系统来提高性能,自主掌握交通仿真,在基准测试中任务完成率提升高达25%。