为5岁儿童打造实时AI辅导老师
摘要
Ello分享了其为4-9岁儿童构建实时AI辅导老师的工程方法,重点在于毫秒级延迟和教学法,以避免分散孩子的注意力。
大家好!过去一年的大部分时间里,我们都在构建一个AI辅导老师,为4-9岁儿童教授阅读、数学、ESL等课程。要让AI辅导老师有效教育孩子,实际上是个非常艰巨的技术挑战,这需要正确的底层架构。<p>我们的辅导老师实时引导用户体验,并即时做出复杂决策。要在对话速度下同时做到这两点,需要替换标准的工具调用循环。我们构建了自己的辅导框架,利用流式解释器执行动作,同时异步规划模型在对话前进行推理,并调用函数来推动孩子的学习。最重要的是,我们开发了一个安全系统,在每轮交互中进行检查,而不会中断活动和对话流程。<p>有效的教学不仅仅是快速回答孩子的问题,而是在正确的时间采取正确的行动。AI也将成为塑造这一代孩子阅读和思考方式的重要组成部分,负责任地应对这一问题意味着要设计得当。<p>很高兴回答大家的问题,也好奇各位的看法,欢迎批评反馈。我们已经在这个问题上研究了很长时间,期待听到HN社区的声音。
查看缓存全文
缓存时间: 2026/07/10 06:21
# 在不到1000毫秒内教会一个孩子:实时导师背后的架构
来源:https://www.ello.com/blog/teaching-a-child-in-1000-ms
工程 2026年7月7日 儿童平板上的Ello应用
*我们致力于构建第一个能够教授4-9岁儿童数学和阅读的AI导师。要让AI真正教好一个五岁的孩子,教学法必须融入工程设计中。*
*孩子不能等待缓慢的回应,看不懂聊天界面,也无法忘记模型给出的任何错误信息。我们想分享一些在构建实时AI导师过程中塑造我们架构决策的经验。*
对话中两秒的停顿,对孩子和开发者(甚至是一个与自动语音代理通话的成人)的感受是完全不同的。几秒钟就足以分散孩子的注意力,让学习中断。
优秀的老师能无需思考地处理好这种情况。他们会立即回应孩子,即使他们暂不给出答案,让孩子自己思考。教学就是在当下时刻匹配正确的方法,而大多数方法都不是直接给出答案。
当我们着手为4-9岁儿童构建AI导师时,我们想构建的是真正能教学的导师,而不仅仅是响应快的聊天机器人。我们知道底层的约束会很严格,而且没有讨价还价的余地:每一轮交互的响应时间都必须小于一秒。大多数代理通过推理预算在速度和质量间取舍。而我们的架构必须将导师扎根于教学法,并能实时回应孩子。
## 我们抛弃了标准的代理循环。
老师要不断决定如何引导学生:是说些什么,在白板上画图,玩游戏,还是完全转换话题。当今代理的标准模式是工具循环。LLM输出一个或多个工具调用,等待它们执行,观察结果,然后决定下一步做什么。因此,构建教学代理最直接的方式就是为老师可能采取的每个动作创建一个工具。
但工具循环存在延迟问题。前沿模型生成第一个token需要2-3秒,之后以大约每秒30个token的速度解码。我们的动作平均包含几十个token。加上往返延迟和音频播放,标准循环意味着每句话或屏幕每次变化之间会有3-4秒的空闲时间。
儿童用Ello进行游戏测试的照片
在我们早期的一次游戏测试中,我们亲眼目睹了这种情况。一个六岁男孩等待着代理思考,然后问道:
> 为什么他不做点什么?什么时候开始?好无聊。
——6岁儿童
同一轮测试中的另一个孩子发现她只需要部分时间集中注意力也能跟上。延迟教会了她对导师自动忽略。同时,这也是她停止学习的时刻。
一个简单的修复方法是使用更小、更快的模型。但这暴露出一个范围问题。教学是一项广泛的任务。导师在单节课中可能需要从几十个动作中做出选择,而最难的决定往往是保留答案,给出提示,提出一个更小的问题,或者让孩子在适度的挣扎中自己领悟。
较小的模型难以在如此宽泛的范围内遵循指令。我们早期使用小模型的代理版本虽然响应快,但总是过早给出答案。每一次这样做,都夺走了学习发生的时刻。
因此,我们构建了一个自定义框架来平衡指令遵循、延迟和灵活的动作空间。模型在单个响应中流式输出多个动作。一个解释器解析并执行每个动作,同时模型仍在生成后续动作。孩子只需等待第一个动作——大约30个token之后——而不必等待整个响应完成。
标准代理循环顺序调用动作 vs. 流式导师框架流式动作的时间图。
将生成与执行分离还带来另外两个好处。我们可以根据情况更改可用的动作。例如,当屏幕上显示一个问题时,代理会获得关于搭建脚手架的指令和选项,而不是直接给出答案。我们还可以在不影响正常路径延迟的情况下验证每个动作。只有当流产生无效动作时,我们才中断并重新生成,否则执行从不暂停。
这些都不是没有代价的。掌控循环意味着我们必须构建自己的可观测性和追踪,而不是依赖框架。而且我们逆流而上:前沿模型经过大量后训练,专门针对工具使用模式。如果未来模型足够快,我们的框架将被设计成可以被更简单的循环替换。
**经验教训:**代理框架正朝着后台工作发展,速度和思考之间的权衡变得容易。实时学习位于另一个极端。以对话速度教学意味着我们必须自己掌控整个循环。
## 优秀的导师能预测孩子下一步会做什么。
一位真正的老师既要反思学生刚刚做了什么,也要预测他们下一步会做什么。同一节课教一百遍,你就会看到模式。但你也了解*这个*孩子,知道他们在哪里停滞不前,什么能激发他们,今天什么可能会绊倒他们。你带着计划开始一节课,并随时调整。
我们将与孩子互动的代理称为**对话器**。我们早期的实验表明,较小的动作空间能带来更好的指令遵循,因此我们构建了第二个代理——**规划器**——来根据课程目标审查对话,并管理对话器的上下文。
导师框架在学习者和规划器-对话器模型之间进行编排的框图。
第一个版本是同步运行的,这当然太慢了。在固定轮数后过期的计划并不可靠。让对话器请求新计划也不可靠。有效的方法是使用异步规划器,在孩子思考或讲话的同时运行它——就像老师在对话间隙中反思和预测一样。这些间隙正是做出判断的地方:挑战孩子还是让他们成功,继续当前概念还是进入下一个。老师凭直觉做出这些判断;而模型需要推理才能达到,异步运行正是为它赢得了时间。
异步也意味着两个代理同时运行,都读取和写入共享状态而不进行协调。因此,我们将每一轮对话、每一次点击、每一次UI更新都作为不可变事件存储在仅追加日志中。任何一个代理都可以读取和追加,无需等待另一个。
儿童与导师交互的会话日志
这种轨迹格式实现了另一种预测。每当对话器提出一个封闭式问题(即设计填空题、玩"我看见了"游戏、完成等式等),框架会假设孩子可能的答案,并在其各自分支(从轨迹分叉)上预生成对每个答案的响应。当孩子回答时,我们将其匹配到某个分支并播放响应,无需等待新的模型调用。
代价是成本,以及偶尔的错误预测。规划器运行在更强大、更昂贵的模型上,并且每轮都运行。预测始终只是预测。有时候一个已经准备好接受挑战的孩子却被轻易放过了。要判断对话器的错误是失误,还是源于有缺陷的计划,难度更大。我们目前还没有一个清晰的信号来确定何时应该相信计划,而不是相信当下的实时情况。
**经验教训:**孩子实时与应用程序交互,而代理则以离散生成的模式运行。因此,要利用孩子思考或说话的时间。让规划器反思过去并预测未来,同时对话器处理当下,缓慢的教学推理与实时交流并发进行。当下一步可预测时,在孩子回答之前就生成好。
## 没人察觉的安全检查。
大多数AI产品将护栏以串行方式置于模型调用或代理轮次之前或之后。用户不会注意到token流经过内容过滤器,而开发者愿意等待CLI工具调用被自动审查。
但在与五岁孩子实时对话中没有隐藏之处。也没有撤销:孩子无法忘记导师说过的话。安全系统必须在每一轮中审查任何动作。
我们的安全分类器是一个LLM,运行大约需要500-1000毫秒。等待该检查完成再运行对话器,会给每一轮增加我们承受不起的一秒延迟。这里又体现了我们框架中解耦生成与执行的另一个优势。
安全分类器阻止执行但不阻止生成。一旦孩子说完话,我们并行调度分类器和一个小模型来生成对话器的第一个动作。该模型快速反应,生成一个**急切响应**,反映或承认孩子所说的内容("你喜欢恐龙!我也是")。
虽然基于规则的检查会更快、更便宜,但它无法应对五岁孩子实际说话方式的各种变化。我们添加到安全策略中的每个类别都会增加token数量,并需要重新调整非确定性分类器。有时转录错误会惊动分类器,触发误报。我们审查这些情况,并用它们来改进代理对孩子的理解。
等到那个**急切动作**生成完毕时,分类器通常已经返回安全结果。这解除了对对话器的阻塞,使其在急切动作执行的同时生成内容。尽管有多次模型调用,孩子听到的是连续的一轮交互。
安全分类器流程图
但比延迟更难解决的问题是,当这个反射性动作是错误选择时该怎么办。对于与孩子的日常对话,镜像回应很好。但其他时候,它与教学法建议的恰恰相反。
比如,一个孩子在课程中提到,同学用坏话骂了他。那个将"我喜欢恐龙"转化为"你喜欢恐龙!我也是"的相同反射,会把那个坏话原封不动地回响给孩子。
因此,每当安全分类器标记了孩子的这一轮对话,我们就丢弃急切动作。对话器会收到针对这一轮的特定指导:不要重复那个名字,承认这一定让人感觉不好,并建议告诉大人。
*注:我们的安全系统由儿童发展专家制定的政策管理。关于安全系统如何工作的细节将单独成文。*
**经验教训:**将执行门控于安全检查之上,而不是门控于生成之上,以避免延迟影响。当检查失败时,用针对孩子情况量身定制的指导替换反射性响应。
## 三个问题领域,仅是冰山一角。构建AI导师需要解决的远不止这些。
你无法通过选择正确的模型、编写提示词然后收工来为儿童构建AI导师。构建儿童AI导师需要更多。它关乎设计一个实时系统,为在事实上和教学法上都正确提供足够时间——有时间在答案会削弱学习效果时保留答案,有时间在孩子完成思考前选择下一个动作,有时间在孩子听到之前重新审视一个草率的反射。
这些单独看来都微不足道,但只有当所有这些部分协同工作时,才能产生魔力——一个能提前思考、优雅恢复、感觉像是*陪着*孩子而非追赶孩子的导师。
如果这些问题让你感兴趣,或者你想了解更多关于为儿童构建实时AI导师到底需要什么,我们很乐意聊聊。我们正在招聘。
相似文章
构建了一个大规模生成个性化K-5练习题的AI系统——从为幼儿正确实施中汲取的经验
作者分享了构建AI系统为K-5学生生成个性化练习题的经验,重点介绍了年龄适宜的难度校准和幼儿学习者的内容准确性等挑战。
一种基于提示工程的方法:在通用AI教学助手中实现可扩展、灵活且实时的混合微层级个性化
本文介绍了一种用于个性化AI教学助手(如Jill Watson)的提示工程框架,该框架利用学习者特定维度实时调整响应,无需进行模型重新训练。
@rohanpaul_ai: 黄仁勋谈到实时AI导师如何让个性化一对一指导变得广泛可及。在…
黄仁勋讨论了像Koji这样的实时AI导师如何让个性化教学变得广泛可及。Sue介绍了Koji,这是一位鼓励思考而非直接给出答案的AI导师。
@mattshumer_: Opus 5 实现了我正在为@AlphaSchool原型设计的这个疯狂的新实时AI导师概念。它驱动底层的聊天+方向,……
Opus 5 为AlphaSchool的实时AI导师原型提供动力,结合了聊天、方向以及一个自定义小型世界模型(类似),用于实时渲染和交互性。
利用人工智能进行教学
OpenAI分享了教育工作者关于将ChatGPT等人工智能工具融入教学的观点,包括利用AI提供语言支持以及教导学生批判性思考AI生成内容的方法。