通过教学实现可解释的机器学习
摘要
OpenAI 提出了一种机器教学方法,其中教师神经网络学习选择最具代表性的示例来教导学生网络识别概念,通过将示例与人类可理解的特性相关联而不是任意的特征编码,产生可解释的结果。
我们设计了一种方法,鼓励 AI 通过对人类也有意义的示例相互教学。我们的方法自动选择最有信息量的示例来教授一个概念——例如,描述狗这个概念的最佳图像——实验中我们发现我们的方法在教导 AI 方面是有效的
查看缓存全文
缓存时间: 2026/04/20 14:56
# 通过教学实现可解释的机器学习
来源:https://openai.com/index/interpretable-machine-learning-through-teaching/
最具变革性的强大 AI 应用将来自计算机和人类的协作,但让它们使用共同语言很困难。想象一下,当你只看到矩形内部的随机点集合时,要猜测矩形的形状有多难:而当你获得矩形四个角上的点时,要找出正确的矩形尺寸就快得多了。我们的机器教学方法是一个由两个智能体之间进行的合作游戏,其中一个充当学生,另一个充当教师。游戏的目标是学生根据概念的示例(如狗的图像)来猜测特定的概念(如"狗"、"斑马"),而教师的目标是学会为学生选择最具说明力的示例。
我们的两阶段技术的工作方式如下:一个"学生"神经网络被赋予随机选择的概念输入示例,并使用传统监督学习方法从这些示例中进行训练以猜测正确的概念标签。第二步中,我们让"教师"网络(它具有一个打算教授的概念,并可以访问将概念链接到示例的标签)在学生身上测试不同的示例,并观察学生为它们分配的概念标签,最终收敛到让学生猜测预期概念所需的最小示例集。这些示例最终看起来是可解释的,因为它们仍然与概念相关联(通过第一步中训练的学生)。
相比之下,如果我们联合训练学生和教师(正如许多当前通信游戏所做的那样),学生和教师可以勾结通过对人类没有意义的任意示例进行通信。例如,"狗"的概念可能最终通过一些任意向量进行编码,这些向量可能显示羊驼和摩托车的图像,或者矩形可能由两个对人类看起来随机的点组成,但编码特定矩形的尺寸。
为了理解为什么我们的技术有效,请考虑当我们使用我们的方法教学生从基于四个属性变化的示例图像中识别概念时会发生什么:大小(小、中、大)、颜色(红、蓝、绿)、形状(正方形对圆形)和边框(实线对无)。
在这种情况下,概念是定义示例子集属于该概念的一组属性;例如,如果概念是红色圆形,那么任何大小或边框的红色圆形都符合该概念。我们的教师网络最终学会选择其唯一的共同属性是概念所需的属性的示例,这样学生可以排除无关的属性。例如,要传达"红色"的概念,我们的教师选择一个没有边框的大红色正方形,然后选择一个有边框的小红色圆形。这两个形状唯一的共同属性是红色,所以概念只能由红色组成。
相似文章
可解释的教学示例
研究表明,通过迭代训练师生神经网络,教师能学到可解释的教学策略,即选择或生成人类能够理解和有效学习的教学示例。
利用人工智能进行教学
OpenAI分享了教育工作者关于将ChatGPT等人工智能工具融入教学的观点,包括利用AI提供语言支持以及教导学生批判性思考AI生成内容的方法。
让AI更像人类一样观察世界
Google DeepMind在《自然》杂志发表了一篇论文,详细介绍了一种将AI视觉表征与人类认知结构对齐的方法,从而提升模型的鲁鲁棒性和可靠性。
通过无监督学习改进语言理解
OpenAI 提出了一种两阶段方法来改进语言理解:首先在大规模无监督数据集上使用语言建模对 transformer 模型进行预训练,然后在较小的有监督数据集上针对特定任务进行微调。该方法在包括常识推理、语义相似度和阅读理解在内的多种任务上取得了最先进的成果,同时需要的超参数调优工作最少。
在课堂上教授人工智能基础
谷歌 DeepMind 的“课堂人工智能”项目向学生讲解数据需求、偏见和大语言模型等基础人工智能概念,旨在通过互动讨论培养未来的问题解决者。