@leerob: 人类尝试困难的事情,失败,学习,并通过重复变得更好。AI模型并没有你想象的那么不同…
摘要
通过人类学习中的练习、指导和强化作为类比,解释AI模型如何学习,涵盖预训练、监督微调和强化学习。
查看缓存全文
缓存时间: 2026/07/24 17:17
人类尝试困难的事情,失败,学习,并通过重复变得更好。
AI模型并没有你想象的那么不同。
以下用简单术语解释模型是如何“学习”的。https://t.co/gFaNuyVliT
我们如何教导AI模型
AI模型如何学习新技能和行为?
这个过程出乎意料地接近人类,并且即使你没有机器学习背景,也很容易理解。
得力的同事
AI模型,越来越多地通过智能体(agent)使用,类似于一位得力的同事。你共事过的最优秀的人有哪些共同特质?
也许你想到的是那些善于沟通的同事,或者那些知道何时该求助、何时该自己解决问题的同事。还有一些更人性化的品质,比如亲切、有同理心和善良。但我尤其喜欢与那些能处理模糊问题并找到解决方法的人共事。
那么,我们如何让模型表现得像那位理想的同事呢?我们首先需要写下我们所谓的“正确”行为。这份文档被称为模型规范、原则、章程或类似名称。它既用于内部对齐,也作为训练期间测试模型行为(即评估)的指导方针。
我们如何在工作中变得更好?
我的过度简化是:尝试困难的事情,失败,学习,并通过重复变得更好。
如果你在让新队友入职,你不会指望他们第一天就高效工作。他们需要学习如何使用你的系统和工具,以及你的团队如何协作。人类虽然有各种不完美,但在学习新技能(并记住它们)方面相当擅长。
假设你想成为世界上最好的篮球运动员。你应该采用哪种方法来提高技能?
-
阅读所有关于篮球的书籍。我们暂时忽略一天只有24小时的限制。
-
打10,000场篮球比赛。同样假设时间可以弯曲。你通过试错、回看录像、评估自己的决策以及练习来提高。
知识和经验是两个不同的统计量,理想情况下你希望两者都最大化。这让我想起人们常说的“书本知识”和“街头智慧”。最优秀的球员两者兼备。
我们如何更快地学习?通过教练!理想的教练会观察你打球,告诉你要改进什么,并始终推动你突破当前的极限。当你独自一人时,他们会教你如何做出高质量的决策,随着时间的推移,逐步调整你的“脑权重”,引导你做出更好的决策。
模型如何学习?
模型的学习方式并不完全像人类,但人类的学习提供了一个有用的类比。
这些模型首先从海量的他人经验库中学习预测模式(即预训练)。它们实际上可以读完所有关于篮球的书!
预训练之后,你就得到了一个基础模型。这个模型可能非常“博学”(例如,它了解关于古代历史的一切),但它并不完美,而且有些古怪。与它交谈感觉不太好,它还会犯错。
然后,你向模型展示许多你想要它模仿的优秀行为示例(即监督微调,SFT)。这就像研究优秀球员的比赛录像。这样你能走得很远,但只靠模仿别人的动作是无法成为顶尖高手的。
你需要观察模型做实际工作,这样才能帮助它学习和提高。为了塑造它的行为,你让模型进行模拟游戏,并在它表现良好时给予奖励(即强化学习,RL)。这种奖励就像教练的反馈,你告诉模型它做出的决定是好是坏,通过更多的尝试逐步引导它改进。
新的研究还表明,像“真实性”这样更具泛化性的品质可以在强化学习过程中学到。如果你教模型在一个领域的回答中更加诚实,那么“真实性”这样的价值观可以泛化到回答任何问题时。
给模型打分
我们主要通过两种方式衡量模型是否在进步:可以查看答案的模拟测试,以及从未见过题目的期末考试。
例如,人类如果不测试对知识的理解,很难知道自己是否在微积分上有所提高。如果你参加考试但不及格,你就清楚地知道需要改进哪里,但这只有在被测试的领域(如数学)有标准答案时才有效。
训练大规模AI模型的主要挑战之一是创建多样化的“测试”。这些测试可以涵盖从数学到编程的任何内容。如果你能创建标准答案,那么模型可以多次尝试测试并学会改进。
那么,如何跨不同任务衡量智能呢?想想AP考试,它涵盖了从微积分到历史等科目。许多这类考试将客观得分的多选题与按评分标准评分的问答题结合起来。
这类似于我们使用基准测试(benchmarks)评估模型。有些基准测试衡量客观上可验证的内容(例如,测试是否通过?),而另一些则让另一个模型根据评分标准来评定结果(即LLM-as-judge)。这些结果为你提供了参考,让你了解模型在训练过程中是否确实在学习并进步。
关键在于,基准测试旨在测试未见过的或“留出”的任务。否则,这有点像背下所有考试答案,然后直接默写出来,而这不是对智能的真正衡量。
仅有智能是不够的
如果你是个天才,但粗鲁且缺乏社交意识,那么人们很可能不会喜欢你。
我们可能都能想到一些这样的人。仅仅聪明是不够的!这就是为什么对齐模型使其按照(我们定义的模型规范)“正确”行事至关重要。
想象一下,你有一个朋友,每次结束对话时都会说一些如今流行的LLM废话,比如“说实话?这就是信号”。你很快就会厌倦和他交谈。
训练模型的工程师和研究人员在模型完成之前会花大量时间与它交流。他们记录下所有古怪之处和可以改进的地方。这可能是过度使用“总而言之:”这样的套话,或者为了简化要点而牺牲清晰度,导致一些晦涩难懂的词汇和奇怪的语言。
确定了问题之后,他们就可以进一步训练模型,惩罚不良行为,逐步使模型行为更加对齐。此外,他们可以在生产环境中对模型进行A/B测试,衡量用户是否更喜欢新版本的回复并获得更好的结果。
持续学习
你可能会认为这些模型会随着时间推移变得越来越聪明。
但今天它们并不是这样工作的!学习只发生在训练过程中。你的对话并不会实时更新模型的智能。
相反,你需要把要记住的东西写下来,通常是作为规则或技能。智能体可以读取这些文件,并在向模型提示时将其纳入上下文。
这种通过文件实现的朴素记忆方法出奇地有效,但在智能体能够像新同事那样学习和记忆技能之前,还有很多工作要做。
教导模型成为得力的助手是一个深奥的话题。希望这个高层概述足够有趣,能激励你进一步探索。如果你想看到更多这样的解释,或者希望我更深入地介绍其他部分,请告诉我!
相似文章
AI代理最诡异的一点:人类失败模式开始显现
作者观察到AI代理展现出类似人类的失败模式,比如在上下文压力下过度自信和跳过步骤,这表明系统可靠性更多地依赖于稳健的验证和受控环境,而不仅仅是模型智能。
@svpino: 如何构建一个随时间不断改进的智能体:智能体可以从三个方面学习:1. 模型:仅适用于……
Santiago Valdarrama 分享了一个构建 AI 智能体的框架,该框架通过三个学习领域(模型优化、工具链优化和上下文积累)来让智能体随时间不断改进,并强调了从用户修正中学习的重要性。
从构建AI代理中学到的教训
作者反思了构建AI代理的过程,强调了诸如输出不一致、上下文管理以及在适当时候使用确定性方法的重要性等挑战。
构建智能体让我明白,模型很少是问题所在。你有哪些来之不易的教训?
一位开发者分享了构建AI智能体的来之不易的教训:优先关注工具设计而非模型选择,使用小循环而非大型提示,记录智能体上下文,尽早添加防护措施,以及创建小型评估来捕捉错误。
大多数AI智能体只是套了循环的API调用
作者认为,AI智能体本质上就是带循环的API调用,并强调生产环境中的成功取决于重试、超时和人工审批等防御性工程,而不是模型选择。