A.L.F.R.E.D.: 带模板的2B模型能以4倍更低速度匹配35B模型

Reddit r/LocalLLaMA 论文

摘要

A.L.F.R.E.D.提出一种系统,将大模型的知识蒸馏到小模型中,并将简单任务路由给小模型,从而用2B模型实现35B模型的性能,同时将推理成本降低4倍。

https://preview.redd.it/qd7drw8mqfdh1.png?width=2223&format=png&auto=webp&s=4df7e6f4002cf6c6508463f40ebdb6a39c6d1805 https://preview.redd.it/86s7i9dpqfdh1.png?width=2411&format=png&auto=webp&s=3f69ccc368fe0212fb4392f14b0d60e38261e186 所以我的想法是:与其把大模型的计算资源花在简单任务上,为什么不将大模型的知识“蒸馏”到小模型中,当再次遇到相同任务时,直接路由到小模型?小模型已经知道如何行动,只需要不同的上下文。例如:"set alarm for 7:00",我们的系统中没有这个模式,所以调用大模型来解析查询,成功后,再让同一个模型从中创建模式。第二次遇到相同请求 "set alarm for 8:30" 时,不再调用大模型、读取技能、逐步操作和验证(简单任务花费约7k token),而是直接将此查询连同模式传递给小模型,它执行操作,只需约1k token,无需技能,无需其他任何东西。就像人类大脑运作一样,通过推理或条件反射进行委托。我知道这或多或少类似于路由,但它增加了额外的步骤,使一切更小、更具确定性,从而带来速度和更好的验证。我称之为 A.L.F.R.E.D. (Adaptive Local-First Routing and Execution Distillation)。以下是所有基准测试、完整论文等:https://github.com/LeonardoDaviti/alfred
查看原文

相似文章