A.L.F.R.E.D.: 带模板的2B模型能以4倍更低速度匹配35B模型
摘要
A.L.F.R.E.D.提出一种系统,将大模型的知识蒸馏到小模型中,并将简单任务路由给小模型,从而用2B模型实现35B模型的性能,同时将推理成本降低4倍。
https://preview.redd.it/qd7drw8mqfdh1.png?width=2223&format=png&auto=webp&s=4df7e6f4002cf6c6508463f40ebdb6a39c6d1805 https://preview.redd.it/86s7i9dpqfdh1.png?width=2411&format=png&auto=webp&s=3f69ccc368fe0212fb4392f14b0d60e38261e186 所以我的想法是:与其把大模型的计算资源花在简单任务上,为什么不将大模型的知识“蒸馏”到小模型中,当再次遇到相同任务时,直接路由到小模型?小模型已经知道如何行动,只需要不同的上下文。例如:"set alarm for 7:00",我们的系统中没有这个模式,所以调用大模型来解析查询,成功后,再让同一个模型从中创建模式。第二次遇到相同请求 "set alarm for 8:30" 时,不再调用大模型、读取技能、逐步操作和验证(简单任务花费约7k token),而是直接将此查询连同模式传递给小模型,它执行操作,只需约1k token,无需技能,无需其他任何东西。就像人类大脑运作一样,通过推理或条件反射进行委托。我知道这或多或少类似于路由,但它增加了额外的步骤,使一切更小、更具确定性,从而带来速度和更好的验证。我称之为 A.L.F.R.E.D. (Adaptive Local-First Routing and Execution Distillation)。以下是所有基准测试、完整论文等:https://github.com/LeonardoDaviti/alfred
相似文章
@jinyuhou0: 在主流基准测试中,我们的30B模型与规模大20-30倍的系统(gpt-5.4-xhigh、DeepSeek-V3.2、Kimi-K2.5)匹敌,而……
一款新的30B模型在主流基准测试中与规模大20-30倍的系统匹敌,同时相比同类30/32B智能体大语言模型,使用的推理令牌减少高达95%。这是通过一个学习型配置器实现的,该配置器决定何时以及如何进行推理。模型和代码已开放。
@sheriyuo: 仅3B活跃参数的35B参数MoE代理模型,声称通过后训练即可匹配或超越100B级模型
一个35B参数的MoE模型,仅3B活跃参数,通过后训练强化学习匹配或超越100B级模型,实现显著效率提升。
@liquidai:推出LFM2.5-230M:这是我们最小的模型,专为快速运行而设计,可在任何地方(CPU、NPU和GPU)上运行,以实现代理型任务…
Liquid AI发布了LFM2.5-230M,这是一个拥有230M参数的小型模型,针对CPU、NPU和GPU上的快速推理进行了优化,适用于手机和机器人等设备上的代理型任务。
一个4b模型现在在网络研究上击败30b模型,原因不在于规模
来自Apodex家族的一个40亿参数开放模型在网页研究基准上优于300亿参数模型,这归因于精心构建的训练数据和自我验证技术,而非原始规模,表明AI能力发展趋向更民主化。
@VukRosic99: 理想汽车的Mach-Mind-4-Flash:一个仅有3B活跃参数的35B MoE模型,仅通过后训练就能匹配100B级别的模型……
理想汽车的Mach-Mind-4-Flash是一个拥有3B活跃参数的35B MoE模型,通过使用统一的强化学习/在线策略蒸馏损失进行后训练优化,在多个基准测试中达到了匹配或超越100B参数模型的性能。