Ling Tiny 3.0:未来的瞥见

Reddit r/LocalLLaMA 模型

摘要

作者在一台2017年的无GPU笔记本电脑上运行Ling Tiny 3.0 AI模型,实现了每秒10个令牌的生成速度,并完成了代码生成等任务,展示了现有硬件在边缘智能方面的潜力。

我一直在尝试使用 Ling 3.0 Tiny,这是一个80亿参数的模型(MoE,10亿活跃参数)。为此,我有了很多深刻的思考。纯粹为了好玩,我在一台旧笔记本上用 llama.cpp 运行了它。这是一台2017年的笔记本,配备第七代i5处理器和8GB内存,几乎无法用于现代任务。无显存,无GPU。我让它运行起来,并让它编写一个脚本来扫描本地网络中所有llama.cpp服务器上的可用模型。它开始以大约每秒10个令牌的速度运行。20分钟后,它完成了任务。期间,它经历了多轮编写代码、运行、获取反馈和迭代的过程。这是一个简单的任务,是的。但这在2020年对我来说需要一两个小时才能完成。令人难以置信的是,如此低性能的硬件竟然在合理的时间内完成了有用的工作。10亿活跃参数如此之小,以至于一个旧CPU可以以每秒10个令牌的速度运行,几乎没有进行优化。我就是构建了 llama.cpp 并运行了找到的第一个Q6量化版本。我想我的观点是,你还记得一两年前,当你俯视你昂贵的GPU设备时,心想,哇,计算机现在自己编写代码了?它真的感觉像有某种智能,仿佛它有了智慧。现在,这开始发生在自2015年以来制造的每一个低性能消费级计算设备上。显然,更昂贵的设备始终在能效、成本效益和生成令牌的速度上更优。因此,使用旧硬件可能永远不切实际。但也许会有意义。一台轻度智能的计算机可以在后台做各种事情。所以,这可能是一个边缘智能的新开始。不需要新的计算能力。所有已存在的设备突然都能开始执行智能任务。不确定。我只是说,我惊叹于自己有了那种奇怪的感觉,当我看着我的GPU时,感觉里面不只是比特,但这次是针对一个旧CPU。(不,我不认为它有意识。不是在说那个。)
查看原文

相似文章

Ling 3.0 闪存/微型基础模型

Reddit r/LocalLLaMA

InclusionAI 已开源 Ling-3.0 系列,该系列具有高效的语言模型,采用稀疏 MoE 架构和混合线性注意力,提供不同训练阶段的检查点,以支持研究和创新。