Ling Tiny 3.0:未来的瞥见
摘要
作者在一台2017年的无GPU笔记本电脑上运行Ling Tiny 3.0 AI模型,实现了每秒10个令牌的生成速度,并完成了代码生成等任务,展示了现有硬件在边缘智能方面的潜力。
我一直在尝试使用 Ling 3.0 Tiny,这是一个80亿参数的模型(MoE,10亿活跃参数)。为此,我有了很多深刻的思考。纯粹为了好玩,我在一台旧笔记本上用 llama.cpp 运行了它。这是一台2017年的笔记本,配备第七代i5处理器和8GB内存,几乎无法用于现代任务。无显存,无GPU。我让它运行起来,并让它编写一个脚本来扫描本地网络中所有llama.cpp服务器上的可用模型。它开始以大约每秒10个令牌的速度运行。20分钟后,它完成了任务。期间,它经历了多轮编写代码、运行、获取反馈和迭代的过程。这是一个简单的任务,是的。但这在2020年对我来说需要一两个小时才能完成。令人难以置信的是,如此低性能的硬件竟然在合理的时间内完成了有用的工作。10亿活跃参数如此之小,以至于一个旧CPU可以以每秒10个令牌的速度运行,几乎没有进行优化。我就是构建了 llama.cpp 并运行了找到的第一个Q6量化版本。我想我的观点是,你还记得一两年前,当你俯视你昂贵的GPU设备时,心想,哇,计算机现在自己编写代码了?它真的感觉像有某种智能,仿佛它有了智慧。现在,这开始发生在自2015年以来制造的每一个低性能消费级计算设备上。显然,更昂贵的设备始终在能效、成本效益和生成令牌的速度上更优。因此,使用旧硬件可能永远不切实际。但也许会有意义。一台轻度智能的计算机可以在后台做各种事情。所以,这可能是一个边缘智能的新开始。不需要新的计算能力。所有已存在的设备突然都能开始执行智能任务。不确定。我只是说,我惊叹于自己有了那种奇怪的感觉,当我看着我的GPU时,感觉里面不只是比特,但这次是针对一个旧CPU。(不,我不认为它有意识。不是在说那个。)
相似文章
Ling 3.0 Tiny 是我低端 PC 上最强大、最快速、最出色的模型!
用户赞扬 Ling 3.0 Tiny AI 模型在低端 PC 上快速高效,并将其与 Qwen 3.5 9b 和 Gemma 12 等模型进行了有利的比较。
Ling-3.0-tiny 是个非常有趣的模型。它可以在 NVIDIA Orin Nano Super 8GB 上运行,支持 128K 上下文并采用 IQ4_NL 量化技术。
本文展示了在NVIDIA Orin Nano Super 8GB设备上运行Ling-3.0-tiny AI模型的实例,采用IQ4_NL量化方案,实现33 tok/s解码速度与完整128K上下文长度,体现了边缘AI的实际部署能力。
Ling 3.0 闪存/微型基础模型
InclusionAI 已开源 Ling-3.0 系列,该系列具有高效的语言模型,采用稀疏 MoE 架构和混合线性注意力,提供不同训练阶段的检查点,以支持研究和创新。
@AdinaYakup: Ling 3.0 tiny a 7.9B/1.3B hybrid reasoning MoE https://huggingface.co/inclusionAI/Ling-3.0-tiny…
InclusionAI introduces Ling-3.0-tiny, a 7.9B-parameter hybrid reasoning MoE model with only 1.3B active parameters per token, optimized for efficient local and edge deployment.
Ling 3 tiny 是否因体积小巧而被低估?
一位用户讨论了 Ling 3 tiny 模型的基准测试,将其与 Qwen3.5 9b 进行比较,并质疑是否其他开源模型被忽视了。