Ling Tiny:速度之王

Reddit r/LocalLLaMA 模型

摘要

Ling Tiny 已替代 Gemma4-12B 作为辅助模型在 4060Ti GPU 上,提供了惊人的速度;用户应避免使用 MTP,并使用 vLLM fork 来支持 BailingMoE3。

Ling Tiny 现已在我的设备中替代了 Gemma4-12B 作为辅助模型,用于执行 hindsight 操作。这是在 4060Ti 上进行的,这是一款市面上较为合理的 GPU,速度惊人。不要启用 MTP,设置 vLLM fork 来支持 BailingMoE3。希望这能对其他人有帮助。
查看原文

相似文章

Ling 3.0 Tiny 对比 Gemma 26B-A4B MoE

Reddit r/LocalLLaMA

比较 Ling 3.0 Tiny 和 Gemma 26B-A4B MoE 模型在音频书流程中的字符归属,显示 Gemma 达到更高精度,但 Ling 提供更快的推理速度。

Ling Tiny 3.0:未来的瞥见

Reddit r/LocalLLaMA

作者在一台2017年的无GPU笔记本电脑上运行Ling Tiny 3.0 AI模型,实现了每秒10个令牌的生成速度,并完成了代码生成等任务,展示了现有硬件在边缘智能方面的潜力。