SLM的消亡?

Reddit r/LocalLLaMA 新闻

摘要

作者反思了27B以下的小语言模型是否正被Qwen 3.5和Gemma 4等更大模型所掩盖,并询问社区中有哪些适合智能体编码任务的高性能SLM。

我很高兴看到这些令人印象深刻的模型相继问世,与来自Z.ai、Moonshot、阿里巴巴等公司的巨头一争高下。对于开源/开放权重社区来说,这是一场值得欢迎的胜利。虽然我心怀感激,但也担心我们可能正在见证小于27B的模型的缓慢消亡。这些新发布的模型与Qwen 3.5 4B/9B和Gemma 4 12B相比黯然失色,尤其是在智能体编码和智能体辅助任务方面。这是否意味着我们在3B-12B权重级别上确实已经触及了能力的极限?还是说这类模型不如那些庞然大物般的大模型有利可图,以至于投入改进使其赶上并不划算?我是否因为大模型抢占了头条而错过了这些令人印象深刻的小模型?如果是这样,请告诉我你正在使用哪些SLM权重级别的模型来处理智能体编码、智能体辅助或两者兼有的任务。我还听说在27B以下实现智能体编码并不可行。我并不是要求一个能在一个HTML文件中一次性生成超逼真多人使命召唤克隆版的模型。只是想要一个在上述真实工作流程中稍微有点能力的东西。
查看原文

相似文章

有人在智能体工作流中使用过SLMs吗?

Reddit r/AI_Agents

一位用户向社区询问在智能体工作流中使用小型/本地语言模型执行特定任务(如路由、分类和提取)的情况,并分享了对大型模型是否总是必要的思考。

不再有开源SLM??

Reddit r/LocalLLaMA

该帖子质疑小语言模型(SLMs)是否将不再开源,引发了关于开源AI未来的讨论。

大小真的重要吗?(LLMs vs. SLMs)

Reddit r/artificial

讨论了大语言模型(LLMs)与小语言模型(SLMs)之间的权衡,质疑在生产用例中是否总是需要更大的模型,并探讨了AI部署的未来。

超小型LLM真的有用吗?

Reddit r/singularity

探讨了非常小的语言模型是否能妥善处理日常对话,以及哪些训练因素使它们表现更佳。