SLM的消亡?
摘要
作者反思了27B以下的小语言模型是否正被Qwen 3.5和Gemma 4等更大模型所掩盖,并询问社区中有哪些适合智能体编码任务的高性能SLM。
我很高兴看到这些令人印象深刻的模型相继问世,与来自Z.ai、Moonshot、阿里巴巴等公司的巨头一争高下。对于开源/开放权重社区来说,这是一场值得欢迎的胜利。虽然我心怀感激,但也担心我们可能正在见证小于27B的模型的缓慢消亡。这些新发布的模型与Qwen 3.5 4B/9B和Gemma 4 12B相比黯然失色,尤其是在智能体编码和智能体辅助任务方面。这是否意味着我们在3B-12B权重级别上确实已经触及了能力的极限?还是说这类模型不如那些庞然大物般的大模型有利可图,以至于投入改进使其赶上并不划算?我是否因为大模型抢占了头条而错过了这些令人印象深刻的小模型?如果是这样,请告诉我你正在使用哪些SLM权重级别的模型来处理智能体编码、智能体辅助或两者兼有的任务。我还听说在27B以下实现智能体编码并不可行。我并不是要求一个能在一个HTML文件中一次性生成超逼真多人使命召唤克隆版的模型。只是想要一个在上述真实工作流程中稍微有点能力的东西。
相似文章
有人在智能体工作流中使用过SLMs吗?
一位用户向社区询问在智能体工作流中使用小型/本地语言模型执行特定任务(如路由、分类和提取)的情况,并分享了对大型模型是否总是必要的思考。
不再有开源SLM??
该帖子质疑小语言模型(SLMs)是否将不再开源,引发了关于开源AI未来的讨论。
大小真的重要吗?(LLMs vs. SLMs)
讨论了大语言模型(LLMs)与小语言模型(SLMs)之间的权衡,质疑在生产用例中是否总是需要更大的模型,并探讨了AI部署的未来。
大型语言模型在某些营销任务中过于庞大。小语言模型登场。
ZeroGPU推出了针对广告技术任务的专用小语言模型(SLM),与大型语言模型相比,成本更低、性能更快。这些小语言模型在CPU上运行,已帮助早期采用者Dappier将费用降低了50%。
超小型LLM真的有用吗?
探讨了非常小的语言模型是否能妥善处理日常对话,以及哪些训练因素使它们表现更佳。