大型语言模型在某些营销任务中过于庞大。小语言模型登场。

Reddit r/ArtificialInteligence 模型

摘要

ZeroGPU推出了针对广告技术任务的专用小语言模型(SLM),与大型语言模型相比,成本更低、性能更快。这些小语言模型在CPU上运行,已帮助早期采用者Dappier将费用降低了50%。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/25 15:20

# 大型语言模型对于某些营销任务来说过于强大。小型语言模型登场 来源:https://www.adexchanger.com/ai/large-language-models-are-overkill-for-some-marketing-tasks-enter-the-small-language-model/ 大型语言模型(LLM)成本高得离谱,这已不是秘密。 企业开始限制员工使用 AI(https://www.wsj.com/tech/ai/corporate-america-is-starting-to-ration-ai-as-cost-skyrockets-1eb99d7a)以节省开支;OpenAI 甚至讨论过降低 token 成本(https://www.adexchanger.com/daily-news-roundup/friday-12062026/)来留住对价格敏感的客户。 但你知道什么比大型语言模型更便宜吗?小型语言模型。 AI 公司 ZeroGPU 开发了小型语言模型(SLM),这些模型基于较少数据训练,旨在执行特定任务和用例。 周四,该公司发布了一组面向广告技术的专用 SLM,旨在帮助科技公司以更低成本更快处理高容量工作流。 ## **小而精,而非大而全** LLM “拥有数万亿参数”,且基于整个互联网进行训练,ZeroGPU 创始人兼 CEO Maddy Arvapally 说。 但对于许多重复性的广告技术任务,如内容分类或文档摘要,参数少于 100 亿的更小模型就足以胜任,她表示。此外,使用 SLM 比让 LLM 执行相同任务更便宜、更快速。 由于需要处理海量数据,LLM 依赖高性能图形处理器(GPU)来输入数据并不断调整模型参数。但企业级 GPU 价格昂贵,因此许多科技公司从云基础设施提供商处租用 GPU。无论哪种方式,GPU 成本最终都会转嫁给终端用户。 而 ZeroGPU 的较小模型运行在中央处理器(CPU)上,CPU 更便宜,且一次处理一个任务。它们还可以在浏览器中运行。 由于 SLM 处理成本较低,AI 变现公司 Dappier 在采用 ZeroGPU 的模型后,总体开支下降了 50%,联合创始人兼 CEO Dan Goikhman 表示。 Dappier 为营销人员提供在线和离线 AI 智能体(https://www.adexchanger.com/publishers/brands-can-now-deploy-their-own-agents-inside-publisher-chatbots/)(本质上就是品牌专属聊天机器人),这些智能体基于品牌语调与准则进行训练。该公司还授权出版商数据(https://www.adexchanger.com/publishers/ai-search-adoption-is-boosting-benzingas-data-licensing-biz/)用于训练 AI 工具。 截至目前,Dappier 已采用三个 ZeroGPU 的 SLM:一个用于内容分类,一个用于意图分类,一个用于审核(即品牌安全)。 ## **与时俱进** Dappier 创建的营销专用智能体需要对客户查询和后续互动“高度响应”,Goikhman 表示,包括对每次对话进行分类并提取用户的“商业意图”。意图可以是任何内容,例如寻找某类产品,或想知道该品牌与竞争对手相比有何不同。 比如,假设用户正在家长网站上阅读一篇关于辅导孩子做作业的文章。Dappier 可以创建一个聊天机器人,生成提示建议,与用户展开关于育儿的对话。 但 SLM 会随着互动的发展持续分析对话上下文和用户意图,Goikhman 说。这使智能体能够不断将用户正在参与的内容以及与机器人的对话映射到 IAB 上下文类别。 目的是向发布商和广告商展示文章及后续对话的内容,他解释道。这样他们就能了解应展示哪些对话提示以保持用户参与,以及哪些类型的广告商可能对该页面及随后的机器人互动感兴趣。 ## **终极前沿?** 更改 AI 工具运行的模型听起来是一项艰巨的任务。但 ZeroGPU 优先考虑帮助客户轻松过渡到 SLM。 其模型拥有“兼容 OpenAI 的端点”,Arvapally 说,这意味着客户只需在后端替换一个 URL,使其调用 ZeroGPU 的 API 而非 OpenAI 的 API。 据 Goikhman 称,整个过程只需大约五分钟。 此前,Dappier 使用 OpenAI 和 Claude 等前沿模型来生成提示和理解上下文。但 SLM 的结果仍然是为客户需求量身定制的,且 AI 在训练中不依赖过多额外资源。 例如,Dappier 跟踪消费者在其聊天机器人中的所有对话,以确定提示建议的最佳实践。但其 SLM 仅基于这些对话和实践进行训练。 Dappier 的另一个主要用例是将文章和对话分类到 IAB 类别中。IAB 内容分类法包含 1,500 多个类别(https://iabtechlab.com/standards/content-taxonomy/),而 SLM 已针对所有这些类别进行训练。 但如果你让内容分类模型进行情感分析,它无法提供结果,Arvapally 说,“因为那根本不是它的用途。” (不过,ZeroGPU 有单独的模型用于情感分析。从这个意义上说,SLM 在特定用例上有点像“我认识一个专门搞这个的”。) 同时,使用 SLM 为特定任务开发工具,执行该任务的速度也快于使用通用 LLM。 Dappier 的内容分类模型可以比前沿模型更快地生成 IAB 分类,因为前沿模型在尝试处理分类法的同时还要吸收查询内容,Arvapally 说。 此外,她补充道,前沿模型在分类任务中存在较高的幻觉率,因为许多 IAB 类别名称相似,而未经过专门训练的模型常常将它们混淆。 但由于 SLM 已针对分类法进行训练,它只需要吸收正在分析的具体文章内容,从而减少了从提示到响应的时间。 结果,Arvapally 说,就是“低于 50 毫秒的响应时间,这对前沿模型来说是不可能的。”

相似文章

大小真的重要吗?(LLMs vs. SLMs)

Reddit r/artificial

讨论了大语言模型(LLMs)与小语言模型(SLMs)之间的权衡,质疑在生产用例中是否总是需要更大的模型,并探讨了AI部署的未来。

SLM的消亡?

Reddit r/LocalLLaMA

作者反思了27B以下的小语言模型是否正被Qwen 3.5和Gemma 4等更大模型所掩盖,并询问社区中有哪些适合智能体编码任务的高性能SLM。

有人在智能体工作流中使用过SLMs吗?

Reddit r/AI_Agents

一位用户向社区询问在智能体工作流中使用小型/本地语言模型执行特定任务(如路由、分类和提取)的情况,并分享了对大型模型是否总是必要的思考。