热门观点:Jev有趣之处不在于它是一个分类器,而在于我们一直将LLM用作极其昂贵的if/else语句
摘要
作者认为,Jev及其类似的分类器之所以有趣,并非因为其新颖性,而是因为它们突显了LLM常被用于简单的决策任务,建议采用更高效的架构,使用较小的模型进行路由和评估。
好吧,也许我忽略了什么,但在两天内读了大约20个关于Jev的帖子后,哈哈,一半的讨论似乎是:'兄弟,这简直就是一个分类器',而另一半则争论说不,这不同,因为它拥有通用世界知识/零样本能力/不需要特定任务训练等等。老实说,我之前也是后者之一,所以决定亲自试用一下。以下是我的想法。我觉得双方可能都在争论错误的事情?对我来说,更有趣的发现是,我们使用完整的生成式LLM来处理实际上并非生成问题的情况,频率高得离谱。比如想想一个普通的智能体管道。应该调用工具A还是工具B?这个请求是计费/支持/退款?前一步骤真的成功了吗?应该把这个发给4B模型还是70B模型?这个答案足够好了吗,还是应该重试?这个PR风险足够大需要人工检查吗?而我们通常怎么做?调用一个LLM,让它'推理',然后要求它输出一些JSON,比如true或'tool_31414225'。当你这样写出来时,听起来确实有点蠢。我们基本上是每次需要有人勾选一个框时,都雇佣了一位小说家。这就是关于Jev(甚至是Laya/或其他必然会出现的模型)让我觉得有趣的地方。不是'天哪,分类器在2026年被发明了'。更像是……也许很多智能体架构现在是颠倒的?也许大型昂贵的自回归模型不应该坐在中间做出每一个决定。可能有大量微小的决策模型用于路由、门控、验证、状态转换等,然后只有当你真正需要生成或正确推理某些内容时,才唤醒大型LLM。所以,从基本上:用户 -> LLM -> LLM -> LLM -> 工具 -> LLM -> LLM,变成了更像:用户 -> 廉价路由器 -> 工具/模型 -> 廉价评估器 -> 仅在需要时才用大LLM。而如果那些'决策'模型实际上可以是微小的、本地的、快速的……我不知道,这似乎非常有用。讽刺的是,人们已经在构建开源版本并使用普通LLM logits做类似事情的事实,让我更不认为Jev本身有什么疯狂的护城河,而是更确信这种模式可能确实重要。不过,我很好奇这里真正构建智能体的各位?你们当前LLM使用中,有多少基本上只是昂贵的是/否或N选一决策?因为我正在看一些我参与过的系统……可能比我想承认的要多得多,哈哈。
相似文章
Jev 不是 LLM 杀手,也不仅仅是一个分类器。我们将其部署于生产环境并与真实用户一起使用。以下是我们学到的经验。
文章分享了使用 Jev(一个语义决策引擎)的生产见解,它通过与 LLMs 并行高效处理常规决策来增强 AI 代理系统,而不替代生成模型。
@mstockton: 围绕Jev模型的一些未经修饰的想法。自言自语:- 商业中有很多很多问题都是分类问题……
作者讨论了使用经典机器学习与LLMs处理商业分类和回归问题,评估了Jev模型作为潜在工具,并将其与现有技术如Structured Outputs和DSPy进行比较,重点强调了可访问性和有效性方面的担忧。
@paarangatrai: 这是理解Jev的最简单方式:大语言模型生成答案。Jev做出决策。这听起来像是一个小小的区别……
这篇文章介绍了Jev,一个旨在做出决策而非生成答案的AI模型,使用结构化输出用于欺诈检测和风险评估等应用,将其定位为大型推理模型的路由层。
Jev 并非新技术。其营销对象是那些认为 AI 起始于 LLMs 的人。
本文批评了 Jev,认为它并非新的 AI 范式,而是一种专门的分类器,其营销针对那些将 AI 等同于 LLMs 的人群。
Jev / TypesafeAI 在 LLM 领域堪称革命性
Jev 是一种新型 AI 模型,它输出评分、选择或二元决策,因其在创意查询时的速度、经济性和准确性而备受赞誉,不同于传统的前沿模型。