热门观点:Jev有趣之处不在于它是一个分类器,而在于我们一直将LLM用作极其昂贵的if/else语句

Reddit r/AI_Agents 新闻

摘要

作者认为,Jev及其类似的分类器之所以有趣,并非因为其新颖性,而是因为它们突显了LLM常被用于简单的决策任务,建议采用更高效的架构,使用较小的模型进行路由和评估。

好吧,也许我忽略了什么,但在两天内读了大约20个关于Jev的帖子后,哈哈,一半的讨论似乎是:'兄弟,这简直就是一个分类器',而另一半则争论说不,这不同,因为它拥有通用世界知识/零样本能力/不需要特定任务训练等等。老实说,我之前也是后者之一,所以决定亲自试用一下。以下是我的想法。我觉得双方可能都在争论错误的事情?对我来说,更有趣的发现是,我们使用完整的生成式LLM来处理实际上并非生成问题的情况,频率高得离谱。比如想想一个普通的智能体管道。应该调用工具A还是工具B?这个请求是计费/支持/退款?前一步骤真的成功了吗?应该把这个发给4B模型还是70B模型?这个答案足够好了吗,还是应该重试?这个PR风险足够大需要人工检查吗?而我们通常怎么做?调用一个LLM,让它'推理',然后要求它输出一些JSON,比如true或'tool_31414225'。当你这样写出来时,听起来确实有点蠢。我们基本上是每次需要有人勾选一个框时,都雇佣了一位小说家。这就是关于Jev(甚至是Laya/或其他必然会出现的模型)让我觉得有趣的地方。不是'天哪,分类器在2026年被发明了'。更像是……也许很多智能体架构现在是颠倒的?也许大型昂贵的自回归模型不应该坐在中间做出每一个决定。可能有大量微小的决策模型用于路由、门控、验证、状态转换等,然后只有当你真正需要生成或正确推理某些内容时,才唤醒大型LLM。所以,从基本上:用户 -> LLM -> LLM -> LLM -> 工具 -> LLM -> LLM,变成了更像:用户 -> 廉价路由器 -> 工具/模型 -> 廉价评估器 -> 仅在需要时才用大LLM。而如果那些'决策'模型实际上可以是微小的、本地的、快速的……我不知道,这似乎非常有用。讽刺的是,人们已经在构建开源版本并使用普通LLM logits做类似事情的事实,让我更不认为Jev本身有什么疯狂的护城河,而是更确信这种模式可能确实重要。不过,我很好奇这里真正构建智能体的各位?你们当前LLM使用中,有多少基本上只是昂贵的是/否或N选一决策?因为我正在看一些我参与过的系统……可能比我想承认的要多得多,哈哈。
查看原文

相似文章

Jev / TypesafeAI 在 LLM 领域堪称革命性

Reddit r/ArtificialInteligence

Jev 是一种新型 AI 模型,它输出评分、选择或二元决策,因其在创意查询时的速度、经济性和准确性而备受赞誉,不同于传统的前沿模型。