Typesafe的JEV模型作为LLM [P]

Reddit r/MachineLearning 模型

摘要

描述了一个对话AI系统,该系统使用Typesafe的Jev非生成模型,通过并行分类和评分从预写回复中选择,提供了一种成本效益高且透明的替代生成式LLM的方案。

我构建了一个对话AI,它不生成任何标记——它使用TypeSafe的Jev从400个预写回复中选择,Jev是一个非生成模型,返回概率判断而非文本。 技术方法:传统LLM逐标记生成回复。我反转了这个——我手写了400个回复,让AI选择最佳匹配。 以下是架构: 步骤1:分类(400毫秒,1次API调用) 我并行询问Jev关于用户消息的18个问题: 同时询问的问题: - 意图(选项:问候/投诉/问题等——14个选项) - 正式性(评分:0-4量表,5个级别) - 情感强度(评分:0-4量表) - 需要人类(Noul:是/否概率) - 子类别_问候(选项:如果意图=问候,哪种类型?) - 子类别_投诉(选项:如果意图=投诉,哪种类型?) ... [14个推测性子类别问题,每个意图一个] 所有18个问题在一次API调用中运行,使用推测性扇出——代码仅读取获胜意图的子类别答案。这消除了额外的往返而没有额外成本。 步骤2:候选获取(0毫秒,纯代码) 回复库的结构为: { complaint: { empathetic: [ { id: "cmp_emp_1", text: "Three times is way too many..." }, { id: "cmp_emp_2", text: "I hear you — that's frustrating..." }, // ...总共10个回复 ], solution_oriented: [ ... ] }, greeting: { ... } } 代码查找bank[intent][subcategory]并拉取约10个候选。如果一个类别中有超过10个,我运行一个廉价的Noul短名单(每个候选一个是/否问题)来缩小范围。 步骤3:评分(400毫秒,1次API调用) 每个候选在6个维度上并行评分: 每个候选(10个候选 × 6个维度 = 60个问题): - 相关性(评分:0-4) - 语气匹配(评分:0-4) - 有用性(评分:0-4) - 回答问题(Noul:0-1) - 具体性(评分:0-4) - 自然流畅度(评分:0-4) 然后我应用上下文感知权重: // 默认权重 weights = { relevance: 0.25, tone: 0.15, helpfulness: 0.20, ... } // 情感强烈?语气更重要 if (emotional_intensity > 2.5) { weights.tone = 0.30; weights.relevance = 0.20; } // 闲聊?自然流畅度更重要 if (intent === "small_talk") { weights.natural_flow = 0.35; weights.helpfulness = 0.05; } 胜者 = 最高加权分数。 步骤4:输出 如果最终分数 < 0.4 或意图置信度 < 0.3,可选的LLM后备方案启动(我使用Claude Haiku)。否则,返回选定的回复。 示例流程: 用户:"我很沮丧,我的订单已经错误三次了" 分类(400毫秒): 意图:投诉(91%置信度) 子类别:共情(推测性答案,因投诉获胜而使用) 情感强度:3.8/4.0 正式性:1.2/4.0 需要人类:0.34(低于0.8阈值,继续) 获取:从投诉/共情获取10个回复 评分(400毫秒): 每个候选 × 6个维度 权重调整:语气=30%(情感强烈) 前三名: #1:"三次实在太多了..." → 0.82 #2:"我听到你了——这很令人沮丧..." → 0.77 #3:"那听起来真的很令人沮丧..." → 0.70 胜者:回复 #1(最高加权分数) 总计:约800毫秒,每条消息约0.0001美元 为什么这有效: 哲学问题很合适。哲学是关于选择正确的框架,而不是生成洞见。"生活的目的是什么?"有许多有效的视角——选择感觉自然。 没有幻觉。每个词都是预写的。 非常适合客户支持或任何品牌安全重要的地方。 完全透明。你看到意图 → 分数 → 胜者。没有"模型决定"的黑箱。 便宜100倍。每条约0.0001美元 vs 约0.01-0.10美元。 哪里会失败: 无法生成任何东西。没有编码、写作、创意任务。如果不在库中,我就没有。 限于400个回复。适用于有界对话(支持、FAQ、入职)。 扩展需要手动工作或带有动态槽的模板回复。 事实问答很棘手,除非你用实时数据模板化回复。 我为低置信度添加了LLM后备方案,但90%是纯选择。 Jev没有做的事情: 它不读取回复库——我在代码中获取候选。Jev只分类消息并对候选评分。没有推理,没有生成,只有快速的概率判断。 链接: 实时演示:https://jevllm.pages.dev(终端模式 + 管道浏览器) 源代码:https://github.com/akash-kamat/jev-llm 欢迎反馈——特别是如果有人尝试过类似的基于选择的方法或对扩展回复库有想法!
查看原文

相似文章

Jev / TypesafeAI 在 LLM 领域堪称革命性

Reddit r/ArtificialInteligence

Jev 是一种新型 AI 模型,它输出评分、选择或二元决策,因其在创意查询时的速度、经济性和准确性而备受赞誉,不同于传统的前沿模型。

Jev

Product Hunt

Jev 是 TypeSafe AI 的前沿模型,用于快速、结构化的AI决策,返回带有校准概率的类型化输出,现已向所有人开放。