299个真实用户意图测试Jev与生产基线的对比。结果如下。

Reddit r/AI_Agents 新闻

摘要

文章报告了glm-4-flash和TypeSafe Jev在299个真实用户意图上的性能比较,显示glm-4-flash的准确率更高,但TypeSafe Jev的速度更快且成本更低。

来自我们飞书生活助手路由器的299个真实用户意图。相同的黄金标签。相同的硬测试套件(19个技能,歧义案例)。glm-4-flash(生成式,生产环境):271/299 = 90.6% TypeSafe Jev(分类器/系统一):262/299 = 87.6% 我仍然会将分类器置于关键路径首位。在29个只有glm解决的案例中:23个是单一模糊技能(行程规划 vs 生活服务简报)。在20个只有Jev解决的案例中:15个是glm的JSON/解析失败,在生产环境中回退到未知。中位数延迟:0.55秒 vs 3.6秒。格式解析失败:0 vs 16。在Jev上299×2的成本为0.086美元。硬限制:Jev只路由,不提取参数。生产环境在网关后仍需生成步骤。使用llm-fit在已发布的相同生产意图路径上测量——非公开排行榜。
查看原文

相似文章

Near Here 获得了 TypeSafe Jev 的早期访问权限,因此我们对其进行了本地事件验证测试,单独调整了每个模型的提示。在我们的测试中,Jev 提供了最高 5.7 倍更快的响应速度、成本降低 98% 以及准确率提高 12 个百分点——查看结果、方法和局限性

Reddit r/artificial

该文章将 TypeSafe Jev 与 Mistral Small 4 和 Gemini 3.5 Flash-Lite 在本地事件验证方面进行了比较,表明 Jev 在测试中提供了更快、更便宜且更准确的结果。

Jev

Product Hunt

Jev 是 TypeSafe AI 的前沿模型,用于快速、结构化的AI决策,返回带有校准概率的类型化输出,现已向所有人开放。

我对比测试了Jev和gpt-5.6-luna!

Reddit r/ArtificialInteligence

本文展示了基准测试比较,显示Jev在49项任务中有42项胜过gpt-5.6-luna,具有更低的延迟和成本,但在文本生成和某些推理方面存在局限性。