Near Here 获得了 TypeSafe Jev 的早期访问权限,因此我们对其进行了本地事件验证测试,单独调整了每个模型的提示。在我们的测试中,Jev 提供了最高 5.7 倍更快的响应速度、成本降低 98% 以及准确率提高 12 个百分点——查看结果、方法和局限性

Reddit r/artificial 新闻

摘要

该文章将 TypeSafe Jev 与 Mistral Small 4 和 Gemini 3.5 Flash-Lite 在本地事件验证方面进行了比较,表明 Jev 在测试中提供了更快、更便宜且更准确的结果。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/16 11:33

# 测试TypeSafe Jev、Mistral与Gemini在本地活动验证任务中的表现 来源:https://nearhere.events/blog/typesafe-jev-mistral-gemini-event-validation 通过针对特定活动验证任务精心调优的提示词,实际对比分析各模型的准确率、响应时间与成本。 幼儿游戏时段应出现在活动网站上。房间租赁价目表则不应出现。介于两者之间的信息,使得自动化活动发现变得有趣:例如俱乐部晚餐、线上圣经学习、学校通知,或是描述缺失但本身有效的活动。 在Near Here平台,我们每月通过整体流程处理数百万个场地信息。当一条信息通过确定性检查后,有时需要模型回答一个具体问题:这些文字描述的内容是否应被排除?我们的目标是找到成本最低、体积最小且能胜任此任务的模型。 TypeSafe的Jev模型显得尤为相关。它返回类型化决策和概率值,而非生成聊天回复。我们使用独立调优的提示词,将其与Mistral Small 4和Gemini 3.5 Flash-Lite进行对比测试。以下是本轮测试(2026年9月16日进行)选出的最佳完整提示配置方案。 ## 任务定义 **挑战:** 在完成确定性检查后,根据标题和可选描述拒绝明确不适合的本地活动信息;在不浏览网络或验证字段准确性的前提下,批准其余所有信息。 这包括排除通用商品服务、场地租赁、空导航、私人或内部活动,以及取消或仅线上的活动。简短的标题、缺失的描述、预订要求或入场费用本身并不构成拒绝活动的理由。模型评判的是内容含义,而非检查日期、地址或信息提取质量。 我们希望快速获得实际测试数据。我们分别调优了每个模型的提示词,然后从所有开发测试案例中选出最强的完整配置。不同的提示词或活动样本可能产生不同结果。这是一次用例研究,而非通用模型排名。 ## 测试结果 所选配置方案:活动验证 (横向滚动对比三个模型) | 测量指标 | Mistral Small 4 | Gemini 3.5 Flash-Lite | TypeSafe Jev | |---------|----------------|---------------------|--------------| | 50个案例测试集的准确率 | 84% (42/50) | 86% (43/50) | 96% (48/50) | | 误拒的有效活动 | 5 / 13 | 1 / 13 | 0 / 13 | | 误批的应排除内容 | 3 / 37 | 6 / 37 | 2 / 37 | | 专项测试案例准确率 | 31 / 32 | 32 / 32 | 32 / 32 | | 平均响应时间 | 2.90秒 | 3.40秒 | 0.59秒 | | 每千次决策成本 | $0.370 | $2.496 | $0.043 | | 每百万输入/输出令牌美元价格 | $0.15 / $0.60 | $0.30 / $2.50 | $0.042 / 免费 | | 模型设置与输出 | 高推理模式;决策+解释 | 高思考模式;决策+解释 | 原生Choice+概率 | 此处的准确率指与测试前确定的预期决策匹配度。三个模型使用相同的50个测试案例,这些案例也用于指导提示词选择。速度和成本数据来自下文描述的21条记录独立测试。两个样本均不能预测生产环境中的准确率。 在主测试集上,Jev匹配了48/50个预期决策,未拒绝任何13个预期有效活动。Gemini匹配43个,Mistral匹配42个。错误分析与准确率数字同等重要:接受不适宜内容与隐藏有效活动是两种不同的产品失误。 ## 输出格式的重要性 Mistral和Gemini返回带有简短解释的结构化决策,均采用高推理设置。Jev则返回类别选择和概率值,不生成解释:一个类别表示无需排除,其他类别则代表不同的拒绝原因。 这些差异是所测配置方案的一部分。成本与耗时对比并非断言这是运行所有模型的最快或最廉价方式。本轮测试未尝试低计算量的聊天设置。类型化输出也无法保证语义决策的正确性。 ## 测试方法 1. **固定任务与预期决策** 主测试集包含50条真实记录:13条预期批准,37条预期拒绝。另测试了50条早期案例(含42条已捕获示例和8条合成案例),以及32条覆盖政策边界的专项案例。 2. **独立调优各提供商** 保持相同的决策策略,根据全部132个案例的总匹配数选择最佳完整配置。保留失败和中断的试验,单独检查误拒情况。未添加网站特定的提示例外。 3. **用新记录测试所选提示** 在查看21条未使用的真实列表的模型结果前,先固定提示词。这些记录已检查并编写预期决策,因此并非独立盲测。 4. **测量完整响应与令牌使用** 开发阶段使用三个并发调用。新记录测试阶段采用单次串行调用(各提供商并行)。计时包含客户端与网络开销。每条记录仅单次观测,无重试。 真实案例来自保留的拒绝记录,而非随机样本。预期决策由助手编写并在调用前确定,包含存在争议的产品判断,未经独立人工裁决。我们保留了输入、响应、提示词和哈希值,确保测量可追溯至原始证据。 ## 详细测量数据 提示词选择阶段的案例测试结果 (横向滚动对比三个模型) | 测量指标 | Mistral Small 4 | Gemini 3.5 Flash-Lite | TypeSafe Jev | |---------|----------------|---------------------|--------------| | 主测试集(50条记录) | 42 / 50 | 43 / 50 | 48 / 50 | | 早期测试集(50条记录) | 48 / 50 | 50 / 50 | 49 / 50 | | 所有提示测试(132条) | 121 / 132 | 125 / 132 | 129 / 132 | | 有效响应率 | 132 / 132 | 132 / 132 | 132 / 132 | 额外测试的21条记录仅含2条预期批准和19条预期拒绝(主要为汽车列表和牙科服务)。这提供的是窄范围验证,不能代表全面本地活动的性能表现。 21条额外记录的测试结果 (横向滚动对比三个模型) | 测量指标 | Mistral Small 4 | Gemini 3.5 Flash-Lite | TypeSafe Jev | |---------|----------------|---------------------|--------------| | 正确决策数 | 19 / 21 | 20 / 21 | 19 / 21 | | 误拒的有效活动 | 1 / 2 | 0 / 2 | 0 / 2 | | 误批的应排除内容 | 1 / 19 | 1 / 19 | 2 / 19 | | 有效响应数 | 21 / 21 | 21 / 21 | 21 / 21 | | 输入/输出令牌数 | 15,372 / 9,090 | 15,503 / 19,108 | 21,528 / 1,775 | | 预估总成本(21条记录) | $0.007760 | $0.052421 | $0.000904 | | 响应时间中位数 | 2.73秒 | 3.44秒 | 0.58秒 | 预估成本为标准未缓存美元价格乘以令牌数量,包含聊天模型的推理输出费用。Jev的输出在发布费率下免费。未计入优惠额度、税费或批量/缓存折扣。每千次决策成本为总记录成本除以21再乘以1000。以上为标价估算,非实际账单。 ## 对Near Here的意义 Jev非常契合这个特定决策场景。在本次测量配置下,它以低成本、短响应时间实现了主测试集的优异表现。额外样本规模小且范围窄,尚不足以确立普遍准确率优势。Mistral对有效活动的误拒也说明,我们不能仅看单一准确率指标。 这些是我们为潜在生产环境选用的提示配置方案;本报告未声称已部署使用。对我们而言,关键问题是:模型能否在满足流程所需量级和成本的前提下,精准完成这项特定决策。 ## 关于Near Here Near Here帮助人们发现英国各地的本地活动——从乡村集市、酒吧竞猜到手工艺工作坊和社区集会。由Jon和Ellie创建的平台,整合了分散在各个场馆网站的信息,包括那些从未登上主流票务平台的小型活动。 这项工作帮助我们保持信息实用性:在过滤服务介绍、商品推广或场地租赁页面的同时,发现真实可参与的活动。欢迎访问www.nearhere.events (https://www.nearhere.events/) 或阅读Near Here背后的故事 (https://nearhere.events/about)。 ## 资料来源、报告与联系方式 - 下载完整对比报告PDF (https://nearhere.events/downloads/near-here-event-validation-comparison-2026-09-16.pdf)——共三页,日期2026年9月16日。 - TypeSafe Jev原始视频公告 (https://x.com/CompleteSkeptic/status/2099925682726002904) 及官方发布公告与定价 (https://typesafe.ai/blog/introducing-system-one-models-and-jev)。 - Mistral定价说明 (https://docs.mistral.ai/inference/pricing) 与Small 4模型详情 (https://docs.mistral.ai/models/mistral-small-4-0-26-03)。API返回`mistral-small-latest`别名。 - Gemini定价方案 (https://ai.google.dev/gemini-api/docs/pricing)。我们请求并获得`gemini-3.5-flash-lite`模型。 - TypeSafe Choice文档 (https://docs.typesafe.ai/primitives/choice)。我们请求`jev-latest`版本;响应标识为`jev-1.13.0`。 价格核查日期:2026年9月16日。如有评估相关问题,请邮件联系[[email protected]](mailto:[email protected])。

相似文章