TypeSafe的Jev无法生成无效输出,但其校准声明未附带ECE或可靠性曲线

Reddit r/ArtificialInteligence 新闻

摘要

TypeSafe AI推出了其Jev模型,声称没有幻觉且概率经过校准,但文章质疑校准缺乏公开证据,同时指出开发者快速采用。

TypeSafe AI于9月15日结束隐身状态,获得由DCVC领投的4000万美元融资,据报道估值为2亿美元,并推出了名为Jev的模型。由前OpenAI研究员Diogo Almeida于2024年创立,他曾参与InstructGPT、ChatGPT和GPT-4的开发。报道中主要有两个声明,需要分开讨论。声明1:它不会产生幻觉。确实如此,但范围比字面意思更窄。Jev不生成文本。它接收程序状态和类型化问题,返回类型化答案并为每个答案附带概率。输出空间在解码前固定,因此它物理上无法生成不在列表中的选项。这消除了虚构输出,但并不保证所选选项正确。错误但格式正确的输出仍然是错误的。The Register的Thomas Claburn也指出了这一点:没有幻觉并不意味着不会出错。底层技术也并非新事物。自2024年8月起,OpenAI的结构化输出中约束解码已保证100%符合JSON模式,而通过固定选项集评估模型概率而非让其生成自由文本,正是自2020年以来MMLU的评估方式。Jev的贡献在于能够零样本跨领域应用,而微调分类器只能覆盖单一领域。这是一个真正的贡献,只是与“不会产生幻觉”所暗示的不同。声明2:概率是校准的。公开未测量。这才是实际产品。每个答案都附带概率,其卖点是70%意味着大约70%的时间正确。训练方法称为校准决策强化学习,与RLHF和RLVR相对立。目前发布的:没有预期校准误差,没有可靠性曲线,没有在任何标准公开基准上的结果,没有架构论文。核心声明没有公开测量支持。已发布的是公司设计的评估,涵盖四个工作流任务,目标标签是GPT-6 Astra和Claude Fable 5.1在高思考下的平均值。这衡量的是与两个竞争模型的一致性,而非正确性。模型可能在每个案例上与参考一致,但在每个案例上都错误。在同一测试中,竞争模型使用默认推理设置运行,因此193.6倍速度和444.6倍成本倍率是针对推理关闭配置测量的,而准确性目标来自推理开启配置。TypeSafe的融资新闻稿称高达100倍,大约是主页数字的一半,公司本身也指出头条倍率是“现实世界收益的较高端”。真正强大的是采用率数字,因为它来自第三方。Vercel报告称Jev是AI Gateway历史上采用最快的模型:18小时内付费团队采用率十分之一,24小时内接近13%,是GPT-5.6家族第一天份额的两倍,是Fable 5.1的六倍。TypeSafe自己的文档也比其营销更坦诚。它发布了一个模型参差页面,指出Jev计数不可靠,在十六进制和RGB值上表现不佳,无法可靠判断两个值是否接近,并将日期读取为文本而非有序数量。它还声明语义相关输出之间没有保证的数学关系,这意味着一个陈述及其否定的概率不一定总和为1。这一点与校准卖点显得格格不入。开放问题:如果校准是产品,什么能说服这个社区它有效?公开基准上的可靠性曲线将是显而易见的起点。在公司外部有人测量之前,Jev最强有力的证据是开发者正在快速采用它,这是关于有用性而非校准的声明。
查看原文

相似文章

Jev

Product Hunt

Jev 是 TypeSafe AI 的前沿模型,用于快速、结构化的AI决策,返回带有校准概率的类型化输出,现已向所有人开放。

Near Here 获得了 TypeSafe Jev 的早期访问权限,因此我们对其进行了本地事件验证测试,单独调整了每个模型的提示。在我们的测试中,Jev 提供了最高 5.7 倍更快的响应速度、成本降低 98% 以及准确率提高 12 个百分点——查看结果、方法和局限性

Reddit r/artificial

该文章将 TypeSafe Jev 与 Mistral Small 4 和 Gemini 3.5 Flash-Lite 在本地事件验证方面进行了比较,表明 Jev 在测试中提供了更快、更便宜且更准确的结果。