一款估值四千万美元的模型正以"校准置信度"作为卖点,然而至今未见任何校准数据公开发布。
摘要
TypeSafe AI推出了Jev模型,宣称其AI回答具有标定置信度,但因未公开标定数据引发质疑,尽管其早期采用指标表现强劲。
TypeSafe AI 于9月15日结束隐身模式,宣布获得由DCVC领投的4000万美元融资,估值据称达2亿美元。公司由前OpenAI研究员Diogo Almeida创立,其曾参与InstructGPT、ChatGPT和GPT-4的研发。该公司推出的模型Jev并不生成文本,而是通过分析程序状态与类型化问题,返回带有概率评估的类型化答案。这一设计借鉴了卡尼曼提出的"系统一"理论:强调快速直觉判断而非深思熟虑。产品的核心主张是这些概率经过校准——即70%概率的预测应在约70%的情况下正确。TypeSafe将这种训练方法称为"校准决策强化学习"。
目前报道中让我存疑的关键在于:校准性作为产品的核心,却缺乏公开的测量数据。既无预期校准误差分析,也无可靠性图表,更没有在任何标准公开基准上的测试结果,也未发布架构论文。对于一家以"修正AI过度自信"为卖点的公司而言,恰恰是这个修正过度自信的特性没有任何公开支撑。
目前已公开的仅是一项由公司设计的四工作流任务评估,其正确答案定义为高思考模式下GPT-6 Astra与Claude Fable 5.1的平均表现。这衡量的是与两个竞品模型的共识度而非正确性——模型可能在每个案例上与参考答案一致,却在所有案例上都判断错误。值得注意的是,对比实验中的竞品模型采用默认推理设置运行,因此193.6倍速度提升与444.6倍成本降低的比较对象是关闭推理功能的配置,而准确性目标却来自开启推理的配置。
所谓"不会产生幻觉"仅在狭窄意义上成立:由于输出空间在解码前已固定,模型无法生成列表之外的选项。这消除了虚构输出,但无法保证所选选项正确。《The Register》曾指出相同观点:不产生幻觉并不等于判断正确。况且受限解码技术并非新事物,OpenAI自2024年8月起就已保证JSON Schema合规性。
但以下方面值得认可:第三方统计的采用数据颇为亮眼。Vercel报告显示Jev是其AI Gateway历史上采用最快的模型:18小时内获得10%付费团队使用,24小时覆盖近13%用户,首日采用率约为Fable 5.1的六倍。更难得的是TypeSafe的技术文档异常坦诚——其专门页面指出Jev计数功能不可靠,在十六进制与RGB数值处理上表现欠佳,无法判断数值邻近性,且将日期识别为文本。文档更明确说明语义相关输出之间不存在确定的数学关系,因此某个陈述与其否定形式的概率总和未必等于1。这种坦率承认与校准性宣传形成鲜明对比,而公司仍选择公开披露。
综上所述,我们看到的是真实的产品、真实的采用率,以及一项未经公司外部测量的核心特性。在将置信度数字投入生产环境之前,你希望看到哪些验证指标?
相似文章
TypeSafe的Jev无法生成无效输出,但其校准声明未附带ECE或可靠性曲线
TypeSafe AI推出了其Jev模型,声称没有幻觉且概率经过校准,但文章质疑校准缺乏公开证据,同时指出开发者快速采用。
TypeSafe AI发布AI模型Jev。与生成文本不同,该模型专注于决策。与传统大语言模型相比,其幻觉率显著降低,且输出成本极低。
TypeSafe AI推出了Jev,这是一款专为机器原生交互设计的AI模型,能够返回类型化的概率决策而非文本,相较于传统大语言模型具有更低的幻觉率和更快的响应速度。
@rohanpaul_ai: 一个名为JevBench的新基准刚刚发布。针对输出为有界软件决策而非开放式文本…
JevBench是一个新基准,通过结合智能、校准、速度和成本来评估AI模型在有界软件决策上的表现,由@rohanpaul_ai宣布。
@ArizePhoenix: TypeSafe本周公开亮相,发布Jev,首个System One Model:一个从不生成文本的前沿模型…
TypeSafe推出Jev,首个System One Model,这是一种前沿AI模型,输出的是类型化的概率决策,而不是文本。
Jev
Jev 是 TypeSafe AI 的前沿模型,用于快速、结构化的AI决策,返回带有校准概率的类型化输出,现已向所有人开放。