一款估值四千万美元的模型正以"校准置信度"作为卖点,然而至今未见任何校准数据公开发布。

Reddit r/artificial 新闻

摘要

TypeSafe AI推出了Jev模型,宣称其AI回答具有标定置信度,但因未公开标定数据引发质疑,尽管其早期采用指标表现强劲。

TypeSafe AI 于9月15日结束隐身模式,宣布获得由DCVC领投的4000万美元融资,估值据称达2亿美元。公司由前OpenAI研究员Diogo Almeida创立,其曾参与InstructGPT、ChatGPT和GPT-4的研发。该公司推出的模型Jev并不生成文本,而是通过分析程序状态与类型化问题,返回带有概率评估的类型化答案。这一设计借鉴了卡尼曼提出的"系统一"理论:强调快速直觉判断而非深思熟虑。产品的核心主张是这些概率经过校准——即70%概率的预测应在约70%的情况下正确。TypeSafe将这种训练方法称为"校准决策强化学习"。 目前报道中让我存疑的关键在于:校准性作为产品的核心,却缺乏公开的测量数据。既无预期校准误差分析,也无可靠性图表,更没有在任何标准公开基准上的测试结果,也未发布架构论文。对于一家以"修正AI过度自信"为卖点的公司而言,恰恰是这个修正过度自信的特性没有任何公开支撑。 目前已公开的仅是一项由公司设计的四工作流任务评估,其正确答案定义为高思考模式下GPT-6 Astra与Claude Fable 5.1的平均表现。这衡量的是与两个竞品模型的共识度而非正确性——模型可能在每个案例上与参考答案一致,却在所有案例上都判断错误。值得注意的是,对比实验中的竞品模型采用默认推理设置运行,因此193.6倍速度提升与444.6倍成本降低的比较对象是关闭推理功能的配置,而准确性目标却来自开启推理的配置。 所谓"不会产生幻觉"仅在狭窄意义上成立:由于输出空间在解码前已固定,模型无法生成列表之外的选项。这消除了虚构输出,但无法保证所选选项正确。《The Register》曾指出相同观点:不产生幻觉并不等于判断正确。况且受限解码技术并非新事物,OpenAI自2024年8月起就已保证JSON Schema合规性。 但以下方面值得认可:第三方统计的采用数据颇为亮眼。Vercel报告显示Jev是其AI Gateway历史上采用最快的模型:18小时内获得10%付费团队使用,24小时覆盖近13%用户,首日采用率约为Fable 5.1的六倍。更难得的是TypeSafe的技术文档异常坦诚——其专门页面指出Jev计数功能不可靠,在十六进制与RGB数值处理上表现欠佳,无法判断数值邻近性,且将日期识别为文本。文档更明确说明语义相关输出之间不存在确定的数学关系,因此某个陈述与其否定形式的概率总和未必等于1。这种坦率承认与校准性宣传形成鲜明对比,而公司仍选择公开披露。 综上所述,我们看到的是真实的产品、真实的采用率,以及一项未经公司外部测量的核心特性。在将置信度数字投入生产环境之前,你希望看到哪些验证指标?
查看原文

相似文章

Jev

Product Hunt

Jev 是 TypeSafe AI 的前沿模型,用于快速、结构化的AI决策,返回带有校准概率的类型化输出,现已向所有人开放。