新AI初创公司构建用于自动化的LLMs结构化替代方案;外部测试显示更低延迟和成本

Reddit r/ArtificialInteligence 模型

摘要

TypeSafe AI 推出了 Jev,这是一种针对LLMs的结构化替代方案,用于自动化,显著降低了延迟和成本,并获得了来自DCVC的4000万美元种子轮融资。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/16 17:30

# TypeSafe推出Jev:宣称比大语言模型更快、更便宜的AI自动化替代方案 来源:https://theframenews.org/en/typesafe-jev-faster-cheaper-llm-alternative/ ## 简言之 TypeSafe AI发布了Jev,这是一款早期访问模型,它能返回带概率的结构化决策,而非自由生成的文本(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。该公司称Jev响应时间为70到500毫秒,并且在其自身的工作流评估中,速度比所比较的语言模型快193.6倍,成本低444.6倍(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。这些评估由TypeSafe设计,尚未被独立复现(https://www.theregister.com/ai-and-ml/2026/09/16/typesafe-ai-debuts-model-for-machines-that-plays-doom/5296711)——另一家媒体在评测该产品时得出了相同结论(https://www.modemguides.com/blogs/ai-news/jev-typesafe-reality-check-run-locally)。在媒体公司Every进行的另一项测试中,Jev比Fable 5.1快约25倍,估算成本低约580倍,并在七处刻意植入的写作问题中找出了六处;而Fable找出了全部七处(https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds)。投资方DCVC表示,其领投了该公司4000万美元的种子轮融资(https://www.finsmes.com/2026/09/typesafe-ai-raises-40m-in-seed-funding.html)。 ## 事件详情 TypeSafe于2026年9月15日宣布了Jev(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。创始人Diogo Almeida此前曾在OpenAI工作,并合著了关于使用人类反馈训练语言模型的2022年InstructGPT论文(https://arxiv.org/abs/2203.02155),他表示公司已处于隐身模式两年(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。Jev目前提供早期访问。同日,DCVC宣布其领投了对总部位于旧金山的TypeSafe的4000万美元种子轮融资(https://www.finsmes.com/2026/09/typesafe-ai-raises-40m-in-seed-funding.html)。 TypeSafe称Jev为其首个“System One Model”,该名称源自Daniel Kahneman关于快速直觉思维与缓慢审慎推理的区分(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。像ChatGPT这样的聊天模型逐词生成答案。Jev不生成文本:开发者预先定义可能的答案,Jev则以该格式返回选项、分数和概率(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。 例如,一个应用程序可以向Jev传递一条客户消息,并询问它涉及计费、技术支持或其他预定义类别的概率,然后根据结果对该消息进行路由。 据TypeSafe称,Jev结合了一种新型模型架构、一个在单个并行步骤中产生所有输出的采样器,以及一种该公司称为“校准决策强化学习”的训练方法(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。公司表示其所有训练数据都是内部创建的,并且不会使用客户数据进行训练(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。它还表示Jev不是一种语言模型(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。 Jev在单次决策中最多可从255个选项中进行选择。对于更大的选项集,TypeSafe使用两阶段流程,先对选项评分再选择,公司表示这可能会减慢响应速度(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。 **价格与速度。** TypeSafe的收费为每百万输入代币0.042美元,目前不对输出收费(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。它列出的端到端响应时间为70至500毫秒,并称这使得Jev在其设计的结构化任务上比前沿语言模型快40到200倍(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。公司表示其延迟测量通常在美国西海岸运行其服务的笔记本电脑上进行,并且目前无法证明其定价没有受到补贴(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。 **TypeSafe自身的评估。** 193.6倍的速度和444.6倍的成本数据来自TypeSafe构建的四个工作流,用于在软件管道内测试模型(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。公司已公布了这些工作流、完整查询、示例以及模型意见不一致的案例。 这些评估并未根据独立验证的正确答案来检查答案。相反,TypeSafe将两个大型模型GPT-6 Astra和Fable 5.1的平均预测作为参考,并衡量其他模型与此的匹配程度(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。TypeSafe对结果附加了几项说明: - 实际用户可能看到的收益很可能处于较高水平(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。 - 这些工作流由TypeSafe自身的模型能力团队编写,因此可能存在偏见(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。 - 竞争模型通过TypeSafe的封装器运行,使其返回带概率的决策,公司表示这往往会使其变得更慢、更昂贵(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。 - 使用Astra和Fable作为参考有利于OpenAI和Anthropic的模型;TypeSafe表示这可能低估了Jev和DeepSeek模型的性能(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。 TypeSafe表示不会发布公共基准测试结果,并鼓励用户构建自己的评估(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。 **关于“幻觉”的声明。** TypeSafe称Jev“无法产生幻觉”(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。该公司文档中的保证范围更窄:Jev无法返回超出开发者定义结构的值(https://docs.typesafe.ai/concepts/system-one)。TypeSafe表示其0%的该属性数字不是测量值,而是由设计得出(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。其展示的语言模型对比数据来自路由服务OpenRouter,该公司承认该服务可能存在偏差(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。 一个有效的答案不一定是正确的。一个被要求将交易标记为欺诈或非欺诈的模型总会返回这两个标签之一,但它仍可能选错。 **外部测试。** Every的评估负责人Mike Taylor报告称,在11个实验中运行了1709次Jev判断。在一项测试中,Jev在不到0.7秒的时间内对37份文档返回了777次判断(https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds)。 Every的CEO Dan Shipper在包含七处刻意引入的写作问题的合成段落上比较了Jev和Fable 5.1。Jev每段耗时中位数0.35秒,Fable为8.83秒,使得Jev在该测试中快约25倍(https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds)。Every估算Jev的成本低约580倍。Jev找出了七个问题中的六个。Fable找出了全部七个(https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds)。 Every的测试使用了与TypeSafe评估不同的任务,且并未复现后者。 ## 这意味着什么(以及不意味着什么) Jev为开发者提供了一种不同的接口。他们不再接收软件需要解析和检查的文本,而是接收预先固定格式的数值和概率。这适用于分类、路由、评分和信息提取等不需要生成文字答案的任务(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。它并非为聊天、写作或编程设计。 速度和成本数据适用于特定测试。193.6倍和444.6倍的数字描述的是TypeSafe的工作流和比较设置(https://typesafe.ai/blog/introducing-system-one-models-and-jev)。Every的数字描述的是一个写作检查任务(https://every.to/also-true-for-humans/mini-vibe-check-typesafe-s-jev-judged-everything-i-ve-written-in-0-7-seconds)。两者都未确立在所有AI任务上的普遍优势,且在Every的测试中,更快、更便宜的模型也是那个不够彻底的。 其设计杜绝了格式错误的输出,但并未杜绝错误的决策。 ## 我们仍然不知道什么 独立复现。尚未发现有来源使用相同方法重新运行TypeSafe的工作流评估。准确性与校准性。TypeSafe称Jev的概率是校准的,即更高的置信度对应更高的准确性。目前尚无独立证据表明Jev在众多真实任务(带有验证过的答案)中的准确性和校准性与大型语言模型相比如何;Every的“六处对七处”结果仅覆盖一项任务。规模化性能。已发布的延迟数据未显示Jev在持续生产负载下或从其他区域运行时的表现。长期价格。TypeSafe表示目前无法证明当前定价没有受到补贴。生产环境使用。所审查的资料未提及有客户大规模运行Jev。估值。4000万美元数字和DCVC的领投角色来自DCVC和TypeSafe自身的公告。估值未披露。

相似文章

These startups are chasing the next big thing in LLMs

MIT Technology Review

MIT Technology Review reports on a wave of startups pursuing post-transformer architectures for LLMs, as the dominant model family faces growing costs, energy use, and context-length limits. Companies like Subquadratic aim to build the next generation of AI.