我对比测试了Jev和gpt-5.6-luna!
摘要
本文展示了基准测试比较,显示Jev在49项任务中有42项胜过gpt-5.6-luna,具有更低的延迟和成本,但在文本生成和某些推理方面存在局限性。
我几天前获得了TypeSafe的Jev的访问权限。这是一种奇怪的模型,完全不生成文本。你发送一些内容加带类型的问题(是/否、从这些选项中选一个、在这个量表上评分),它会返回概率。设置:49项任务,约8,200个条目,全部来自公开标注数据集(SST-2、MMLU、ARC、MS MARCO、XNLI、SQuAD、Banking77等),加上一些合成测试,其中代码计算正确答案。两个模型使用相同的问题措辞。基线是关闭推理的gpt-5.6-luna,以及开启低推理的gpt-5.6-luna。我的发现:Jev在49项任务中有42项匹配或超过基线!中位服务器时间约105毫秒对比700-800毫秒,每1,000条目约0.04美元对比0.16-0.19美元,校准误差大约是基线的一半,所以概率确实有意义。让我惊讶的部分是推理。LogiQA 0.77对比0.59,WinoGrande 0.89对比0.66,ARC-Challenge 0.97对比0.87,MMLU 0.94对比0.87。我假设它记忆了基准测试,所以我用Fable 5.1脚本生成了120个新的数学文字题。它在这些题目上得到0.75,与它在GSM8K上的0.72差不多。关闭推理的Luna在相同题目上得到0.17。重排序也是一个明显的优势(NFCorpus nDCG@10 0.73对比0.63),Luna在那里每个查询需要1-3秒。它失败的地方:在列表中计数(0.87对比0.99,一旦Luna可以推理),从77个意图中选择1个(Banking77,0.81对比0.87),问一个问题然后它的否定没有给出加起来为1的概率,平均偏差约0.3。在一个单独的私有测试中,大约100个长文档在一次请求中,它给少数完全不相关的文档打了高相关性分数。没有干净的基准测试显示这一点,因为我知道有人会问。这些是公开基准测试,所以任何模型都可能存在污染,新的数学集是我唯一的控制。基线故意设定为无/低推理。每任务200个条目意味着任何低于约0.05的都是噪声。只有7个领先明显超出误差范围。而且它不能写文本、调用工具或解释自己,所以它不会取代你的LLM。它取代了周围的小型分类器、重排序器和“这是否相关”调用。仓库包含任务构建器、运行器、评分器、我的原始逐条结果和完整表格。仅Python标准库。你可以通过一个参数插入任何OpenAI兼容模型作为另一个基线,以及完整结果:https://github.com/OmarMujahid/jev-decision-bench
相似文章
GPT 5.6 Sol 基准测试
GPT 5.6 Sol 在 AI 语言建模方面取得新的基准测试结果,展示了性能改进。
@reach_vb: GPT-5.6 Luna Max在DeepSWE v1.1测试中比Sonnet 5 Max高出13.3分,而Sonnet的成本是其44倍。DeepSWE测试co…
GPT-5.6 Luna Max在DeepSWE v1.1编码基准测试中以更低的成本优于Sonnet 5 Max,并且与Gemini 3.7 Flash Medium相比也表现出强劲性能。
@FinanceYF5: 1/ Jev + Mercury 2.5在WebMCP基准测试中近乎“突破”:所有49/49任务完成。模型成本约…
Jev + Mercury 2.5 AI模型在WebMCP基准测试上完成了所有任务,成本显著低于GPT-6 Astra变体。
GPT-5.6 Luna vs GPT-6 Astra:1.20美元模型是否足以胜任代码审查?
我们对GPT-5.6 Luna与GPT-6 Astra在50个真实PR上进行了基准测试,结果显示Astra发现92个漏洞,Luna发现69个,而Luna以仅3.6%的成本捕获了75%的漏洞。本次还包括详细的评估分解,以及即将与Fable 5.1的比较。
@jerryjliu0:我们对GPT-5.6在文档理解方面进行了全面基准测试。总体来说,GPT-5.6 Sol与GPT-5.5相比没有变化…
LlamaIndex对GPT-5.6在文档理解方面进行了基准测试,发现其相比GPT-5.5没有改进;该模型在文本和表格上表现良好,但在图表和布局方面仍有不足。