DIY Jev
摘要
作者分享了一个类似DIY Jev的推理设置,使用开源权重大语言模型,展示了通过简单的提示和基于logit的验证,在没有微调的情况下实现了良好的准确性,并提供了一个用于本地部署的Rust Web服务器。
所以这个Jev的东西变得有点大了... 说实话,它似乎被过度吹捧了,但事实就是这样。并不是说它不好,只是感觉我们通常忽略了更大的事情... 无论如何,回到本文的重点:我一直在尝试使用普通的开源权重大语言模型来搭建一个简单的类似Jev的推理设置。我之前用大语言模型做过类似Jev的东西,我从不觉得我们需要为此单独使用“系统一模型”,因为大语言模型就能很好地完成。所以我稍微尝试了一下。与OpenJev的主要区别是没有自然语言推理微调或分类器头。对于每个候选答案,我将问题转化为布尔验证:<state>...</state> <question>...</question> <options>...</options> <candidate>B</candidate> 然后,不是生成任何内容,我分别读取每个候选答案的真/假logits,为每个候选答案进行减法,并对这些分数进行softmax处理。所以3个候选答案就是3个差值,然后对它们进行softmax。昂贵的状态/问题/选项前缀只需评估一次,然后候选分支(仅最后几个标记不同)通过llama.cpp进行批处理。在一个32,235个示例的基准测试中:Qwen3-4B 65.0% 准确率 ~27 请求/秒 Qwen3 27B 75.3% ~2.9 请求/秒 Qwen3.6 35B-A3B 75.5% ~5.3 请求/秒 这个请求/秒是在一台5090 24GB的笔记本电脑上测量的。有趣的部分是,这种方法在完全未修改的模型上效果出奇地好。事实证明,相同的模型可以超越OpenJev的微调版本。不声称这重现了Jev或基准测试是完全可比的,主要感兴趣的是在不进行任何训练、仅通过有效调整提示的情况下能走多远。仓库:DIY-Jev GH 查看一下,提供反馈并构建酷炫的东西 :) 编辑:我忘了说哈哈 该仓库是一个Rust Web服务器,具有Jev兼容的API,你可以以Jev的方式从HF运行本地ggufs。包括几个模型的基准测试。
相似文章
OpenJev
OpenJev是一款基于浏览器的工具,允许用户在本地运行AI模型,并比较不同的推理方法,例如直接读取logits与在JSON格式中生成tokens的对比。
@dair_ai: Jev 新手指南。此外,我们还为您构建了 Jev Playground,以测试多种使用场景。
这篇文章向初学者介绍 Jev,并提供 Jev Playground 来测试其多种用途。
体验Jev——一种有趣的AI代理方法
作者讨论了尝试使用Jev,这是一种专注于决策的AI代理工具,与使用大型语言模型处理所有任务相比,它声称在速度和成本上有显著优势。
@NFT_Chen: 太棒了!立即通过本地化决策引擎将任何LLM转换为Jev模型!LLM2Jev带来Jev的统一Ch…
LLM2Jev是一个开源工具,它将本地HuggingFace模型适配为使用Choice、Score和Noul框架执行结构化决策,提供仅预填充推理,并与Transformers和SGLang集成。
@omarsar0: 我为Jev找到的最疯狂用例之一:验证器。我对此非常兴奋,至少想分享一下……
作者分享了Jev在构建AI代理框架自定义验证器的新用例,通过结合System One和System Two模型实现可扩展的测试时计算。