@0xCodila:中国学生刚发现用JEV赋能任何LLM或AI代理的最佳方式——发布了PDF研究报告,转变:我粘贴…
摘要
中国学生发布了关于JEV的PDF研究报告,该方法将LLM评估成本降低63倍,并在44个基准测试中提高了准确性。
查看缓存全文
缓存时间: 2026/09/26 08:57
中国学生刚刚找到了将JEV用于任何LLM或AI智能体的最佳方法——发布了一份PDF研究报告
转变:我将它粘贴到Claude和GPT中——成本降低了约63倍
以下是他们在44个基准测试中的发现:
1 → 7,193个响应,10种故障类型。Jev测试了幻觉、提示注入、数据泄露和其他AI故障
2 → 一个简单问题就奏效了:0.886的中位AUROC,在无需特定任务训练的情况下,在31个基准测试中有25个超越了训练基线
3 → 上下文比巧妙提示更重要——给Jev提供源信息或规则,以便其核查答案
4 → 保留概率值,而非仅“是”或“否”——在10个标注样本上拟合阈值,使中位F1从0.706提升至0.793
5 → 在置信度最高的50%决策中,中位准确率达到0.933——将不确定案例交由二次审核
6 → Jev甚至帮助发现了三个基准测试中的标注错误。有时测试的“正确答案”才是问题所在
7 → 每次调用处理11.4个问题,中位延迟0.31秒——在19个基准测试中,核查成本仅0.30美元,而使用LLM法官需18.96美元——成本降低约63倍
结果:它将使你的配置比95%用户使用的方案更便宜、更高效
复制研究者在44个基准测试中验证的Jev配置——随后深入了解Jev完整架构↓
codila (@0xCodila): Jev是AI行业的“互联网时刻”
它能在毫秒级、近乎零成本下指导你的智能体和LLM下一步行动
正确配置后,你将掌握2028年的AI工程师技术栈
本文将为你详解配置方法
相似文章
@N01ennn: 哇塞 . Jev创始人 Diogo Almeida 刚刚发布了一份11页的PDF,详细描述了整个Jev + AI代理循环,这是一个9步蓝图…
Jev创始人 Diogo Almeida 发布了一份11页的PDF,概述了通过AI代理运行LLM以最小化成本的9步蓝图,重点强调了任务分割、基于置信度的行动和人工监督。
Jev 不是 LLM 杀手,也不仅仅是一个分类器。我们将其部署于生产环境并与真实用户一起使用。以下是我们学到的经验。
文章分享了使用 Jev(一个语义决策引擎)的生产见解,它通过与 LLMs 并行高效处理常规决策来增强 AI 代理系统,而不替代生成模型。
JEV-as-a-Judge: 自信时接受,不确定时上报
本文介绍了JEV-as-a-Judge,这是一种用于大型语言模型(LLMs)的经济高效评估方法,它使用一个仅基于决策的评判器,设置置信度阈值来接受确定的判定并上报不确定的判定,以显著更低的成本实现了与最先进模型相当的准确性。
@LangChain:我们对 Jev 与 LLM 裁判在准确性、可重复性、延迟和成本方面进行了测试,以查看 System One 模型是否能够……
本文评估了来自 TypeSafe AI 的 System One 模型 Jev 作为一个新的代理评估器,显示它在一致性、速度和成本方面优于 LLM 裁判。
@0xCodila: Jev是人工智能行业的'互联网时刻' 它能在毫秒级别告诉你代理和LLMs的下一步,以...的成本
Jev被呈现为一种变革性的AI工具,它能优化代理和LLMs的决策,显著降低成本并提高效率,并提供逐步设置路线图。