@0xCodila:中国学生刚发现用JEV赋能任何LLM或AI代理的最佳方式——发布了PDF研究报告,转变:我粘贴…

X AI KOLs Timeline 论文

摘要

中国学生发布了关于JEV的PDF研究报告,该方法将LLM评估成本降低63倍,并在44个基准测试中提高了准确性。

中国学生刚发现用JEV赋能任何LLM或AI代理的最佳方式——发布了PDF研究报告 转变:我将其粘贴到Claude和GPT中——并将成本降低了约63倍 以下是他们在44个基准测试中发现的结果: 1 → 7,193个回复,10种故障类型。Jev在幻觉、提示注入、数据泄露和其他AI故障上进行了测试 2 → 一个简单问题奏效了:中位AUROC为0.886,在31个基准测试中的25个上击败了训练过的基线,无需任务特定训练 3 → 上下文击败了巧妙的提示——给Jev它需要用来核对答案的源或规则 4 → 保留概率,而不仅仅是"是"或"否"——在10个标记样本上拟合阈值,将中位F1从0.706提高到0.793 5 → 在50%最自信的决策中,中位准确率达到0.933——将不确定案例发送进行再次审查 6 → Jev甚至帮助揭示了三个基准测试中的标注错误。有时测试的"正确答案"才是问题所在 7 → 每次调用11.4个问题,中位延迟0.31秒——在19个基准测试中,检查成本为0.30美元,而使用LLM法官为18.96美元——大约便宜63倍 结果是:它将使您的设置比95%的人运行的更便宜和更快 复制研究人员在44个基准测试中测试的Jev设置——然后阅读完整的Jev架构 ↓
查看原文
查看缓存全文

缓存时间: 2026/09/26 08:57

中国学生刚刚找到了将JEV用于任何LLM或AI智能体的最佳方法——发布了一份PDF研究报告

转变:我将它粘贴到Claude和GPT中——成本降低了约63倍

以下是他们在44个基准测试中的发现:

1 → 7,193个响应,10种故障类型。Jev测试了幻觉、提示注入、数据泄露和其他AI故障

2 → 一个简单问题就奏效了:0.886的中位AUROC,在无需特定任务训练的情况下,在31个基准测试中有25个超越了训练基线

3 → 上下文比巧妙提示更重要——给Jev提供源信息或规则,以便其核查答案

4 → 保留概率值,而非仅“是”或“否”——在10个标注样本上拟合阈值,使中位F1从0.706提升至0.793

5 → 在置信度最高的50%决策中,中位准确率达到0.933——将不确定案例交由二次审核

6 → Jev甚至帮助发现了三个基准测试中的标注错误。有时测试的“正确答案”才是问题所在

7 → 每次调用处理11.4个问题,中位延迟0.31秒——在19个基准测试中,核查成本仅0.30美元,而使用LLM法官需18.96美元——成本降低约63倍

结果:它将使你的配置比95%用户使用的方案更便宜、更高效

复制研究者在44个基准测试中验证的Jev配置——随后深入了解Jev完整架构↓

codila (@0xCodila): Jev是AI行业的“互联网时刻”

它能在毫秒级、近乎零成本下指导你的智能体和LLM下一步行动

正确配置后,你将掌握2028年的AI工程师技术栈

本文将为你详解配置方法

相似文章

JEV-as-a-Judge: 自信时接受,不确定时上报

Hugging Face Daily Papers

本文介绍了JEV-as-a-Judge,这是一种用于大型语言模型(LLMs)的经济高效评估方法,它使用一个仅基于决策的评判器,设置置信度阈值来接受确定的判定并上报不确定的判定,以显著更低的成本实现了与最先进模型相当的准确性。