@omarsar0:一直在将Jev集成到我的自定义工具中。我对看到的结果感到无比兴奋。大多数演示……

X AI KOLs Timeline 模型

摘要

Omar Saroof分享了将Jev集成到自定义工具中的兴奋之情,强调了它实现更快、更便宜、更可靠的AI工作流和代理体验的潜力。

一直在将Jev集成到我的自定义工具中。 我对看到的结果感到无比兴奋。 我时间线上的大多数演示都很花哨但非常基础。注意它们都是关于一些之前已经可能实现的无聊分类任务。 我明白。Jev又快又便宜。这一点已经证明了。 但Jev能解锁什么新东西呢? 我更感兴趣的是:Jev如何进化代理工具体验? 为了认真探索这一点,我们首先需要将Jev视为一个关键的基本要素,未来会有更多这样的要素。 我们必须思考它如何补充当今的测试时计算策略。它不是在竞争;它是在加速并允许更有趣的扩展策略。 Jev开始在我的自定义工具中解锁许多疯狂而有趣的体验。这些功能要么成本过高,要么缺乏合适的基本要素,要么由于延迟限制而不可行。 经过一些探索(很快会分享更多细节),以下是一些真正让我兴奋的事情: - Jev实现了更便宜、更快的工作流(显而易见),这可以帮助我们更好地扩展代理工具。如果你需要分类器、想改善控制流或需要更确定性的工作流,不要使用标准LLM;Jev可能更适合。Jev还非常适合大规模标注事物。 - Jev通过智能决策、动态工作流/即时生成工具的结构化智能以及新的上下文管理策略等组件提高了可靠性;我已经看到一些后者,关于按需呈现上下文的可能方式,如工具调用、技能元数据等。这里有很多可以分享的。 - Jev解锁了增强代理体验的新有趣方式(例如,动态UI、高效的LLM委员会、更智能的路由、实现更智能、高效的编排和规划,通过呈现更相关和及时的上下文,使代理更具决定性和实用性)。 - Jev感觉像是正确的基本要素,能够实现更可靠的评估策略,如LLM-as-a-Judge,并为代理工具构建强大的验证器。这是Jev可能解锁大量优势的两个领域。更不用说,我看到它在合成高质量数据以加速RSI方面的潜力,通过帮助模型和工具共同进化。 这周我旅行了(去Dreamforce),感觉非常疲惫,但一份完整的指南即将发布。
查看原文
查看缓存全文

缓存时间: 2026/09/19 21:11

我一直在将Jev集成到我的自定义agent harness中。

对目前看到的成果感到无比兴奋。

时间线上大多数演示虽然炫目,但非常基础——注意到它们都聚焦于那些早已能实现的乏味分类任务。

我明白。Jev快速且低成本,这一点已毋庸置疑。

但Jev究竟能解锁哪些新可能?

这才是我更感兴趣的:Jev如何演进agent harness体验?

要认真探索这个问题,我们首先需要将Jev视为一个关键基础构件——这只是众多即将涌现构件中的一个。

我们必须思考它如何与当前的测试时计算策略形成互补。这不是竞争关系,而是加速器,能推动更有趣的规模化策略。

Jev正在我的自定义harness中解锁许多令人震撼的全新体验。这些功能此前或是成本过高,或是缺乏合适的基础构件,亦或因延迟限制而无法实现。

经过初步探索(很快会分享更多细节),以下几点让我尤为兴奋:

  • Jev能实现更低成本与更高速的工作流(这是显而易见的),这将帮助我们更好地扩展agent harness。若你需要分类器、希望改进控制流程,或需要更确定性的工作流,不必使用标准LLM——Jev可能是更优选择。它也极其适合大规模标注任务。

  • Jev通过智能决策组件、为动态工作流/实时生成harness提供的结构化智能,以及新的上下文管理策略提升了可靠性。我已观察到后者的一些实践案例,比如按需呈现上下文(类似工具调用、技能元数据等)的潜在方式。这方面有太多值得分享的内容。

  • Jev解锁了增强agent体验的新颖有趣方式(例如动态界面、高效的LLM理事会、更智能的路由、实现更智能高效的编排与规划、更具决断力且通过呈现更相关及时的上下文来构建实用型主动代理)。

  • Jev恰似一个正确的核心构件,能支持更可靠的评估策略(如LLM-as-a-Judge),并为agent harness构建强大的验证器。这两个领域是Jev可能释放巨大潜力的方向。更不用说,它具备合成高质量数据以加速RSI(递归自我改进)的潜力,促进模型与harness的协同进化。

本周我差旅至Dreamforce大会,此刻虽疲惫不堪,但完整指南即将发布。

相似文章