@Vtrivedy10: 有一个非常令人兴奋的未来智能体配方,用于构建低成本到无需计量的智能,应用于提取信…
摘要
该帖子概述了一个未来智能体配方,通过微调高效、专业化的开源模型,在LLM-as-a-judge任务上超越前沿性能,并将其应用于从追踪数据中提取信号以实现持续学习。LangChain Labs 和 FireworksAI 发布了展示这一方法的新工作。
查看缓存全文
缓存时间: 2026/06/16 19:39
有一个非常令人兴奋的未来代理配方,用于打造成本极低的智能,并将其应用于从每个代理产生的 Trace 数据中提取信号。
它包括:
-
微调高效、专门化的开源模型,使其在狭窄但重要的任务上达到前沿性能
-
大规模理解 Trace 数据,从而能够提取信号,以在长时间跨度内改进每个代理 —— 将持续学习视为一个数据挖掘问题
我们很高兴发布来自 LangChain Labs 的新成果,与 @FireworksAI_HQ 的杰出团队合作(特别感谢 @chahvivi 和那里的优秀团队)
我们发现,通过良好的数据设计 + SFT,构建者可以在 LLM-as-a-judge 任务上超越前沿性能,这些任务会读取每个代理产生的 Trace,并通过评分标准从中提取信号
如果你对此感兴趣,或者想要微调自己的评判模型以大规模处理每个 Trace,请联系我们
相似文章
@Vtrivedy10: https://x.com/Vtrivedy10/status/2066571435871551655
LangChain Labs与Fireworks AI联合研究表明,通过微调开源Qwen模型,可以创建一个能够检测生产轨迹中“感知错误”的轨迹判断器,且该模型在以最高降低100倍成本的同时达到前沿性能。该模型在两个内部数据集上进行了评估,并显示出跨应用的通用性。
@LangChain: 改进智能体 旧方法:手动读取追踪、寻找模式、编写评估、创建修复。更好的办法…
这条推文对比了改进AI智能体的旧手动方法与使用LangSmith Engine的新自动化方法,后者循环进行追踪、评估和修复。
@LangChain:在提升您的代理之路上
LangChain 宣布了一项用于改进 AI 代理的资源。
@songhan_mit: 我们开发了一种基于智能体的原生方法来加速生成式AI,延续了KDA(内核设计智能体)在更高层次上的成功…
Enze Xie 宣布推出 Sol Video Inference Engine,这是一个基于智能体的原生、无需训练的全栈加速器,用于视频扩散,能够自动调整缓存、稀疏注意力、令牌剪枝、量化和内核融合,在像 64B Cosmos3-Super 和 22B LTX-2.3 这样的大模型上实现了 >2 倍的端到端加速。
@levie:如果你曾经好奇为什么未来我们需要100倍的AI推理,以及它将由什么驱动,这…
本文讨论了Devin的新功能'Security Swarm',它使用Agentic MapReduce来扩展AI驱动的代码安全分析,说明了未来需要100倍AI推理的原因以及在各行业中战略部署多样化模型的重要性。