@lotte_verheyden: 如果你想改进你的智能体,追踪质量非常重要。这是我们应用内智能体追踪的一个例子…
摘要
这条推文讨论了通过显示顺序的LLM和工具调用而非嵌套它们来提高追踪质量,如何使调试和增强AI智能体更容易。
如果你想改进你的智能体,追踪质量非常重要。
这是我们应用内智能体追踪的一个例子:我们过去将所有工具调用嵌套在单个LLM调用下,所以你只能看到初始输入和最终输出。现在我们顺序显示LLM调用和工具调用,包括每个中间的LLM调用。
因此,我们可以立即看到某个工具调用是否撑爆了上下文窗口、某个特定步骤是否耗时过长等。这样调试和改进我们的智能体就容易多了。
查看缓存全文
缓存时间: 2026/09/10 04:12
追踪质量对优化你的智能体至关重要。
以我们内部应用的智能体追踪记录为例:过去我们将所有工具调用嵌套在单一LLM调用下,因此只能看到初始输入和最终输出。如今我们会按顺序展示LLM调用和工具调用,包括每一次中间LLM调用过程。
由此我们能立即发现:某个工具调用是否撑爆了上下文窗口、特定步骤耗时是否过长等问题。这极大简化了调试和优化智能体的过程。
相似文章
昨天发帖讨论了智能体调试的恶性循环。回复教会我的比帖子本身更多。
一位开发者反思社区在调试AI智能体方面的见解,强调通过记录工具调用和结构化输出验证器等技术实现系统可靠性。
@AiCamila_: 智能体可观测性最佳实践:指标、日志与追踪——你无法改进你看不见的东西。智能体可观测…
这条推文分享了智能体可观测性的最佳实践,涵盖指标、日志和追踪,用于调试和优化生产环境中的AI智能体。
我厌倦了手动调试追踪
一位开发者构建了一个AI代理调试工具,通过比较重放与参考运行来识别行为首次偏离的位置,表达了对手动追踪调试的挫败感。
@benhylak:我们构建了第一个本地调试智能体的合理方法。你可以查看你的追踪记录。codex/claude code 也可以。这允许……
一个新的开源工具可以通过查看追踪记录实现AI智能体的本地调试,允许使用codex和Claude code等工具自动编写评估并进行测试。
@yoheinakajima:与 @agnostai 一起充分利用您的代理跟踪信息
Agnost AI 推出了其首个模型 agnost-*******-0.1,该模型基于客户的生产跟踪数据训练,在任务成功率上提升了 22.9%,并在某些指标上减少了 90.2%。