我为AI代理构建了一个本地优先的调试器——v0.3版本现已能找出好坏运行结果之间首次出现有证据支持的分歧点。
摘要
TraceMotive v0.3.0 是一款开源本地优先调试器,能够比较 AI 智能体的多次运行过程,并找出良好执行与异常执行之间首个有证据支撑的分歧点。
各位好!我刚发布了TraceMotive v0.3.0——一款开源的本地优先AI智能体执行调试器。我要解决的问题其实很简单:当你有两次智能体运行,一次成功,一次失败或行为异常。大多数追踪工具虽然能显示两次执行过程,但你仍需手动检查追踪记录,找出它们从何处开始出现行为差异。在v0.3版本中,TraceMotive可以对比两次运行,并基于结构证据识别出第一个有实际支撑的行为差异点。大致工作流程是:良好运行 vs 异常运行 → 确定性结构对齐 → 首个有支撑的行为差异 → 诊断发现 → 调查起点 → 补充观察/上下文/不确定性
一些典型发现示例:
- 工具输入发生改变
- 工具输出出现差异
- 检测到新错误
- 旧错误被解决
- 工具被新增/移除
- 执行子树结构变化
- 工具重复调用模式改变
- 模型/请求参数/追踪状态变化(作为上下文)
我们的重要设计目标之一是避免虚假确定性。TraceMotive不会声称首个差异点直接导致后续失败。如果重复工具调用无法安全对齐、内容被编辑、捕获数据不可用或追踪记录不完整,结果会明确显示为“不确定”。所有功能仍保持本地优先原则:不收集任何遥测数据,收集器/界面仅限本地回环连接,捕获的数据被视为不可信信息。
现在还提供了一个无需API密钥的确定性演示模式:
```bash
pip install tracemotive==0.3.0
tracemotive serve
```
在另一个终端运行:
```bash
tracemotive demo
```
这会生成参考运行与修改运行,并自动打开调查视图。
我目前处于早期阶段,特别希望获得关于以下方面的反馈:
- 这套调查工作流是否真正实用
- 结构对齐过于保守的案例
- 你希望接下来支持哪些智能体框架
作为一名高中生,我在构建过程中大量借助AI编程工具,同时也在这个项目中学到很多。很乐意听到哪里出问题了!
相似文章
在指出v0.1最大问题后,我重建了本地AI代理调试器
TraceMotive v0.2.0,一个本地AI代理调试工具,已经发布,带来了持久化存储、一键启动和跟踪比较功能等改进,解决了初始版本的反馈。
我厌倦了手动调试追踪
一位开发者构建了一个AI代理调试工具,通过比较重放与参考运行来识别行为首次偏离的位置,表达了对手动追踪调试的挫败感。
@benhylak:我们构建了第一个本地调试智能体的合理方法。你可以查看你的追踪记录。codex/claude code 也可以。这允许……
一个新的开源工具可以通过查看追踪记录实现AI智能体的本地调试,允许使用codex和Claude code等工具自动编写评估并进行测试。
厌倦了用W&B和Langfuse调试AI代理,所以我自建了一个追踪器,寻求反馈
构建了一个新的追踪器用于调试AI代理,它能自动检测循环、将会话记录为可读时间线,并支持并排对比。寻求反馈。
为什么我的 AI 智能体检索到了错误的记忆?为此我构建了一个调试器
作者构建了 Agent DevTools,这是一个用于 AI 智能体的本地调试器,可检查提示词、记忆、检索和工具调用,支持 LangChain,并提供了一个免费的 Groq 演示。