在指出v0.1最大问题后,我重建了本地AI代理调试器
摘要
TraceMotive v0.2.0,一个本地AI代理调试工具,已经发布,带来了持久化存储、一键启动和跟踪比较功能等改进,解决了初始版本的反馈。
几天前,我发布了TraceMotive,一个本地优先的跟踪/调试工具,用于AI代理执行。第一个版本可以工作,但反馈相当明确:
- 跟踪在重启后消失
- 设置需要多个终端
- 用户需要Node/npm来运行UI
- 它的行为更像是一个跟踪查看器,而不是调试器
因此,我将这些反馈作为v0.2.0的开发范围。新版本增加了:
- 持久化的本地SQLite存储
- `tracemotive serve` 实现一键启动
- 一个打包的生产环境UI,无需Node/npm运行时
- 跟踪到跟踪的比较
- 仅更改过滤
- 并排字段差异
- 明确的模糊/不可用状态,而不是猜测重复的工具调用配对
在测试比较时,我发现朴素的顺序匹配在插入/删除/重排后可以自信地配对错误的重复工具调用。我最终将这些组视为模糊的,而不是假装配对是精确的。我现在主要寻找真实的失败案例。如果您处理代理跟踪,什么会阻止您使用类似的东西?
相似文章
厌倦了用W&B和Langfuse调试AI代理,所以我自建了一个追踪器,寻求反馈
构建了一个新的追踪器用于调试AI代理,它能自动检测循环、将会话记录为可读时间线,并支持并排对比。寻求反馈。
我厌倦了手动调试追踪
一位开发者构建了一个AI代理调试工具,通过比较重放与参考运行来识别行为首次偏离的位置,表达了对手动追踪调试的挫败感。
@benhylak:我们构建了第一个本地调试智能体的合理方法。你可以查看你的追踪记录。codex/claude code 也可以。这允许……
一个新的开源工具可以通过查看追踪记录实现AI智能体的本地调试,允许使用codex和Claude code等工具自动编写评估并进行测试。
为什么我的 AI 智能体检索到了错误的记忆?为此我构建了一个调试器
作者构建了 Agent DevTools,这是一个用于 AI 智能体的本地调试器,可检查提示词、记忆、检索和工具调用,支持 LangChain,并提供了一个免费的 Groq 演示。
@JiaZhihao: 推出 Motus Tracing:AI 代理的开源可观测性。没有追踪,代理就是消耗 token 的黑盒……
Motus Tracing 是一个完全开源的可观测层,专为 AI 代理设计,能够捕获每一次模型调用、工具调用、沙箱交互和错误,提供统一的跨度模型,支持本地开发和云部署,零设置成本。