我为AI代理构建了一个本地优先的调试器——v0.3版本现已能找出好坏运行结果之间首次出现有证据支持的分歧点。

Reddit r/AI_Agents 工具

摘要

TraceMotive v0.3.0 是一款开源本地优先调试器,能够比较 AI 智能体的多次运行过程,并找出良好执行与异常执行之间首个有证据支撑的分歧点。

各位好!我刚发布了TraceMotive v0.3.0——一款开源的本地优先AI智能体执行调试器。我要解决的问题其实很简单:当你有两次智能体运行,一次成功,一次失败或行为异常。大多数追踪工具虽然能显示两次执行过程,但你仍需手动检查追踪记录,找出它们从何处开始出现行为差异。在v0.3版本中,TraceMotive可以对比两次运行,并基于结构证据识别出第一个有实际支撑的行为差异点。大致工作流程是:良好运行 vs 异常运行 → 确定性结构对齐 → 首个有支撑的行为差异 → 诊断发现 → 调查起点 → 补充观察/上下文/不确定性 一些典型发现示例: - 工具输入发生改变 - 工具输出出现差异 - 检测到新错误 - 旧错误被解决 - 工具被新增/移除 - 执行子树结构变化 - 工具重复调用模式改变 - 模型/请求参数/追踪状态变化(作为上下文) 我们的重要设计目标之一是避免虚假确定性。TraceMotive不会声称首个差异点直接导致后续失败。如果重复工具调用无法安全对齐、内容被编辑、捕获数据不可用或追踪记录不完整,结果会明确显示为“不确定”。所有功能仍保持本地优先原则:不收集任何遥测数据,收集器/界面仅限本地回环连接,捕获的数据被视为不可信信息。 现在还提供了一个无需API密钥的确定性演示模式: ```bash pip install tracemotive==0.3.0 tracemotive serve ``` 在另一个终端运行: ```bash tracemotive demo ``` 这会生成参考运行与修改运行,并自动打开调查视图。 我目前处于早期阶段,特别希望获得关于以下方面的反馈: - 这套调查工作流是否真正实用 - 结构对齐过于保守的案例 - 你希望接下来支持哪些智能体框架 作为一名高中生,我在构建过程中大量借助AI编程工具,同时也在这个项目中学到很多。很乐意听到哪里出问题了!
查看原文

相似文章

我厌倦了手动调试追踪

Reddit r/AI_Agents

一位开发者构建了一个AI代理调试工具,通过比较重放与参考运行来识别行为首次偏离的位置,表达了对手动追踪调试的挫败感。