我开源了一个完整的代理可观测性堆栈:记录 -> 检查 -> 差异 -> 行动(全部MIT)

Reddit r/AI_Agents 工具

摘要

本文介绍了一个开源的代理可观测性堆栈,包含四个MIT许可的仓库,专注于提取和检查模型信念,以提升AI代理的调试和性能。

你的代理每次都用简单语言告诉你它为什么失败。但然后它被忽略了 - 因为‘可观测性’意味着读取追踪,而追踪只显示它做了什么,而不是它在做时相信什么。我反其道而行:直接从模型自己的流式输出中读取信念,并保持一切自托管和开源。这个堆栈(四个MIT仓库):Axion - 中间件,将模型的流式输出分流并提取信念(假设/意图/规划)作为结构化事件。零额外延迟,无需更改代理代码。实际测试输出:‘我相信用户想要X’ -> [意图] 置信度 0.80。包括PII脱敏和一个Webhook通道(axion.belief_batch.v1),将信念元数据馈送到Langfuse/Arize/Braintrust span中。VisReplay - 将完整会话(思考、工具调用、错误)记录到版本化文件中,你可以逐帧重放。VisCompile - 代理运行之间的确定性行为差异。字节精确。在CI中控制回归(回归时退出码2,在管道中工作)。VisBoard - 共享代理/人类工作区:看板、具有ETag语义的版本化注释、范围化的代理令牌工作流、实时SSE事件、集成同步链接。我在发布前本周实时验证了每一个:带脱敏的SSE信念流、字节确定性快照、完整的看板CRUD + 代理认证语义针对真实Postgres。诚实差距:信念提取基于模式(正则表达式 + 子句规则),确定性和免费设计 - 模式是开源的,所以你可以扩展它们。仅自托管,尚无托管层。VisBoard自动化仅支持Webhook/通知动作。
查看原文

相似文章

我开源了用于让AI代理保持在正轨上的指令。

Reddit r/ArtificialInteligence

这个开源工具为编码代理提供了一个可移植且与代理无关的控制平面,通过一组可放入任何代码仓库的文件,提供一致的操作规则、分阶段项目规划、记忆、技能和运行手册。