我开源了一个完整的代理可观测性堆栈:记录 -> 检查 -> 差异 -> 行动(全部MIT)
摘要
本文介绍了一个开源的代理可观测性堆栈,包含四个MIT许可的仓库,专注于提取和检查模型信念,以提升AI代理的调试和性能。
你的代理每次都用简单语言告诉你它为什么失败。但然后它被忽略了 - 因为‘可观测性’意味着读取追踪,而追踪只显示它做了什么,而不是它在做时相信什么。我反其道而行:直接从模型自己的流式输出中读取信念,并保持一切自托管和开源。这个堆栈(四个MIT仓库):Axion - 中间件,将模型的流式输出分流并提取信念(假设/意图/规划)作为结构化事件。零额外延迟,无需更改代理代码。实际测试输出:‘我相信用户想要X’ -> [意图] 置信度 0.80。包括PII脱敏和一个Webhook通道(axion.belief_batch.v1),将信念元数据馈送到Langfuse/Arize/Braintrust span中。VisReplay - 将完整会话(思考、工具调用、错误)记录到版本化文件中,你可以逐帧重放。VisCompile - 代理运行之间的确定性行为差异。字节精确。在CI中控制回归(回归时退出码2,在管道中工作)。VisBoard - 共享代理/人类工作区:看板、具有ETag语义的版本化注释、范围化的代理令牌工作流、实时SSE事件、集成同步链接。我在发布前本周实时验证了每一个:带脱敏的SSE信念流、字节确定性快照、完整的看板CRUD + 代理认证语义针对真实Postgres。诚实差距:信念提取基于模式(正则表达式 + 子句规则),确定性和免费设计 - 模式是开源的,所以你可以扩展它们。仅自托管,尚无托管层。VisBoard自动化仅支持Webhook/通知动作。
相似文章
我开源了用于让AI代理保持在正轨上的指令。
这个开源工具为编码代理提供了一个可移植且与代理无关的控制平面,通过一组可放入任何代码仓库的文件,提供一致的操作规则、分阶段项目规划、记忆、技能和运行手册。
我开源了一个 AI 智能体的执行记录工具(意图与现实)
作者宣布开源 Sentience Governor,一个面向 AI 智能体的开源治理运行时,它将声明的意图、记录的执行和事后的解释分离开来,并通过 MCP 将观察到的工具活动与声明的范围进行核对。
分享一种面向AI代理的不同研究架构,用以检查并解决运行自主代理时的已知瓶颈。欢迎反馈?
介绍了一种面向AI代理的新研究架构,其核心是一个透明运行时,每次交互都会成为可重放的执行轨迹,具有完全可检查性,包括规划、执行、观察、验证和记忆阶段。
我们对AI栈的每一层都有可观测性,唯独缺少决定智能体信念的那一层
文章批评了AI智能体记忆层缺乏可观测性,该层决定了智能体的信念,并质疑为何在系统其他可观测性取得进展的情况下,这一层仍是一个黑箱。
@JiaZhihao: 推出 Motus Tracing:AI 代理的开源可观测性。没有追踪,代理就是消耗 token 的黑盒……
Motus Tracing 是一个完全开源的可观测层,专为 AI 代理设计,能够捕获每一次模型调用、工具调用、沙箱交互和错误,提供统一的跨度模型,支持本地开发和云部署,零设置成本。