我构建了一种方法,让 Claude Code/Codex/Hermes 能够验证自身的工作,而不仅仅是说“完成”

Reddit r/AI_Agents 工具

摘要

Iris 是一个 MCP 服务器,运行在你的真实应用中,通过检查条件并返回通过/失败判定及证据来验证 AI 代理(例如 Claude Code、Codex、Hermes)的工作,与基于快照的方法相比,减少了误报和令牌使用。

Claude Code 在我的支付端点返回了 401。然后它说“完成”。我三天后才知道。于是我构建了 Iris:一个运行在你真实应用中的 MCP 服务器,它为你的 AI 代理提供判定(通过/失败 + 证据),而不是需要它自行解读的快照。工作原理:你的代理调用 iris_assert() 并传入条件(网络 200 + 控制台干净 + 信号触发)。Iris 检查实际运行的应用并返回 { pass: false, evidence: [...] } — 哪些项失败、实际值是什么、以及需要修复的文件:行号。诚实的令牌基准测试:在常见循环中,比完整树快照少 73 倍(约 100 vs 约 6,856)。完整树 vs 完整树:仅约 1.8 倍。我没有隐藏这个数字。提前回应热门评论:这不是 Playwright MCP。Playwright 驱动一个独立的浏览器并将快照交给代理——代理仍然需要猜测。Iris 运行在你的真实应用内并返回判定。两者都可以使用。MIT 许可,仅开发环境,仅 localhost。`npm i -D @syrin/iris` 很乐意在评论区回答所有问题。
查看原文

相似文章

@PrajwalTomar_: https://x.com/PrajwalTomar_/status/2064324584254710262

X AI KOLs Following

Nous Research 的 Hermes Agent 是一款开源自主 AI 代理,它在服务器上持续运行,跨会话记住每一次对话,并自主创建技能文件,使其与 Claude Code 和 Cursor 等基于会话的编码工具截然不同,属于一个根本不同的代理类别。