我构建了一种方法,让 Claude Code/Codex/Hermes 能够验证自身的工作,而不仅仅是说“完成”
摘要
Iris 是一个 MCP 服务器,运行在你的真实应用中,通过检查条件并返回通过/失败判定及证据来验证 AI 代理(例如 Claude Code、Codex、Hermes)的工作,与基于快照的方法相比,减少了误报和令牌使用。
Claude Code 在我的支付端点返回了 401。然后它说“完成”。我三天后才知道。于是我构建了 Iris:一个运行在你真实应用中的 MCP 服务器,它为你的 AI 代理提供判定(通过/失败 + 证据),而不是需要它自行解读的快照。工作原理:你的代理调用 iris_assert() 并传入条件(网络 200 + 控制台干净 + 信号触发)。Iris 检查实际运行的应用并返回 { pass: false, evidence: [...] } — 哪些项失败、实际值是什么、以及需要修复的文件:行号。诚实的令牌基准测试:在常见循环中,比完整树快照少 73 倍(约 100 vs 约 6,856)。完整树 vs 完整树:仅约 1.8 倍。我没有隐藏这个数字。提前回应热门评论:这不是 Playwright MCP。Playwright 驱动一个独立的浏览器并将快照交给代理——代理仍然需要猜测。Iris 运行在你的真实应用内并返回判定。两者都可以使用。MIT 许可,仅开发环境,仅 localhost。`npm i -D @syrin/iris` 很乐意在评论区回答所有问题。
相似文章
@ScottyBeamIO: https://x.com/ScottyBeamIO/status/2066885278451519590
Hermes Agent 是一个云端AI代理,持续运行并通过消息交互。它具有自我改进循环,从对话中提取模式以增强记忆和技能,并且拥有简化的设置和灵活的模型路由。
@zeroxkyle: 我最近在使用 Claude Code 一年多之后安装了 Hermes。在工作中试用过,没觉得有必要个人部署……
一位用户分享了从 Claude Code 转向 Hermes AI 的积极体验,称赞该智能体具备学习能力、能处理长时间任务,并显著提升了生产力。
@dr_cintas: 现在你可以给 Hermes、Claude Code 和 Codex 无限记忆,它叫做 agentmemory。记录你的代理所做的…
Agentmemory 是一个免费、开源的工具,它赋予 Hermes、Claude Code 和 Codex 等 AI 代理无限记忆能力,通过记录会话活动、用 AI 压缩,并将相关上下文注入到未来会话中。它在 GitHub 上已有超过 4000 个星标。
@PrajwalTomar_: https://x.com/PrajwalTomar_/status/2064324584254710262
Nous Research 的 Hermes Agent 是一款开源自主 AI 代理,它在服务器上持续运行,跨会话记住每一次对话,并自主创建技能文件,使其与 Claude Code 和 Cursor 等基于会话的编码工具截然不同,属于一个根本不同的代理类别。
我停止打造一家AI优先的公司。正确的Hermes设置应该是什么样子
作者分享了从二元(AI能或不能)方法转向三层体系(手动、带审查的自主、全自主)来构建AI代理的经验,使用Hermes搭配DeepSeek V4 Flash作为编排器,Claude Code作为执行器,并引入看板板和确定性脚本以确保可靠性。