@akshay_pachaar: Karpathy 的 Agentic Engineering 终于有了合适的开发工具!当代理停止工作时,模型只是可能的原因之一…
摘要
CopilotKit Inspector 是一个面向 AI 代理的开源调试工具,它监控交互、帮助重现故障,并使用 AG-UI 协议将洞察转化为代理改进。
查看缓存全文
缓存时间: 2026/09/11 16:43
Karpathy的智能体工程终于有了专业的开发者工具!当一个智能体停止工作时,模型只是可能的原因之一。问题可能出在失败的工具、丢失的连接、未生效的接口更新,或是对话中更早的某个环节。@CopilotKit 围绕这一问题重新构建了其开源的 Inspector 工具。它嵌入在应用程序内部,监控用户、界面与智能体之间的完整交互。当出现故障时,Inspector 按钮会变红,标明故障名称,并直接定位到发生问题的环节。
但一个更难的问题是复现该故障。这是因为智能体并不总是遵循相同的路径执行。再次运行相同的提示词可能触发不同的工具、产生不同的响应,或者从不同的应用状态开始。Inspector 通过保存的对话线程(Threads)和一个隔离的智能体演练场(Agent Playground)来处理此问题。开发者可以打开出现问题的对话,选择“从此处尝试”,并将到该点为止的所有内容复制到演练场中。原始对话保持不变,同时可以测试另一条响应或工具路径。
线程可以在实时应用中打开,而助手消息可以跳转回其在 Inspector 中对应的上下文。所有这些都在 AG-UI 协议之下运行,该协议负责在智能体和界面之间传递消息、工具活动、状态变化和其他事件。这些交互还可以输入到 CopilotKit Intelligence 中,这样当相同的问题或有用的行为反复出现时,它可以成为一个有证据支持的“洞察”和一个提议的“技能(SKILL).md”文件。开发者可以在智能体继承该技能之前进行审核、编辑和批准。
该工具还能帮助开发者发现问题、重建其上下文、测试另一条路径,并将反复出现的经验教训转化为智能体的改进。它是开源的,包含在 CopilotKit 的开发构建版本中。Intelligence 的设置只需一个提示即可开始。文档在此:https://docs.copilotkit.ai/inspector
我正在对此进行大量测试,并将很快通过一个实践演示更详细地介绍此内容。
Inspector
来源: https://docs.copilotkit.ai/inspector
功能展示
CopilotKit Inspector 是一个内置的调试工具,覆盖在您的应用之上。首次打开会显示主页。后续打开将返回到您上次使用的面板。
| 功能 | 描述 |
|---|---|
| 主页 | 项目、运行时、服务以及 CopilotKit 新闻。 |
| 线程 | 检查真实的线程及其消息、AG-UI 事件和状态。 |
| 记忆 | 当 Intelligence 公开时,检查长期记忆。 |
| AG-UI 事件 | 实时查看前端和智能体之间的原始 AG-UI 事件流。 |
| 可用智能体 | 查看哪些智能体已连接并对您的应用可用。 |
| 智能体状态 | 在更新时检查您的智能体的当前状态。 |
| 前端工具 | 查看您在前端定义的工具及其参数模式。 |
| 上下文 | 查看您提供给智能体的上下文,包括可读对象(readables)和文档上下文。 |
| 项目上下文 | 当运行时提供时,查看受信任的组织、项目、计划、线程使用情况、有效期以及许可证相关的操作。 |
导航和线程
侧边栏包含三组:主页、工作台(线程、记忆)和检查(智能体、AG-UI 事件、前端工具、上下文)。能力仅在存在 A2UI 目录时显示。与工程师交谈位于侧边栏页脚。
当 Intelligence 已连接时,主页会在“发生了什么”右侧显示一个小型的“Intelligence 已连接”标签。
打开一个真实线程以检查其消息、AG-UI 事件和状态。元数据更新不会更改所选线程。
当线程没有真实行,或者线程被锁定时,Inspector 会保留概览视频、三个本地示例线程、它们的详情标签页以及引导式教程。示例不会发送真实的线程请求。启用减少动画后,视频将从暂停开始,并带有标记的播放控件。如果媒体加载失败,会在示例、详情和教程保持可用的同时显示回退文本。
项目上下文与使用情况
一个由 Intelligence 支持的运行时可以提供可选的受信任的项目元数据。有效的组织和项目名称以及计划标签会显示在账户条带中。每个模块都是独立的,因此缺失或无效的身份数据不会隐藏有效的使用或操作数据。
受信任的线程使用情况和兼容的提供操作仅在线程页脚中显示。它们独立渲染:使用情况可以在没有身份、计划、许可证或操作元数据的情况下出现,而仅操作元数据不会凭空发明使用情况。
| 使用状态 | Inspector 行为 |
|---|---|
| 有限 | 显示 已使用 / 限制 线程 和一个原生进度条。超额时显示 限制+ / 限制 线程 并将进度条上限设为 100%。 |
| 无限制 | 显示受信任的已使用计数,带无限制标签,无进度条。 |
| 未知限制 | 显示受信任的已使用计数,带限制不可用标签,但不发明数字限制或进度。 |
| 已知有效期计数 | 显示计数,包括 0 个即将过期。 |
| 缺失或格式错误的有效期 | 隐藏有效期值,但不隐藏有效的基本使用量。 |
“即将过期”描述的是未来24小时内保留策略的阈值。它并不能证明线程清理程序已运行,或 Inspector 已锁定或删除了线程。
当线程被锁定时,运行时的许可证状态控制文本和任何操作:
| 许可证状态 | Inspector 行为 |
|---|---|
| 活动 | 解释运行时没有线程端点,不显示锁定操作。 |
| 未启用 | 仅针对匹配的受信任操作显示 启用 Intelligence。 |
| 已过期 | 仅针对匹配的受信任操作显示 续订 或 管理您的计划。 |
| 未知 | 显示中性的不可用文本,无操作。 |
一个有效的受管理页脚可以针对匹配的受信任操作显示管理您的计划。受管理的企业版没有管理计划操作,团队自托管版没有托管操作;两者都可以保持有效的使用量可见。
Inspector 打开运行时提供的精确受信任 URL。它不会从项目详细信息构建 URL,也没有硬编码的注册回退。如果元数据许可证状态与运行时的许可证状态冲突,则以运行时状态为准控制文本,Inspector 在不隐藏有效使用量的情况下隐藏操作。
旧的运行时、核心和 Inspector 版本无需同步部署即可保持兼容。旧的 V1 生产者会让 usage.expiringSoonCount 不存在,而过期前的共享和运行时版本会忽略或移除来自新生产者的附加叶子节点。旧的 Inspector 会忽略它不渲染的元数据;新的 Inspector 会检测旧的核心和运行时支持,并使用安全的元数据缺失回退。在任何混合配置中,显式的 threadEndpoints 始终是权威,元数据永远不会启用线程工作。
显示或隐藏 Inspector
默认情况下,Inspector 仅在 localhost、127.0.0.1 和 0.0.0.0 上显示。将 enableInspector 设置为 false 可在这些主机上隐藏它:
{children}
将 enableInspector 设置为 true 可在其他主机上(包括生产构建中)显示它。CopilotKit 始终使用显式的 true 或 false 值。
NEXT_PUBLIC_COPILOTKIT_LICENSE_KEY 是一个浏览器可见的可发布密钥,与服务器端的 CPK_INTELLIGENCE_API_KEY 是不同的凭据,后者由 copilotkit project select 写入您的 .env 文件。服务器端密钥由 运行时端点 中描述的 CopilotKitIntelligence 客户端使用。不要将两者互换,切勿将服务器端密钥暴露给浏览器。
相似文章
@akshay_pachaar: Karpathy的Agentic Engineering终于有了合适的工具!(由谷歌打造)Karpathy将Agentic Engineering定义为……
谷歌推出了Agents CLI,这是一个统一的命令行工具,集成了在Google Cloud上对代理进行搭建、评估和部署的功能,使编码助手能够在不切换上下文的情况下实践Agentic Engineering。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2064051835636498924
Opik 是一个用于AI代理可观测性的开源平台,它不仅限于追踪,还能自动诊断故障、提出修复方案并进行验证,从而在没有人工干预的情况下关闭调试循环。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2070860837448040832
Google的Agents CLI提供了一个统一的工具,用于搭建、评估和部署AI代理,解决了代理工程中工作流程碎片化的问题。文章演示了如何使用该CLI构建RAG代理,展示了其与编码代理和ADK模式的集成。
@akshay_pachaar: Karpathy 说过一句你以后会后悔没在意的话:“你仍然要对你的软件负责,跟以前一样。你 n…
详细演示了如何使用 Google 的 Agents CLI 评估技能来检测和修复 RAG 代理中的“vibe coding”漏洞,并通过一个真实示例说明 Claude Code 如何帮助创建自定义评分标准,并将测试分数从 19/33 提高到 30/33。
@akshay_pachaar:关于循环工程。这周大家都在说同一件事。你不再提示代理,而是设计循环来提示它们……
这篇文章讨论了AI代理的循环工程,并介绍了Opik——一个来自Comet ML的开源工具,用于生成式AI应用的调试、评估和优化,重点在于自动化失败处理以及根据真实失败构建回归测试。