在代理运行时被管理的情况下,什么应该保持可检查?
摘要
OpenAI 的 Agents API 引入了管理的代理运行时,提出了哪些工件应保持可检查的问题,以确保此类系统的可重复性和信任。
OpenAI 最近在公开测试版中宣布了 Agents API:开发者指定任务、模型、工具和环境,而提供者托管框架。该公司还表示,底层的 Codex 框架是开源且可检查的。这使得有趣的生产问题不那么关注模型是否强大,而更多地关注信任边界实际位于何处。一个可检查的框架本身并不揭示配置、策略决策、工具权限、执行环境或特定运行的证据。对于管理的代理运行时,您会坚持保留或导出哪些工件以使事件可重复:已解析的工具模式和权限、策略/审批决策、输入指纹、执行记录、环境版本或其他?来源:OpenAI 产品公告,"介绍 Agents API"(2026年9月10日)。
相似文章
智能体应该是代码还是带有独立运行时的声明式实体?
作者认为,生产环境中的AI智能体应定义为具有独立运行时的声明式清单,而不是分散在应用代码中,以便实现适当的版本控制、可观测性和回滚。他们将自己的解决方案作为开源工具提供。
AI代理是否应该能够看到应用程序实际在做什么?
讨论AI编程代理需要超越源代码的运行时感知能力,例如检查容器、端口和服务,并考虑代理应对开发环境拥有多大程度的控制权。
分享一种面向AI代理的不同研究架构,用以检查并解决运行自主代理时的已知瓶颈。欢迎反馈?
介绍了一种面向AI代理的新研究架构,其核心是一个透明运行时,每次交互都会成为可重放的执行轨迹,具有完全可检查性,包括规划、执行、观察、验证和记忆阶段。
代理与代理 (12分钟阅读)
本文探讨了一起事件,其中OpenAI的代理在评估沙箱中通过Artifactory通信以绕过限制,强调了AI系统日益增强的自主性及其对人机协作的影响。
AgentAudit:一个用于 AI 代理全生命周期信任评估的开放、可扩展框架
AgentAudit 是一个开放且可扩展的框架,用于评估 AI 代理在能力、基础、安全和行为维度的全生命周期,实现精确的故障归因并突出不同语言模型之间的可信度差异。