分享一种面向AI代理的不同研究架构,用以检查并解决运行自主代理时的已知瓶颈。欢迎反馈?
摘要
介绍了一种面向AI代理的新研究架构,其核心是一个透明运行时,每次交互都会成为可重放的执行轨迹,具有完全可检查性,包括规划、执行、观察、验证和记忆阶段。
这是一个基于另一个项目实验的研究项目,该项目的实现和想法已转化为研究论文,所有链接均在评论中。一个透明的AI语言运行时,其中每次AI交互都成为可重放的执行轨迹。
规划。执行。观察。验证。记忆。
没有隐藏。一切皆可检查。
一个全新的独立后端,每次用户交互都是可重放的轨迹:
InputEnvelope -> 上下文(每个项目的来源) -> 门控(暂停/编辑) -> 规划 -> 行动/观察循环(工具、MCP、技能) -> 验证(修订路径) -> 响应 -> 内存提交(笔记 + 事实 + 概要)
每次转换 = 追加日志中的一个类型化事件
TrailProjection:时间线 + 节点/边图,按检查级别划分
没有隐藏状态:门控显示的内容正是模型所见,整个运行过程仅从事件日志重建。
#ai #harness #harness_engineering #ai_runtime #runtime #ai_agent #agent #llm #language_runtime #transparent_ai_agent
相似文章
大家是如何处理 AI 智能体的长期记忆 + 回放/调试问题的?
一位开发者探讨了当前 AI 智能体记忆系统的局限性,并提出了一款具有片段存储和回放调试功能的新记忆层工具,希望获得社区的验证。
如何让代理运行数小时,以及哪些架构真正对代理友好?#深度探讨 #氛围程序员问题
作者探讨了AI编码代理的两个关键挑战:确保长时间自主执行(数小时)以及为本地应用设计对代理友好的架构。他们提出在规划和执行之前,增加一个显式的知识组织阶段来管理混乱的上下文。
一个真正的多智能体系统的运行时架构是什么样的?
对生产中多智能体AI系统运行时架构的实践性探讨,涉及编排、记忆、状态性以及Temporal、LangGraph和自定义方法等工具选择。
我认为AI代理将需要一个操作层
作者认为,随着AI代理变得越来越自主,需要一个治理层来实现控制、可观测性和可审计性,并介绍了Bendex Arc作为解决方案,其组件包括Arc Gate、Arc Replay、Arc Approve和Arc Memory。
关于 AI 智能体的真实内情
一位资深从业者分享了将 25 个以上 AI 智能体部署到生产环境的经验教训,指出记忆、编排和可审计性远比模型选择重要。文章详细介绍了上下文丢失、静默成本循环等常见故障模式,并推荐了包含 Claude Sonnet 4、Pydantic AI 以及 Octopodas 等专用记忆层的技术栈。