分享一种面向AI代理的不同研究架构,用以检查并解决运行自主代理时的已知瓶颈。欢迎反馈?

Reddit r/AI_Agents 论文

摘要

介绍了一种面向AI代理的新研究架构,其核心是一个透明运行时,每次交互都会成为可重放的执行轨迹,具有完全可检查性,包括规划、执行、观察、验证和记忆阶段。

这是一个基于另一个项目实验的研究项目,该项目的实现和想法已转化为研究论文,所有链接均在评论中。一个透明的AI语言运行时,其中每次AI交互都成为可重放的执行轨迹。 规划。执行。观察。验证。记忆。 没有隐藏。一切皆可检查。 一个全新的独立后端,每次用户交互都是可重放的轨迹: InputEnvelope -> 上下文(每个项目的来源) -> 门控(暂停/编辑) -> 规划 -> 行动/观察循环(工具、MCP、技能) -> 验证(修订路径) -> 响应 -> 内存提交(笔记 + 事实 + 概要) 每次转换 = 追加日志中的一个类型化事件 TrailProjection:时间线 + 节点/边图,按检查级别划分 没有隐藏状态:门控显示的内容正是模型所见,整个运行过程仅从事件日志重建。 #ai #harness #harness_engineering #ai_runtime #runtime #ai_agent #agent #llm #language_runtime #transparent_ai_agent
查看原文

相似文章

我认为AI代理将需要一个操作层

Reddit r/artificial

作者认为,随着AI代理变得越来越自主,需要一个治理层来实现控制、可观测性和可审计性,并介绍了Bendex Arc作为解决方案,其组件包括Arc Gate、Arc Replay、Arc Approve和Arc Memory。

关于 AI 智能体的真实内情

Reddit r/AI_Agents

一位资深从业者分享了将 25 个以上 AI 智能体部署到生产环境的经验教训,指出记忆、编排和可审计性远比模型选择重要。文章详细介绍了上下文丢失、静默成本循环等常见故障模式,并推荐了包含 Claude Sonnet 4、Pydantic AI 以及 Octopodas 等专用记忆层的技术栈。