我为 AI 代理构建了一个持续层。在受控测试中,它减少了 49.4% 的模型令牌使用量,加速了 60.8% 的恢复速度,并将每次成功结果的高级模型成本降低了 63.6%。
摘要
Infra 是一个面向 AI 代理的供应商中立持续层,能够在中断时保留权威状态,在内部受控测试中将模型令牌使用量减少了 49.4%,并加速了 60.8% 的恢复速度。
我正在解决的问题出现在代理在现实世界中成功执行某项操作,但在记录结果之前被中断时。例如:代理 A 运行数据库迁移。迁移成功。代理 A 在记录成功之前终止。代理 B 接手。代理 B 现在面临几个危险的选择:重复迁移并冒着重复外部副作用的风险;在没有证据的情况下假设已完成;或花费更多令牌试图重构发生的事情。对话摘要可以描述前一个代理的意图,但它并不总能证明哪些外部操作实际完成。我正在构建 Infra 作为一个供应商中立的持续性和控制层,将权威状态保存在代理的上下文窗口和运行时之外。它保留:授权的委托、约束和范围;检查点和决策;工件血统;审批;已完成外部副作用的证据;下一个允许的操作;为后续代理或运行时准备的续接包。后续代理不需要重新启动任务或盲目信任摘要。它接收可验证的状态,并从下一个有效步骤继续。在一个使用一类故意中断的高风险工作的内部基准测试中:Infra 完成了 5/5 次运行;一个强大的书面交接基线完成了 4/5;测量到的模型令牌使用量降低了 49.4%;端到端恢复速度加快了 60.8%;影子高级模型每次成功结果的成本降低了 63.6%;在 Infra 的 5/5 次运行中保留了完整的审计证据,而基线运行中为 0/5。这不是一个普遍的性能声明或客户验证。它来自一个受控内部任务类的证据。在一个更简单、重复成本低且安全的任务上,Infra 比强交接基线多用了 13.8% 的令牌。因此,我认为并非每个代理都需要这个层。对于短期、可逆且廉价的工作,普通的交接仍然更有意义。Infra 旨在用于以下代理工作负载:运行时间足够长以超过单个上下文窗口;在工作者、模型或运行时之间移动;将工作委托给子代理;产生外部副作用;中断后恢复变得昂贵或不安全。我现在正在选择最多三个创始设计合作伙伴进行一次私密的、经过测量的端到端试点。试点涵盖每个合作伙伴一个实际工作负载和 3-5 个中断场景。生产观察仅限于影子模式,而主动中断和恢复测试仅在沙箱或预发布环境中进行。试点没有软件费用,不需要强制正面评价,合作伙伴身份或结果不会在未经许可的情况下发布。完成试点的合作伙伴将根据测量的工作负载和贡献获得 Infra 使用积分。如果您运营具有此类故障模式的代理,请发送:代理执行什么操作;中断在哪里造成不确定性;哪些操作重复起来昂贵或不安全;当前恢复如何工作;是否有清理过的日志以及沙箱、预发布或影子集成可用。
相似文章
长期运行的AI代理可能面临比记忆更大的连续性问题
反思了长期运行的AI代理所面临的连续性问题,认为需要确定性控制层来管理权威状态,并质疑现有的IAM、事务和溯源等基础设施是否足够。
@_avichawla: https://x.com/_avichawla/status/2063548691353629040
阐述了传统后端如何增加AI代理的token使用量,并展示了一种上下文工程方法,该方法无需更改模型或提示词即可将Claude Code会话成本降低2.5倍。
我受够了AI代理在生产环境中静默失败,于是为它们构建了一个运行时控制层
作者构建了一个运行时控制层,以解决AI代理在生产环境中静默失败的问题。
我构建了一个开源记忆层,用于阻止 AI 代理中的跨租户数据泄露
Verity 是一个新的开源、权限感知的多租户 AI 代理记忆层,它通过在检索查询中直接强制执行访问控制(而不是依赖模型行为)来防止跨租户数据泄露。
AI成本的很大一部分只是模型一遍又一遍地重读相同的文本。有趣的修复尝试,带有公开证明
Corbenic AI声称为大语言模型提供无损KV缓存重用,允许存储的模型内存在不同机器和GPU代际之间逐比特恢复,并通过公开校验和进行验证。该项目包括一个开源的小模型,训练成本约600欧元,使整个流程可审查。